Réponse rapide
Une politique MDP devient utilisable sur un robot réel après validation hors ligne et en simulation, bornage des actions, contrôleur de sécurité, surveillance des états et progression par essais à énergie limitée.
Vérifier données et modèle
Transitions, récompenses, couverture et unités sont contrôlées. Les états non vus et erreurs de modèle sont recherchés plutôt que masqués par une moyenne.
Séparer optimisation et sécurité
Un filtre d’action, limiteur ou contrôleur classique empêche collision, dépassement d’effort et vitesse excessive. L’arrêt reste possible si la politique ou le capteur devient incohérent.
Augmenter progressivement
Simulation, banc, vitesse réduite puis mission limitée permettent de comparer mesures et hypothèses. Chaque étape possède des critères d’arrêt et de retour arrière.
Sources et références
- [1] Robotics and Autonomous Systems — NIST