Comment rendre une politique MDP sûre sur un robot réel ?

Réponse rapide

Une politique MDP devient utilisable sur un robot réel après validation hors ligne et en simulation, bornage des actions, contrôleur de sécurité, surveillance des états et progression par essais à énergie limitée.

Vérifier données et modèle

Transitions, récompenses, couverture et unités sont contrôlées. Les états non vus et erreurs de modèle sont recherchés plutôt que masqués par une moyenne.

Séparer optimisation et sécurité

Un filtre d’action, limiteur ou contrôleur classique empêche collision, dépassement d’effort et vitesse excessive. L’arrêt reste possible si la politique ou le capteur devient incohérent.

Augmenter progressivement

Simulation, banc, vitesse réduite puis mission limitée permettent de comparer mesures et hypothèses. Chaque étape possède des critères d’arrêt et de retour arrière.

Sources et références

  1. [1] Robotics and Autonomous Systems — NIST

Cette réponse vous a-t-elle été utile ?