Réponse rapide
Sécuriser l’exploration d’un robot par Q-learning impose actions admissibles, enveloppe de sécurité, simulation préalable, supervision, limites indépendantes et repli immédiat.
Une politique d’exploration doit rester bornée
Récompense élevée ne justifie pas vitesse, force ou zone dangereuse. Arbitre de sécurité, enveloppe et arrêt doivent préempter l’agent.
Filtrer les actions
Un contrôleur ou arbitre refuse vitesse, force, zone, charge, posture et transition qui dépassent les contraintes.
Explorer par paliers
Commencez en simulation ou sur banc, augmentez progressivement exposition et conservez une politique de référence validée.
Surveiller chaque essai
Mesurez état, événement, récompense, contrainte, intervention et arrêt et interrompez dès qu’un comportement sort du domaine.
Sources et références
- [1] Robotics and Autonomous Systems — NIST