Comment sécuriser l’exploration d’un robot qui apprend par Q-learning ?

Réponse rapide

Sécuriser l’exploration d’un robot par Q-learning impose actions admissibles, enveloppe de sécurité, simulation préalable, supervision, limites indépendantes et repli immédiat.

Une politique d’exploration doit rester bornée

Récompense élevée ne justifie pas vitesse, force ou zone dangereuse. Arbitre de sécurité, enveloppe et arrêt doivent préempter l’agent.

Filtrer les actions

Un contrôleur ou arbitre refuse vitesse, force, zone, charge, posture et transition qui dépassent les contraintes.

Explorer par paliers

Commencez en simulation ou sur banc, augmentez progressivement exposition et conservez une politique de référence validée.

Surveiller chaque essai

Mesurez état, événement, récompense, contrainte, intervention et arrêt et interrompez dès qu’un comportement sort du domaine.

Sources et références

  1. [1] Robotics and Autonomous Systems — NIST

Cette réponse vous a-t-elle été utile ?