Réponse rapide
Une politique apprise par démonstration reste sûre si les actions sont filtrées par limites et contrôleurs, si les états hors domaine déclenchent un repli et si les essais progressent de la simulation vers le robot réel.
Borner la politique
Vitesse, effort, zone, collision, énergie et trajectoire sont imposés par des barrières indépendantes. La politique ne peut pas écrire directement une commande non bornée.
Reconnaître l’inconnu
Confiance, distance aux démonstrations, capteurs incohérents et objectif ambigu déclenchent observation, ralentissement ou reprise humaine.
Tester par niveaux
Replay, simulation, matériel dans la boucle, banc à faible énergie puis tâche contrôlée fournissent des preuves croissantes. Chaque niveau conserve un arrêt accessible.
L’imitation ne remplace pas l’analyse de risque
Un modèle peut reproduire une action dangereuse avec une grande fidélité. Les limites physiques, l’arrêt et la supervision priment sur le score d’imitation.
Sources et références
- [1] Robotics and Autonomous Systems — NIST