Comment préserver la sécurité lorsqu’une politique est apprise par démonstration ?

Réponse rapide

Une politique apprise par démonstration reste sûre si les actions sont filtrées par limites et contrôleurs, si les états hors domaine déclenchent un repli et si les essais progressent de la simulation vers le robot réel.

Borner la politique

Vitesse, effort, zone, collision, énergie et trajectoire sont imposés par des barrières indépendantes. La politique ne peut pas écrire directement une commande non bornée.

Reconnaître l’inconnu

Confiance, distance aux démonstrations, capteurs incohérents et objectif ambigu déclenchent observation, ralentissement ou reprise humaine.

Tester par niveaux

Replay, simulation, matériel dans la boucle, banc à faible énergie puis tâche contrôlée fournissent des preuves croissantes. Chaque niveau conserve un arrêt accessible.

L’imitation ne remplace pas l’analyse de risque

Un modèle peut reproduire une action dangereuse avec une grande fidélité. Les limites physiques, l’arrêt et la supervision priment sur le score d’imitation.

Sources et références

  1. [1] Robotics and Autonomous Systems — NIST

Cette réponse vous a-t-elle été utile ?