Comment un humain peut-il corriger un apprentissage par démonstration ?

Réponse rapide

Un humain peut corriger un apprentissage par démonstration en annotant résultat et erreur, interrompant une action, fournissant une contre-démonstration ou ajustant limites et objectif. Le système distingue correction de style, changement de tâche et arrêt de sécurité. Chaque modification est confirmée, versionnée et évaluée avant d’être réutilisée.

Intervenir au bon moment

L’opérateur peut reprendre la commande, marquer une étape incorrecte et expliquer la condition qui manquait. Le robot conserve état avant correction et ne transforme pas une urgence en donnée d’apprentissage sans accord. Les corrections sont rejouées sur les cas concernés.

Séparer mémoire, politique et sécurité

Exemple corrigé, règle de validation et limite de contrôleur possèdent des versions distinctes. Une correction n’abaisse pas automatiquement les seuils physiques. Permissions, identité et accès aux données d’apprentissage sont contrôlés.

Ne pas apprendre directement d’une reprise improvisée

Une intervention peut viser seulement à sortir d’un danger, pas à montrer la bonne tâche. Contexte, intention et résultat sont clarifiés avant intégration. Les corrections contradictoires restent en revue plutôt que fusionnées sans décision.

Sources et références

  1. [1] Robotics and Autonomous Systems — NIST

Cette réponse vous a-t-elle été utile ?