Réponse rapide
Une récompense fidèle à une tâche robotique relie succès mesurable, contraintes, qualité et coût d’échec au comportement souhaité, puis est testée contre des stratégies indésirables.
Une récompense incomplète crée un raccourci
Un gain local peut sacrifier qualité, énergie ou sécurité. Testez stratégies alternatives et cas limites avant apprentissage.
Écrire le résultat attendu
Décrivez état final, tolérances, personnes, ressources, réversibilité et conditions qui comptent réellement pour l’usage.
Pondérer avec prudence
Valeurs, unités, horizon et fréquence évitent qu’un petit gain local domine sécurité, qualité ou mission complète.
Chercher les contournements
Comparez comportements, cas limites, scénarios cachés, simulation et référence et corrigez la mesure avant l’apprentissage.
Sources et références
- [1] Robotics and Autonomous Systems — NIST