Comment définir une récompense pour un robot dans un modèle markovien ?

Réponse rapide

Une récompense MDP relie chaque transition au résultat utile, au coût et au risque de la tâche. Elle doit décourager les raccourcis dangereux et rester cohérente avec les critères mesurés sur le robot.

Récompenser l’effet réel

Réussite, précision, temps, énergie et information gagnée sont définis par la mission. Un proxy facile à maximiser est comparé au résultat utilisateur.

Borner les comportements

Collision, force, zone, température et perte de capteur entraînent pénalité forte, terminaison ou contrainte séparée. Le contrôleur de sécurité ne dépend pas de la récompense.

Chercher les stratégies perverses

Épisodes adverses et cas limites révèlent exploitation des capteurs, oscillation ou attente artificielle. La formulation est révisée puis testée indépendamment.

Sources et références

  1. [1] Robotics and Autonomous Systems — NIST

Cette réponse vous a-t-elle été utile ?