Réponse rapide
Une récompense traduit réussite, temps, énergie, stabilité et sécurité, sans permettre de raccourci qui maximise score mais rate le résultat. Son comportement est vérifié avec scénarios et contraintes externes.
Décrire l’effet voulu
But, conditions de réussite, qualité minimale et échec sont séparés de la commodité du calcul. Les termes et unités de la récompense sont documentés.
Chercher les détournements
Agent immobile, boucle, action excessive, dommage ou collecte de points facile sont testés. Limites de sécurité et règles externes ne sont jamais remplacées par le score.
Relire le comportement
Trajectoires, interventions, énergie, erreurs et scénarios adverses sont observés. Une récompense ajustée est comparée à l’ancienne avec la même évaluation.
Sources et références
- [1] Reinforcement learning — PyTorch tutorials — PyTorch
- [2] Robotics and Autonomous Systems Technology Roadmaps — NASA