Réponse rapide
Un problème de renforcement décrit états, actions, transitions et récompense. L’agent cherche une politique maximisant un retour cumulé ; en robotique, récompense, exploration sûre et écart simulation-réel sont déterminants.
Définir l’environnement
État observable, action admissible, transition, horizon et terminaison décrivent la tâche. Incertitude, délai et coût d’une action sont inclus.
Relier score et résultat
Réussite, temps, énergie, stabilité et sécurité sont représentés sans créer de raccourci qui maximise score mais échoue la mission.
Explorer avec limites
Simulation, contraintes, supervision et essais progressifs réduisent risque. Politique, données et domaine sont versionnés avant transfert.
Sources et références
- [1] Reinforcement learning — PyTorch tutorials — PyTorch
- [2] Robotics and Autonomous Systems Technology Roadmaps — NASA