Réponse rapide
Le Q-learning apprend une valeur pour chaque paire état-action et améliore progressivement une politique en comparant récompense reçue et meilleure valeur future estimée.
Une valeur apprise n’est pas une garantie
Q-learning dépend des états, récompenses et expériences rencontrés. Contraintes, politique de secours et validation restent nécessaires avant action physique.
Décrire l’expérience
État, action, récompense, transition, facteur d’actualisation et condition terminale définissent ce que l’agent apprend.
Construire la valeur
La table ou le modèle Q représente intérêt attendu d’une action selon l’état et les données déjà observées.
Choisir avec prudence
Exploration, exploitation, contraintes, simulation et repli encadrent la politique qui utilise les valeurs apprises.
Sources et références
- [1] Robotics and Autonomous Systems — NIST