Qu’est-ce que le Q-learning pour un robot ?

Réponse rapide

Le Q-learning apprend une valeur pour chaque paire état-action et améliore progressivement une politique en comparant récompense reçue et meilleure valeur future estimée.

Une valeur apprise n’est pas une garantie

Q-learning dépend des états, récompenses et expériences rencontrés. Contraintes, politique de secours et validation restent nécessaires avant action physique.

Décrire l’expérience

État, action, récompense, transition, facteur d’actualisation et condition terminale définissent ce que l’agent apprend.

Construire la valeur

La table ou le modèle Q représente intérêt attendu d’une action selon l’état et les données déjà observées.

Choisir avec prudence

Exploration, exploitation, contraintes, simulation et repli encadrent la politique qui utilise les valeurs apprises.

Sources et références

  1. [1] Robotics and Autonomous Systems — NIST

Cette réponse vous a-t-elle été utile ?