Réponse rapide
La mise à jour Q-learning rapproche la valeur d’une action de la récompense immédiate plus la meilleure valeur future, pondérée par le taux d’apprentissage et l’actualisation.
Une mise à jour peut propager une erreur
Récompense bruitée, état ancien ou action interdite faussent les valeurs. Vérifiez bornes, terminal et données avant de réutiliser la politique.
Écrire la transition
À partir de état, action, récompense et nouvel état, sélectionnez la meilleure action future autorisée et traitez terminal séparément.
Régler l’apprentissage
Taux d’apprentissage, facteur d’actualisation, exploration et normalisation modifient vitesse, stabilité et portée de l’expérience.
Contrôler l’algorithme
Vérifiez valeurs finies, bornes, répétitions, données obsolètes, actions interdites et convergence sur cas simples.
Sources et références
- [1] Robotics and Autonomous Systems — NIST