Comment fonctionne la mise à jour Q-learning ?

Réponse rapide

La mise à jour Q-learning rapproche la valeur d’une action de la récompense immédiate plus la meilleure valeur future, pondérée par le taux d’apprentissage et l’actualisation.

Une mise à jour peut propager une erreur

Récompense bruitée, état ancien ou action interdite faussent les valeurs. Vérifiez bornes, terminal et données avant de réutiliser la politique.

Écrire la transition

À partir de état, action, récompense et nouvel état, sélectionnez la meilleure action future autorisée et traitez terminal séparément.

Régler l’apprentissage

Taux d’apprentissage, facteur d’actualisation, exploration et normalisation modifient vitesse, stabilité et portée de l’expérience.

Contrôler l’algorithme

Vérifiez valeurs finies, bornes, répétitions, données obsolètes, actions interdites et convergence sur cas simples.

Sources et références

  1. [1] Robotics and Autonomous Systems — NIST

Cette réponse vous a-t-elle été utile ?