Pourquoi utiliser un critique séparé pour apprendre une politique robotique ?
Réponse rapide
Un critique séparé permet d’estimer la valeur des actions avec un signal plus informatif que le seul succès final, ce qui peut accélérer l’apprentissage et réduire la variance ; il reste toutefois sujet à biais et erreur d’estimation.
Fournir un retour intermédiaire
Valeur, avantage ou différence temporelle indique si une transition rapproche de l’objectif. L’acteur reçoit ainsi un signal avant la fin d’une longue mission.
Séparer les mises à jour
Réseaux cibles, lots d’expérience et fréquence de mise à jour limitent les oscillations entre acteur et critique. Les données de validation ne servent pas à masquer une divergence.
Surveiller le biais
Un critique trop confiant peut pousser l’acteur vers des états dangereux ou mal explorés. Comparaison à des retours réels et garde-fous externes restent nécessaires.
Sources et références
- [1] Robotics and Autonomous Systems — NIST