Quelle différence entre acteur-critique et Q-learning pour un robot ?
Réponse rapide
Le Q-learning apprend directement une valeur d’action et choisit souvent par maximisation, tandis que l’acteur-critique apprend explicitement une politique et un évaluateur. Les deux peuvent utiliser des approximations et de l’exploration.
Situer Q-learning
Une table ou un réseau estime Q pour des couples état-action. La politique est dérivée de cette valeur, ce qui devient difficile lorsque les actions sont continues.
Situer l’acteur-critique
L’acteur produit directement une action ou une distribution, et le critique estime son avantage ou sa valeur. Cette séparation facilite certaines commandes continues mais ajoute une source d’instabilité.
Comparer le contexte
Dimension d’état, action, données, coût des erreurs et contraintes déterminent la méthode. Les deux approches nécessitent bornage, simulation et évaluation indépendante.
Sources et références
- [1] Robotics and Autonomous Systems — NIST