Aller au contenu
Robopedia Rechercher une réponse
Méthodes acteur critique Avancé Comparaison

Quelle différence entre acteur-critique et Q-learning pour un robot ?

Mise à jour29 août 2026 Lecture1 minute

Réponse rapide

Le Q-learning apprend directement une valeur d’action et choisit souvent par maximisation, tandis que l’acteur-critique apprend explicitement une politique et un évaluateur. Les deux peuvent utiliser des approximations et de l’exploration.

Situer Q-learning

Une table ou un réseau estime Q pour des couples état-action. La politique est dérivée de cette valeur, ce qui devient difficile lorsque les actions sont continues.

Situer l’acteur-critique

L’acteur produit directement une action ou une distribution, et le critique estime son avantage ou sa valeur. Cette séparation facilite certaines commandes continues mais ajoute une source d’instabilité.

Comparer le contexte

Dimension d’état, action, données, coût des erreurs et contraintes déterminent la méthode. Les deux approches nécessitent bornage, simulation et évaluation indépendante.

Sources et références

  1. [1] Robotics and Autonomous Systems — NIST

Cette réponse vous a-t-elle été utile ?

Continuer à explorer

Une autre question sur la robotique ou l’IA ?