Le Q-learning apprend directement une valeur d’action et choisit souvent par maximisation, tandis que l’acteur-critique apprend explicitement une politique et un évaluateur. Les deux peuvent utiliser des approximations et de l’exploration.
Un critique séparé permet d’estimer la valeur des actions avec un signal plus informatif que le seul succès final, ce qui peut accélérer l’apprentissage et réduire la variance ; il reste toutefois sujet à…
L’exploration permet à l’acteur d’essayer des actions nouvelles, mais elle doit rester bornée pour ne pas mettre le robot ou son environnement en danger.
Avant d’utiliser un acteur-critique sur un robot réel, on compare ses décisions à des règles sûres et on vérifie ses réactions dans des scénarios inconnus.
Une méthode acteur-critique sépare un acteur, qui choisit une action, d’un critique, qui estime si cette action mène à un bon résultat.