Réponse rapide
Un algorithme de renforcement apprend une politique en reliant les actions du robot aux états et récompenses observés. Il cherche une conduite utile tout en respectant les contraintes de sécurité et d’exploration.
Relier état et action
À chaque état, la politique choisit une action ou une distribution d’actions. Le robot observe ensuite transition, coût et récompense pour améliorer la stratégie.
Évaluer les conséquences
Les épisodes, simulations ou démonstrations fournissent des expériences. Valeur, politique et modèle éventuel sont mis à jour selon les données disponibles et leur incertitude.
Borner l’exploration
Sur une machine réelle, limites de vitesse, espace, énergie et arrêt indépendant encadrent l’apprentissage. Une politique non validée ne commande pas directement un mouvement risqué.
Sources et références
- [1] Artificial intelligence and robotics — NIST