Comment fonctionne l’apprentissage par renforcement pour un robot ?

Réponse rapide

L’apprentissage par renforcement fait explorer des actions, observer leurs conséquences et ajuster une politique selon une récompense, sous contraintes et objectifs explicites.

Décrire

L’état rassemble observations et mémoire, l’action modifie le robot ou le monde et le retour mesure une conséquence dans un horizon défini.

Borner

Limitez vitesse, force, énergie, zone et actions interdites et utilisez simulation, superviseur ou contrôleur indépendant avant essais réels.

Évaluer

Comparez résultat, sécurité, énergie, généralisation et stabilité et gardez la politique en évaluation tant que récompense ou comportement restent ambigus.

Sources et références

  1. [1] Robotics and Autonomous Systems — NIST

Cette réponse vous a-t-elle été utile ?