Quelle différence entre apprentissage par renforcement hors ligne et en ligne pour un robot ?

Réponse rapide

Hors ligne, le renforcement apprend sur des données enregistrées sans agir ; en ligne, il explore le monde réel ou simulé et doit gérer risque, coût et dérive immédiats.

Avertissement de sécurité

L’exploration en ligne peut produire une action dangereuse. Utilisez une politique sûre, des actions réversibles et une validation avant tout essai réel.

Comparer

Le hors-ligne est contrôlable mais limité aux états observés ; l’en ligne découvre mais peut produire actions dangereuses et données biaisées.

Encadrer

Utilisez jeux séparés, politique de comportement, contraintes et validation avant transfert et limitez exploration réelle à des actions réversibles.

Vérifier

Mesurez généralisation, sécurité, couverture, latence et reprise et gardez une politique validée comme référence.

Sources et références

  1. [1] Robotics and Autonomous Systems — NIST

Cette réponse vous a-t-elle été utile ?