Réponse rapide
Hors ligne, le renforcement apprend sur des données enregistrées sans agir ; en ligne, il explore le monde réel ou simulé et doit gérer risque, coût et dérive immédiats.
Avertissement de sécurité
L’exploration en ligne peut produire une action dangereuse. Utilisez une politique sûre, des actions réversibles et une validation avant tout essai réel.
Comparer
Le hors-ligne est contrôlable mais limité aux états observés ; l’en ligne découvre mais peut produire actions dangereuses et données biaisées.
Encadrer
Utilisez jeux séparés, politique de comportement, contraintes et validation avant transfert et limitez exploration réelle à des actions réversibles.
Vérifier
Mesurez généralisation, sécurité, couverture, latence et reprise et gardez une politique validée comme référence.
Sources et références
- [1] Robotics and Autonomous Systems — NIST