Réponse rapide
L’exploration est risquée sur un robot réel car l’agent peut essayer une action inconnue qui provoque collision, chute, dommage, usure, perte d’énergie ou situation irréversible avant d’avoir appris.
L’exploration peut blesser ou détruire
Une action aléatoire peut provoquer collision, chute ou perte de contrôle. Filtrez les actions, simulez, supervisez et gardez arrêt et politique de secours indépendants.
Limiter l’exposition
Simulation, banc, démonstrations, enveloppe d’action, progression par paliers et politique de secours réduisent le coût des essais.
Surveiller chaque essai
Contrôleur, opérateur et capteurs vérifient vitesse, force, zone, charge, énergie, obstacle, contrainte et résultat en temps réel.
Arrêter et apprendre
Un dépassement déclenche arrêt ou repli et l’expérience est journalisée avant de modifier la politique ou de reprendre.
Sources et références
- [1] Artificial intelligence and robotics — NIST
- [2] Reinforcement learning — PyTorch tutorials — PyTorch
- [3] Robotics and Autonomous Systems Technology Roadmaps — NASA