Réponse rapide
Le Q-learning est difficile sur un robot réel à cause du grand espace d’états, du coût des essais, des dynamiques continues, du bruit, des délais et des risques physiques.
L’exploration coûte dans le monde réel
Essais aléatoires peuvent collisionner, user ou blesser. Simulez, filtrez les actions et gardez supervision et repli indépendants.
Limiter l’exploration
Une action aléatoire peut collisionner, user la machine ou blesser. Simulation, contraintes et politique de secours réduisent l’exposition.
Gérer les mesures
État partiel, récompense retardée, capteurs bruyants et transitions non répétables compliquent l’attribution d’un effet à une action.
Adapter la représentation
Discrétisation, approximation, mémoire d’expérience et apprentissage hors ligne doivent conserver stabilité, diversité et vérification.
Sources et références
- [1] Robotics and Autonomous Systems — NIST