Réponse rapide
Le Q-learning met à jour une valeur état-action selon récompense et meilleure continuation estimée. Exploration améliore connaissance, mais robot réel exige contraintes, simulation et transfert contrôlé.
Calculer la valeur
État, action, récompense, état suivant et facteur d’actualisation forment la mise à jour. Table ou réseau conserve une estimation avec ses limites.
Choisir une action inconnue
Exploration et exploitation sont équilibrées selon coût d’erreur. Action interdite ou dangereuse est filtrée avant le choix.
Passer au réel par étapes
Simulation, banc, enveloppe réduite et supervision précèdent une mission. Différences de capteur, délai, dynamique et contact sont mesurées.
Sources et références
- [1] Reinforcement learning — PyTorch tutorials — PyTorch
- [2] Definitions — autonomy and teleoperation — NASA