Comment fonctionne le Q-learning pour une décision robotique ?

Réponse rapide

Le Q-learning met à jour une valeur état-action selon récompense et meilleure continuation estimée. Exploration améliore connaissance, mais robot réel exige contraintes, simulation et transfert contrôlé.

Calculer la valeur

État, action, récompense, état suivant et facteur d’actualisation forment la mise à jour. Table ou réseau conserve une estimation avec ses limites.

Choisir une action inconnue

Exploration et exploitation sont équilibrées selon coût d’erreur. Action interdite ou dangereuse est filtrée avant le choix.

Passer au réel par étapes

Simulation, banc, enveloppe réduite et supervision précèdent une mission. Différences de capteur, délai, dynamique et contact sont mesurées.

Sources et références

  1. [1] Reinforcement learning — PyTorch tutorials — PyTorch
  2. [2] Definitions — autonomy and teleoperation — NASA

Cette réponse vous a-t-elle été utile ?