Comment surveiller une politique d’apprentissage par renforcement pendant son exécution ?

Réponse rapide

Surveiller une politique d’apprentissage par renforcement pendant son exécution consiste à relier observation, action proposée, action appliquée, contraintes, confiance et résultat de mission à la version du robot et de la politique. Les écarts au domaine validé déclenchent une alerte, un contrôleur de secours, un ralentissement ou un arrêt selon le risque.

Observer décision et contexte

Chaque cycle conserve capteurs utiles, action retenue, limites rencontrées, santé des ressources et configuration de mission. Une récompense élevée ne prouve pas que vitesse, force, énergie ou marge sont acceptables.

Définir alertes et replis

Seuils portent sur trajectoire, effort, température, énergie, confiance perceptive, fréquence de refus et observation hors domaine. Les transitions vers commande classique ou arrêt sont testées avec bruit et latence.

Analyser les dérives lentes

Une politique peut rester stable tout en perdant précision ou marge. Tendances, épisodes inhabituels et comparaison à une référence sont revus avant toute extension du domaine.

Sources et références

  1. [1] Robotics and Autonomous Systems — NIST

Cette réponse vous a-t-elle été utile ?