Comment évaluer une politique apprise par Q-learning ?

Réponse rapide

Évaluer une politique apprise par Q-learning demande scénarios séparés, comparaison à une référence, mesures de réussite, coût, robustesse, contraintes, généralisation et pire cas.

Le score moyen cache les échecs

Mesurez pires cas, violations, interventions et généralisation sur conditions non vues et comparez à une référence connue.

Séparer apprentissage et test

Conservez épisodes et conditions non vus et évitez d’ajuster la politique sur les mêmes résultats qui servent à la juger.

Mesurer l’usage réel

Rapportez récompense mais aussi collisions, violations, énergie, latence, interventions, variance et retour en sécurité.

Tester les variations

Perturbez capteurs, charge, dynamique, environnement et objectifs et comparez à la politique de référence.

Sources et références

  1. [1] Robotics and Autonomous Systems — NIST

Cette réponse vous a-t-elle été utile ?