Réponse rapide
Évaluer une politique apprise par Q-learning demande scénarios séparés, comparaison à une référence, mesures de réussite, coût, robustesse, contraintes, généralisation et pire cas.
Le score moyen cache les échecs
Mesurez pires cas, violations, interventions et généralisation sur conditions non vues et comparez à une référence connue.
Séparer apprentissage et test
Conservez épisodes et conditions non vus et évitez d’ajuster la politique sur les mêmes résultats qui servent à la juger.
Mesurer l’usage réel
Rapportez récompense mais aussi collisions, violations, énergie, latence, interventions, variance et retour en sécurité.
Tester les variations
Perturbez capteurs, charge, dynamique, environnement et objectifs et comparez à la politique de référence.
Sources et références
- [1] Robotics and Autonomous Systems — NIST