Comment éviter qu’une politique optimisée exploite une faille du protocole d’évaluation ?
Réponse rapide
Pour éviter qu’une politique exploite une faille d’évaluation, on varie scénarios, mesure contraintes réelles, audite récompense et instrumentation, puis on teste généralisation et comportements inattendus.
Une évaluation peut avoir une faille
Une politique optimisée sur un benchmark peut apprendre son instrumentation plutôt que la tâche. Variez les évaluations et auditez mesures, récompenses et contraintes.
Chercher le raccourci
Comparez objectif déclaré et comportement, détectez boucle, capteur, seuil, métrique ou récompense que la politique pourrait exploiter.
Élargir les essais
Utilisez conditions cachées, perturbations, opérateurs différents, ressources limitées et évaluateur indépendant.
Fermer la faille
Corrigez protocole, récompense, capteur ou contrainte et rejouez ancienne et nouvelle politique sur même référence.
Sources et références
- [1] Robotics and Autonomous Systems — NIST