Aller au contenu
Robopedia Rechercher une réponse
Optimisation de politique Avancé Sécurité

Comment éviter qu’une politique optimisée exploite une faille du protocole d’évaluation ?

Mise à jour29 août 2026 Lecture1 minute

Réponse rapide

Pour éviter qu’une politique exploite une faille d’évaluation, on varie scénarios, mesure contraintes réelles, audite récompense et instrumentation, puis on teste généralisation et comportements inattendus.

Une évaluation peut avoir une faille

Une politique optimisée sur un benchmark peut apprendre son instrumentation plutôt que la tâche. Variez les évaluations et auditez mesures, récompenses et contraintes.

Chercher le raccourci

Comparez objectif déclaré et comportement, détectez boucle, capteur, seuil, métrique ou récompense que la politique pourrait exploiter.

Élargir les essais

Utilisez conditions cachées, perturbations, opérateurs différents, ressources limitées et évaluateur indépendant.

Fermer la faille

Corrigez protocole, récompense, capteur ou contrainte et rejouez ancienne et nouvelle politique sur même référence.

Sources et références

  1. [1] Robotics and Autonomous Systems — NIST

Cette réponse vous a-t-elle été utile ?

Continuer à explorer

Une autre question sur la robotique ou l’IA ?