Réponse rapide
La sécurité s’intègre à une récompense par contraintes, pénalités fortes ou actions interdites, mais elle doit aussi être garantie par un contrôleur ou arbitre indépendant de l’apprentissage.
La récompense ne remplace pas l’arbitre
Modèle, données ou agent peuvent contourner une pénalité. Limites, contrôleur et arrêt doivent rester indépendants de l’apprentissage.
Séparer objectif et enveloppe
Définissez limites de vitesse, force, zone, énergie, contact et personnes que l’agent ne peut pas échanger contre un score.
Pénaliser sans ambiguïté
Mesurez violation, proximité, intervention, dommage et arrêt et vérifiez que la pénalité domine un gain local tentant.
Tester l’indépendance
Injectez récompense fausse, modèle biaisé et politique nouvelle et confirmez que l’arbitre conserve arrêt et limitation.
Sources et références
- [1] Robotics and Autonomous Systems — NIST