Réponse rapide
Après déploiement, une politique de renforcement se surveille par ses actions, états, récompenses, limites franchies, interventions et performances par scénario. Toute dérive doit pouvoir déclencher une limitation ou un retour en arrière.
Journaliser la décision
Version de politique, observation, action, confiance, récompense et mode de sécurité sont associés à chaque épisode. Les journaux restent synchronisés avec le contexte matériel.
Comparer aux références
Taux de réussite, énergie, collisions évitées, interventions, temps et violations de contraintes sont suivis par environnement. Une moyenne globale ne doit pas masquer un scénario dégradé.
Déclencher le repli
Seuils d’anomalie, watchdog et validation indépendante peuvent limiter la politique ou repasser à une commande connue. L’événement et la version concernée sont conservés pour analyse.
Sources et références
- [1] Artificial intelligence and robotics — NIST