Réponse rapide
Un apprentissage qui dérive s’interrompt par gel de politique, arrêt des actions, sauvegarde de l’état, comparaison à une référence et retour contrôlé à une version validée.
Avertissement de sécurité
Un apprentissage qui dérive ne doit pas continuer à commander. Gelez l’exploration, revenez à une version validée et analysez les traces avant reprise.
Détecter
Surveillez récompense, violations, variance, actions extrêmes, consommation, latence et régression par rapport au modèle de référence.
Geler
Coupez exploration ou commande d’apprentissage et basculez vers arrêt, politique sûre ou opérateur sans perdre les traces utiles.
Analyser
Rejouez données, récompense, environnement et version et ne reprenez qu’après correction, test indépendant et autorisation.
Sources et références
- [1] Robotics and Autonomous Systems — NIST