Comment interrompre proprement un apprentissage par renforcement qui dérive ?

Réponse rapide

Un apprentissage qui dérive s’interrompt par gel de politique, arrêt des actions, sauvegarde de l’état, comparaison à une référence et retour contrôlé à une version validée.

Avertissement de sécurité

Un apprentissage qui dérive ne doit pas continuer à commander. Gelez l’exploration, revenez à une version validée et analysez les traces avant reprise.

Détecter

Surveillez récompense, violations, variance, actions extrêmes, consommation, latence et régression par rapport au modèle de référence.

Geler

Coupez exploration ou commande d’apprentissage et basculez vers arrêt, politique sûre ou opérateur sans perdre les traces utiles.

Analyser

Rejouez données, récompense, environnement et version et ne reprenez qu’après correction, test indépendant et autorisation.

Sources et références

  1. [1] Robotics and Autonomous Systems — NIST

Cette réponse vous a-t-elle été utile ?