Réponse rapide
Une comparaison fiable rejoue les mêmes entrées dans des configurations identifiées, mais ajoute aussi des scénarios qui cherchent les effets de bord. Les écarts sont examinés par situation et par risque : une vitesse améliorée ne compense pas une latence ou une marge de sécurité dégradée. La promotion est conditionnée à une revue et à un retour arrière réellement testable.
Figer une référence complète
La référence comprend code, dépendances, firmware, paramètres, capteurs, outil, carte et version des données. Les traces sont horodatées et rejouées avec des conditions comparables, sans utiliser les données d’apprentissage comme preuve indépendante. Les incertitudes et différences de matériel sont conservées avec les résultats.
Chercher les effets de bord
Aux tests unitaires et nominaux s’ajoutent perte de communication, charge maximale, capteur bruité, reprise et variation de température. On regarde collisions évitées, refus, latence de boucle, énergie et comportements hors domaine, pas seulement l’erreur moyenne. Un écart critique bloque la diffusion même si le score global progresse.
Documenter les changements acceptés
Une nouvelle stratégie peut volontairement modifier vitesse ou trajet, mais le responsable de la tâche doit l’approuver avec une preuve adaptée. Une courte période sans incident ne suffit pas à conclure à la stabilité. Le plan de retour à la version précédente est préparé et exercé avant déploiement large.
Sources et références
- [1] Robotics and Autonomous Systems — NIST