Réponse rapide
Deux versions se comparent sur les mêmes données et conditions, avec des métriques adaptées à la tâche, à la latence, aux ressources et aux erreurs critiques. Le meilleur score moyen ne suffit pas si une régression apparaît dans un cas important.
Geler la comparaison
Jeu de test, prétraitement, matériel et seuils restent identiques. Les résultats sont répétés lorsque l’inférence comporte une part aléatoire.
Regarder au-delà de la moyenne
Précision, rappel, calibration, temps de réponse, mémoire et énergie sont ventilés par scène ou classe. Les faux positifs et faux négatifs sont examinés selon leur conséquence opérationnelle.
Documenter le compromis
La version retenue indique gains, régressions et conditions de validité. Une amélioration de benchmark n’autorise pas un déploiement si le repli ou la latence deviennent moins maîtrisables.
Sources et références
- [1] Robotics and Autonomous Systems — NIST