Réponse rapide
Mesurer l’accord entre annotateurs révèle si une règle est comprise de la même manière, si les données sont ambiguës ou si certaines classes sont mal définies. Un accord élevé ne garantit pas la vérité lorsqu’une erreur est partagée ; il doit être comparé à une référence experte, à la difficulté et à la tâche du modèle.
Choisir une mesure adaptée
Accord exact, IoU, distance de frontière, corrélation ou coefficient tenant compte du hasard sont choisis selon étiquette et géométrie. Fréquence des classes, exemples communs et désaccords par contexte sont publiés. Les valeurs manquantes ne sont pas assimilées à un accord.
Relire les désaccords instructifs
Les annotateurs expliquent leur choix sur un échantillon et mettent à jour la règle si nécessaire. Cas difficiles, occlusions et capteurs dégradés nourrissent le jeu de référence. L’analyse distingue erreur d’outil, de consigne et d’interprétation.
Ne pas optimiser un score sans examiner les exemples
Une classe rare ou facile peut dominer une moyenne. Les frontières et situations qui changent la décision robotique sont inspectées. Une mesure seule ne justifie pas de déclarer le jeu prêt.
Sources et références
- [1] Model Evaluation — scikit-learn User Guide — scikit-learn
- [2] Artificial Intelligence Risk Management Framework (AI RMF 1.0) — NIST