Réponse rapide
La qualité multi-annotateurs repose sur consigne versionnée, exemples de référence, relecture d’échantillons et mesure des désaccords adaptée au type d’annotation. Les divergences révèlent aussi des règles ambiguës.
Stabiliser la consigne
Version, cas limites, définition et procédure d’escalade sont partagés. Exemples positifs, négatifs et inconnus couvrent les décisions fréquentes.
Mesurer l’accord utile
Accord, IoU, distance, classe, temporalité ou corrélation sont choisis selon l’annotation. Échantillon relecté et désaccords sont conservés par scénario.
Traiter la cause
Règle clarifiée, image difficile ou compétence annotateur sont distinguées. Correction et nouvelle version sont testées sur un jeu indépendant.
Sources et références
- [1] Model Evaluation — scikit-learn User Guide — scikit-learn