Réponse rapide
On calibre l’incertitude d’un modèle en comparant ses niveaux de confiance à la fréquence réelle des erreurs sur des données indépendantes. Le calibrage est vérifié par domaine et par type de décision.
Comparer confiance et réalité
Parmi les prédictions annoncées à 80 % de confiance, environ huit sur dix doivent être correctes dans le domaine évalué. Courbes de fiabilité, erreurs et abstentions rendent cet écart visible.
Ajuster sans fuite
Un jeu de calibration séparé peut ajuster les scores ou les seuils après l’entraînement. Il ne doit pas réutiliser les données du test ni masquer les classes rares.
Relier au risque
La confiance calibrée pilote marge, demande d’aide et arrêt. Un score élevé hors domaine ne vaut pas une preuve : détection de nouveauté et limites de validité restent nécessaires.
Sources et références
- [1] Robotics and Autonomous Systems — NIST