Réponse rapide
Évaluer une IA multimodale impose des entrées incomplètes, bruitées ou contradictoires et vérifie si le système détecte la situation. Une réponse de secours, une demande d’observation ou un arrêt contrôlé vaut mieux qu’une sortie confiante fondée sur une modalité absente.
Retirer une modalité
Caméra masquée, texte ambigu, localisation indisponible ou mesure saturée sont testés séparément et ensemble. Les résultats indiquent quelles décisions restent fiables et lesquelles doivent être suspendues.
Vérifier l’abstention
Le système doit signaler manque, contradiction et incertitude avec un état exploitable. Une réponse prudente est évaluée comme un comportement réussi lorsqu’aucune action sûre ne peut être déterminée.
Comparer au cas complet
Les performances sont ventilées par modalité et par contexte, puis comparées à la configuration nominale. Les seuils de repli sont choisis à partir du risque de la mission, pas d’une moyenne globale.
Sources et références
- [1] Artificial Intelligence Risk Management Framework (AI RMF 1.0) — NIST
- [2] Transformers Documentation — Hugging Face