Réponse rapide
Réduire les biais d’un modèle vision-langage demande d’examiner images, langues, accents, environnements et objets représentés, puis de mesurer les erreurs par contexte. Collecte ciblée, annotation précise et abstention dans les cas non couverts peuvent réduire un biais sans prétendre le supprimer.
Cartographier la couverture
Les exemples sont ventilés par condition d’éclairage, distance, langue, accent, apparence et lieu. On recherche aussi les corrélations qui permettent au modèle de répondre avec un décor plutôt qu’avec l’objet.
Agir sur les données et le modèle
Des scènes ciblées, des consignes variées et des règles d’annotation explicites réduisent les confusions. Les transformations et seuils sont évalués séparément afin de ne pas déplacer l’écart vers un autre groupe.
Prévoir l’abstention
Lorsque le contexte n’est pas couvert, l’agent demande précision, observation ou intervention humaine. Les performances et limites annoncées restent ventilées après déploiement, car le terrain peut évoluer.
Sources et références
- [1] OECD AI Principles — OECD
- [2] Artificial Intelligence Risk Management Framework (AI RMF 1.0) — NIST