Pourquoi mesurer les performances d’un robot par sous-groupe ou par contexte ?

Réponse rapide

Ventiler les performances par sous-groupe ou contexte révèle des erreurs qu’une moyenne globale peut masquer et relie chaque écart à une décision, un risque ou un accès au service.

Point de vigilance

Un sous-groupe peu observé ne prouve ni bonne ni mauvaise performance. Indiquez l’incertitude et limitez l’usage si les données sont insuffisantes.

Détailler les mesures

Publiez effectifs, métriques et incertitudes pour les contextes utiles. Distinguez une performance stable d’un manque d’observations qui rend la conclusion fragile.

Comparer les conditions

Un système peut bien naviguer de jour et manquer davantage d’obstacles la nuit. Cette différence justifie une limite d’usage et une collecte ciblée avant extension.

Garder des groupes interprétables

Des catégories trop petites donnent des estimations instables. Choisissez des regroupements liés à la mission, à l’environnement ou à la décision étudiée.

Sources et références

  1. [1] Model Evaluation — scikit-learn User Guide — scikit-learn
  2. [2] OECD AI Principles — OECD

Cette réponse vous a-t-elle été utile ?