Réponse rapide
Évaluer un modèle d’IA sur des données jamais vues mesure sa capacité à généraliser plutôt qu’à mémoriser les exemples d’entraînement. Le jeu indépendant révèle erreurs, biais, incertitude et limites dans des scènes proches de l’usage. Pour un robot, on relie ces résultats à la conséquence physique, au délai et à la possibilité de s’abstenir.
Geler un protocole indépendant
Jeu de test, provenance, transformation, version et accès sont protégés jusqu’à l’évaluation. Scènes, personnes, trajectoires et périodes corrélées sont regroupées pour éviter les fuites. Les critères sont définis avant de regarder les résultats.
Mesurer par situation et par erreur
Précision, rappel, latence, confiance, abstention et impact sur trajectoire ou effort sont ventilés par classe et contexte. Intervalles et répétitions montrent la variabilité. Un cas rare mais dangereux reste visible derrière la moyenne.
Ne pas recycler le test jusqu’à obtenir un bon score
Ajuster le modèle après chaque consultation rend le test moins indépendant. Une nouvelle version du protocole est nécessaire après décision. Les métriques restent liées au jeu et à la configuration qui les ont produites.
Sources et références
- [1] Model Evaluation — scikit-learn User Guide — scikit-learn