Comment documenter une évaluation de modèle pour qu’elle soit reproductible ?

Réponse rapide

Documenter une évaluation reproductible décrit données, matériel, logiciel, modèle, paramètres, prétraitement, métriques, scénarios, versions, graines, environnement et critères d’acceptation. Les entrées, sorties, horodatages et écarts sont conservés avec le rapport. Une autre équipe doit pouvoir refaire l’essai sans deviner une étape implicite.

Figer configuration et provenance

Identifiants de jeu, hachages, firmware, pilote, modèle, code, calibration, capteurs et météo sont liés. Scripts d’exécution ou commandes sont versionnés pour orchestrer l’essai, sans générer le contenu évalué. Accès et données sensibles sont contrôlés.

Publier résultats et incertitude

Chaque métrique possède définition, unité, population, exclusions et intervalle. Cas d’échec, données manquantes, reprise et intervention humaine sont comptés. Résultats bruts et agrégés restent disponibles pour audit.

Ne pas documenter seulement le chiffre final

Un score sans version, jeu ou conditions ne peut pas être comparé. Les écarts au protocole et les hypothèses sont déclarés. Une évaluation non reproductible ne prouve pas la stabilité du modèle.

Sources et références

  1. [1] Model Evaluation — scikit-learn User Guide — scikit-learn

Cette réponse vous a-t-elle été utile ?