Comment séparer entraînement, validation et test en apprentissage supervisé ?

Réponse rapide

Séparer entraînement, validation et test évite d’utiliser les mêmes exemples pour ajuster un modèle, choisir ses réglages et annoncer sa performance. La séparation tient compte des scènes, personnes, trajectoires et périodes proches afin d’éviter les fuites. Chaque version de données, prétraitement et métrique est conservée avec le résultat.

Geler les jeux et les transformations

Identifiants, hachages, partitions et règles de filtrage sont documentés. Validation guide hyperparamètres et seuils ; test reste caché jusqu’à l’évaluation finale. Les données temporelles ou corrélées sont regroupées avant séparation.

Mesurer performance par scénario

Erreur, rappel, précision, latence, abstention et impact physique sont ventilés par classe, site, lumière et mouvement. Variance et cas rares sont conservés. Toute fuite découverte entraîne une nouvelle évaluation déclarée.

Ne pas consulter le test pour améliorer itération après itération

Le test devient alors une validation implicite et sa performance est optimiste. Une nouvelle version de test est nécessaire pour une mesure indépendante. Les chiffres précédents restent attribués à leur protocole.

Sources et références

  1. [1] Model selection and evaluation — scikit-learn User Guide — scikit-learn

Cette réponse vous a-t-elle été utile ?