Réponse rapide
Une fuite de données se produit lorsqu’une information du test influence l’entraînement ou le réglage, ce qui rend la performance artificiellement optimiste. Il faut séparer les exemples selon le temps, le robot, la scène ou la mission et apprendre les transformations uniquement sur l’entraînement.
Définir des frontières réelles
Des images voisines d’une même séquence ou des mesures d’un même robot peuvent se retrouver dans plusieurs sous-ensembles. Le découpage s’effectue donc selon l’unité qui doit rester inconnue au modèle lors du test.
Isoler les statistiques
Normalisation, sélection de variables et imputation sont ajustées sur l’entraînement, puis appliquées telles quelles à validation et test. Les paramètres calculés avec tout le corpus sont une source classique de fuite.
Chercher les signaux suspects
Une performance étonnamment élevée, un doublon ou une métadonnée corrélée à la cible déclenche une revue. Un test sur un site ou une période réellement tenus à l’écart donne une estimation plus crédible.
Sources et références
- [1] Common pitfalls and recommended practices — scikit-learn — scikit-learn
- [2] AI Risk Management Framework — NIST