Réponse rapide
On détecte une fuite de données en recherchant des exemples identiques ou corrélés entre ensembles, des transformations partagées, des informations futures ou des identifiants qui révèlent directement la cible.
Découper par épisode
Images voisines, trajectoires d’un même passage, robot et environnement sont regroupés avant séparation. Une découpe aléatoire peut placer presque la même scène dans train et test.
Auditer les transformations
Normalisation, calibration, sélection de variables et prétraitement sont ajustés sur l’entraînement seulement. Les métadonnées futures ne doivent pas entrer dans l’entrée du modèle.
Comparer une base indépendante
Jeu caché, données temporelles nouvelles et test par robot révèlent une performance artificiellement gonflée. Les résultats sont comparés avant et après correction.
Un score de test élevé peut être une fuite
Si le test partage contexte ou information avec l’apprentissage, il ne prouve pas la généralisation. Le déploiement doit attendre une évaluation réellement indépendante.
Sources et références
- [1] Robotics and Autonomous Systems — NIST