Réponse rapide
Séparer entraînement et évaluation d’un modèle robotique empêche que les mêmes exemples servent à apprendre puis à déclarer la performance. Les jeux sont partitionnés par scène, mission, personne ou période lorsque cela reflète l’usage, et le test est gelé avec ses versions. Toute fuite, doublon ou transformation partagée est recherchée avant comparaison.
Geler les frontières de données
Identifiants, hachages, partitions, prétraitement et labels sont versionnés. Données de validation aident à choisir, données de test servent seulement à l’estimation finale. Les séries temporelles et trajectoires proches ne sont pas réparties au hasard si cela crée une fuite.
Mesurer généralisation et incertitude
Précision, rappel, erreur de pose, latence et comportement hors domaine sont comparés par scénario. Répétitions et intervalles rendent visibles variabilité et classes rares. Un gain sur l’entraînement n’est pas compté comme preuve.
Ne pas ajuster le modèle sur le résultat du test
Modifier seuils ou labels après avoir vu le test transforme celui-ci en entraînement. Une nouvelle version de test doit être déclarée et justifiée. Les résultats précédents restent conservés.
Sources et références
- [1] Artificial intelligence and robotics — NIST