Comment séparer entraînement et évaluation d’un modèle robotique ?

Réponse rapide

Séparer entraînement et évaluation d’un modèle robotique empêche que les mêmes exemples servent à apprendre puis à déclarer la performance. Les jeux sont partitionnés par scène, mission, personne ou période lorsque cela reflète l’usage, et le test est gelé avec ses versions. Toute fuite, doublon ou transformation partagée est recherchée avant comparaison.

Geler les frontières de données

Identifiants, hachages, partitions, prétraitement et labels sont versionnés. Données de validation aident à choisir, données de test servent seulement à l’estimation finale. Les séries temporelles et trajectoires proches ne sont pas réparties au hasard si cela crée une fuite.

Mesurer généralisation et incertitude

Précision, rappel, erreur de pose, latence et comportement hors domaine sont comparés par scénario. Répétitions et intervalles rendent visibles variabilité et classes rares. Un gain sur l’entraînement n’est pas compté comme preuve.

Ne pas ajuster le modèle sur le résultat du test

Modifier seuils ou labels après avoir vu le test transforme celui-ci en entraînement. Une nouvelle version de test doit être déclarée et justifiée. Les résultats précédents restent conservés.

Sources et références

  1. [1] Artificial intelligence and robotics — NIST

Cette réponse vous a-t-elle été utile ?