Pourquoi versionner les données d’apprentissage d’un robot ?

Réponse rapide

Versionner les données d’apprentissage permet de retrouver les exemples et annotations qui ont produit un modèle. Cette trace aide à reproduire une évaluation, expliquer une régression et revenir à une combinaison connue, en conservant provenance, transformations et exclusions.

Identifier le corpus

Un identifiant immuable pointe vers fichiers, annotations, règles de filtrage et métadonnées. Les ajouts, corrections et suppressions créent une nouvelle version plutôt que de modifier silencieusement l’ancienne.

Relier données et modèle

Le rapport d’entraînement mentionne version du corpus, code, hyperparamètres et matériel. Une équipe peut ainsi rejouer l’expérience ou comprendre pourquoi deux modèles issus d’un même nom diffèrent.

Documenter les limites

Exclusions motivées, droits d’usage et biais connus restent attachés à la version. Cette documentation évite de réutiliser un corpus dans un contexte où ses conditions de collecte ne conviennent plus.

Sources et références

  1. [1] DVC Documentation — Iterative
  2. [2] Artificial Intelligence Risk Management Framework (AI RMF 1.0) — NIST

Cette réponse vous a-t-elle été utile ?