Pourquoi normaliser les données avant un clustering robotique ?

Réponse rapide

Normaliser les données avant un clustering rend les variables comparables lorsque leurs unités, amplitudes ou dispersions diffèrent. Sans cela, une mesure en grandes unités peut dominer la distance et imposer des groupes artificiels. La transformation choisie, ses paramètres et son effet sur les valeurs extrêmes doivent rester cohérents entre apprentissage et usage.

Choisir une transformation justifiée

Standardisation, échelle robuste ou transformation physique sont comparées selon bruit, distribution et sens de la mesure. Moyenne, écart, médiane et bornes sont calculés sur la référence sans regarder le test. Valeurs manquantes et saturation sont traitées explicitement.

Appliquer la même chaîne au robot

Paramètres et unités sont versionnés et vérifiés au déploiement. Une température, une vitesse ou une force mal convertie est détectée avant regroupement. Les résultats sont interprétés dans les unités originales pour éviter une fausse causalité.

Ne pas normaliser pour effacer une différence utile

Une amplitude peut porter l’information de sécurité ou d’énergie. Transformation et pondération sont validées par la tâche et non choisies mécaniquement. Les données anormales ne sont pas masquées par un prétraitement opaque.

Sources et références

  1. [1] Preprocessing data — scikit-learn

Cette réponse vous a-t-elle été utile ?