Réponse rapide
Normaliser les données avant un clustering rend les variables comparables lorsque leurs unités, amplitudes ou dispersions diffèrent. Sans cela, une mesure en grandes unités peut dominer la distance et imposer des groupes artificiels. La transformation choisie, ses paramètres et son effet sur les valeurs extrêmes doivent rester cohérents entre apprentissage et usage.
Choisir une transformation justifiée
Standardisation, échelle robuste ou transformation physique sont comparées selon bruit, distribution et sens de la mesure. Moyenne, écart, médiane et bornes sont calculés sur la référence sans regarder le test. Valeurs manquantes et saturation sont traitées explicitement.
Appliquer la même chaîne au robot
Paramètres et unités sont versionnés et vérifiés au déploiement. Une température, une vitesse ou une force mal convertie est détectée avant regroupement. Les résultats sont interprétés dans les unités originales pour éviter une fausse causalité.
Ne pas normaliser pour effacer une différence utile
Une amplitude peut porter l’information de sécurité ou d’énergie. Transformation et pondération sont validées par la tâche et non choisies mécaniquement. Les données anormales ne sont pas masquées par un prétraitement opaque.
Sources et références
- [1] Preprocessing data — scikit-learn