Réponse rapide
Les gradients disparaissent lorsque les dérivées multipliées à travers de nombreuses couches ou étapes deviennent très petites, ce qui ralentit l’apprentissage des représentations lointaines ou des séquences longues.
Comprendre la chaîne
Activations saturées, poids mal initialisés, profondeur et récurrence peuvent réduire le signal. Les premières couches progressent alors beaucoup moins que les dernières.
Comparer les gradients
Normes par couche, perte, vitesse d’apprentissage et sensibilité aux entrées sont suivies. Un bon score final peut masquer une représentation fragile sur les cas nouveaux.
Stabiliser l’apprentissage
Normalisation, activations adaptées, connexions résiduelles, initialisation et architecture temporelle réduisent le problème. Chaque remède est vérifié sur validation indépendante.
Sources et références
- [1] Robotics and Autonomous Systems — NIST