Le taux d’apprentissage fixe la taille des mises à jour : trop faible, l’entraînement progresse lentement ; trop élevé, il oscille, diverge ou dépasse les bonnes régions. Il se choisit sur validation.
La descente par lot calcule un gradient sur toutes les données avant chaque mise à jour ; la descente par mini-lots utilise des sous-ensembles, offrant un compromis entre stabilité, mémoire et fréquence des mises…
Une divergence se repère par perte qui augmente ou devient non finie, gradients qui explosent, paramètres instables et métriques de validation qui se dégradent. L’entraînement est alors arrêté ou ramené à un état connu.
La descente de gradient ajuste les paramètres d’un modèle dans la direction qui réduit une fonction de perte, à partir du gradient calculé sur des données d’apprentissage.
Normaliser les variables avant une descente de gradient met les grandeurs sur des échelles comparables et évite qu’une mesure domine le calcul uniquement par son unité.