La descente par lot calcule un gradient sur toutes les données avant chaque mise à jour ; la descente par mini-lots utilise des sous-ensembles, offrant un compromis entre stabilité, mémoire et fréquence des mises…
Une divergence se repère par perte qui augmente ou devient non finie, gradients qui explosent, paramètres instables et métriques de validation qui se dégradent. L’entraînement est alors arrêté ou ramené à un état connu.
Le taux d’apprentissage fixe la taille des mises à jour : trop faible, l’entraînement progresse lentement ; trop élevé, il oscille, diverge ou dépasse les bonnes régions. Il se choisit sur validation.
La descente de gradient ajuste les paramètres d’un modèle dans la direction qui réduit une fonction de perte, à partir du gradient calculé sur des données d’apprentissage.
La rétropropagation calcule comment l’erreur de sortie d’un réseau contribue aux paramètres de chaque couche afin de les ajuster.
On entraîne un réseau par lots d’exemples : la rétropropagation agrège leurs erreurs avant de modifier les paramètres.
Préparer les données avant l’entraînement d’un réseau neuronal robotique demande de vérifier annotations, formats, unités, équilibre des cas et séparation entre apprentissage et test.
Normaliser les variables avant une descente de gradient met les grandeurs sur des échelles comparables et évite qu’une mesure domine le calcul uniquement par son unité.