Quelle différence entre descente de gradient par lot et par mini-lots ?
Mise à jour29 août 2026
Lecture1 minute
Réponse rapide
La descente par lot calcule un gradient sur toutes les données avant chaque mise à jour ; la descente par mini-lots utilise des sous-ensembles, offrant un compromis entre stabilité, mémoire et fréquence des mises à jour.
Calculer globalement
Le lot complet donne un gradient moins bruité mais demande mémoire et temps avant chaque étape. Il peut être coûteux lorsque les données sont nombreuses.
Mettre à jour souvent
Les mini-lots exploitent le matériel et apportent des mises à jour fréquentes, avec un bruit qui peut aider ou perturber la convergence.
Comparer équitablement
Taille de lot, taux, nombre d’epochs, mélange des données et budget de calcul sont documentés. Validation et consommation doivent être comparées avec le même protocole.
Sources et références
- [1] Robotics and Autonomous Systems — NIST