Réponse rapide
La mémoire d’un GPU peut limiter un entraînement robotique car modèle, activations, gradients, lots et données intermédiaires doivent tenir simultanément, sinon calcul échoue ou ralentit par échanges.
Débordement mémoire peut interrompre l’inférence
Mesurez pics, fragmentation et durée d’exécution et prévoyez configuration réduite, surveillance et repli avant saturation.
Décomposer l’occupation
Mesurez paramètres, précision, batch, séquence, augmentations, cache, bibliothèques et fragmentation plutôt qu’un modèle seul.
Réduire sans déformer
Diminuez lot ou résolution, utilisez précision mixte, accumulation ou modèle adapté et contrôlez l’effet sur apprentissage.
Surveiller l’exécution
Journalisez mémoire, erreurs, température et transferts et refusez une configuration qui échoue seulement après longue durée.
Sources et références
- [1] CUDA C Programming Guide — NVIDIA
- [2] PyTorch Documentation — PyTorch