Réponse rapide
Surveiller température et énergie d’un GPU robotique évite throttling, erreurs, vieillissement, redémarrage et autonomie imprévisible et permet d’adapter charge ou mode avant dépassement.
La surchauffe peut modifier le comportement
Throttling, erreur ou redémarrage changent latence et perception. Surveillez température, puissance et marge et déclenchez un repli contrôlé.
Mesurer le thermique
Suivez température cœur, boîtier, mémoire, ventilation, température ambiante, charge et fréquence pendant les cas maximaux.
Relier énergie et mission
Comparez puissance, batterie, durée, calcul restant et marge de retour et limitez fonctions non critiques si nécessaire.
Déclencher le repli
Réduisez fréquence ou résolution, basculez vers modèle léger, alertez et arrêtez proprement avant perte de contrôle.
Sources et références
- [1] CUDA C Programming Guide — NVIDIA
- [2] Systems Engineering Handbook — NASA