Réponse rapide
Une latence GPU prévisible se construit par modèles et tailles fixes, allocations maîtrisées, files bornées, synchronisation explicite, priorité des flux et mesure des percentiles élevés dans la configuration cible.
Chronométrer toute la chaîne
Capture, transfert, noyau, synchronisation, post-traitement et publication sont horodatés. Moyenne, jitter, maximum et âge de la donnée sont suivis.
Limiter les variations
Batch, résolution, concurrence et mémoire sont bornés. Les flux critiques évitent une file partagée avec une charge non maîtrisée.
Gérer le dépassement
Une tâche trop lente est abandonnée, dégradée ou remplacée par une estimation de secours. La commande ne continue pas avec une mesure périmée sans limite.
Une latence moyenne basse peut masquer un arrêt ponctuel
Le pire percentile ou une synchronisation bloquante peut dépasser le délai de stabilité. Les critères sont établis sur les pires cas, pas sur la moyenne seule.
Sources et références
- [1] Robotics and Autonomous Systems — NIST