Réponse rapide
Surveiller un service ROS 1 en production consiste à suivre disponibilité, latence, erreurs, fréquence, charge, files d’attente, journaux et conséquences des requêtes.
La surveillance doit déclencher une action
Disponibilité, latence et erreurs n’ont de valeur que si seuils, repli, intervention et arrêt sont définis à l’avance.
Mesurer la disponibilité
Présence du serveur, succès, timeout et redémarrage indiquent si l’interface est réellement utilisable.
Relier appel et résultat
Identifiant, durée, réponse, effet et contexte permettent de distinguer réseau lent, logique erronée et actionneur défaillant.
Déclencher un repli
Seuils d’alerte, limitation d’appel, mode sûr et intervention sont définis avant la perte complète du service.
Sources et références
- [1] Robotics and Autonomous Systems — NIST