Comment évaluer les réponses d’un grand modèle de langage utilisé par un robot ?

Réponse rapide

Les réponses d’un grand modèle utilisé par un robot s’évaluent sur compréhension, exactitude, respect des outils, robustesse aux ambiguïtés, latence et conséquences des erreurs en contexte réel.

Point de vigilance

Une bonne formulation ne prouve pas une bonne action. Mesurez erreurs, refus, latence et conséquences dans des scénarios représentatifs.

Construire des scénarios

Testez demandes normales, incomplètes, contradictoires, malveillantes et hors domaine avec états et permissions variés.

Mesurer l’action

Comparez intention, outil, paramètres, résultat, refus et temps de réponse ; une formulation élégante ne compense pas une commande dangereuse.

Rejouer les limites

Conservez corpus, versions et décisions humaines, analysez erreurs par contexte et bloquez l’usage lorsque la couverture validée est dépassée.

Sources et références

  1. [1] Robotics and Autonomous Systems — NIST

Cette réponse vous a-t-elle été utile ?