Réponse rapide
La qualité d’une interaction vocale se mesure par compréhension, corrections, tours inutiles, temps, refus justifiés, satisfaction et erreurs dangereuses ou divulgations. Tests couvrent locuteurs, langues, bruits, distances et demandes sensibles. Dialogue court n’est positif que si intention, paramètres et effet ont réellement été compris.
Croiser moteur et parcours
Erreur de transcription et d’intention décrivent moteur ; réussite, abandon et transfert décrivent service. Mesures sont ventilées par accent, volume, bruit et demande. Faux accord et mauvaise action sont séparés d’une simple incompréhension.
Mesurer l’effort imposé
Répétitions, reformulations, confirmations et attente sont comptées, puis rapprochées de la compréhension de l’utilisateur. Phrase artificielle peut réussir au laboratoire et échouer dans vie réelle. Observations révèlent fatigue, distraction et stratégie de contournement.
Conserver des critères d’arrêt
Robot bascule vers texte, bouton ou humain si qualité baisse, données risquent d’être exposées ou charge augmente. Gain marginal ne justifie pas erreurs. Changement de modèle déclenche nouvelle campagne sur scénarios sensibles.
Sources et références
- [1] Robotics and Autonomous Systems — NIST