Comment distinguer la voix de l’utilisateur d’un son diffusé par un robot ?

Réponse rapide

Pour distinguer l’utilisateur de ses propres annonces, le robot combine annulation d’écho, détection d’activité, direction d’arrivée et alternance de parole. Il indique si une consigne a réellement été reçue avant d’agir.

Retirer la parole connue

Le signal envoyé au haut-parleur sert à estimer et annuler son retour dans les microphones. Réverbération et haut-parleur voisin peuvent toutefois laisser une incertitude résiduelle.

Comparer direction et activité

Réseau de microphones, activité vocale et moment de prise de parole donnent des indices complémentaires. Une source hors zone ou simultanée ne doit pas être attribuée sans confiance suffisante.

Ne pas convertir un écho en ordre

Le robot reformule la commande reconnue et attend confirmation si l’action est sensible. Les sorties et interruptions restent traçables pour comprendre l’attribution.

Sources et références

  1. [1] Web Speech API Specification — W3C

Cette réponse vous a-t-elle été utile ?