Réponse rapide
La vision-langage désigne généralement un modèle ou une architecture qui fusionne images et texte, tandis que « vision et langage » peut désigner plus largement l’ensemble des composants et interfaces reliant ces deux modalités en robotique.
Distinguer modèle et système
Un modèle vision-langage produit représentations ou réponses à partir de pixels et de mots. Un système vision et langage ajoute capteurs, mémoire, planification, contrôleurs et interfaces de validation.
Relier les rôles
La perception détecte, le langage décrit ou contraint, puis un planificateur transforme l’intention en tâche. Les limites de chaque composant sont suivies séparément.
Employer le terme utile
La documentation indique si elle parle d’un modèle préentraîné, d’un pipeline multimodal ou d’un robot complet. Cette précision évite d’attribuer au modèle des garanties apportées par d’autres modules.
Sources et références
- [1] Robotics and Autonomous Systems — NIST