Réponse rapide
On relie un modèle vision-langage à une tâche robotique par une représentation intermédiaire vérifiable : objets, relations, paramètres, préconditions et critères de réussite sont transmis au planificateur plutôt qu’une commande brute.
Décrire les entités
Les régions d’image sont associées à des identifiants, propriétés et incertitudes. Une instruction « prendre » doit préciser cible, pose, accessibilité et état attendu.
Convertir en opérations
Le planificateur sélectionne une compétence autorisée, vérifie ses préconditions et réserve les ressources. Le modèle peut proposer, mais ne contourne ni limites ni contrôles du système.
Boucler avec observation
Après chaque étape, vision et capteurs confirment l’état réel. Une divergence déclenche pause, replanification ou demande d’aide au lieu de poursuivre sur une hypothèse périmée.
Sources et références
- [1] Robotics and Autonomous Systems — NIST