Réponse rapide
Une IA générative multimodale combine plusieurs entrées, comme une image, une consigne textuelle et l’état du robot, pour produire une réponse ou une proposition d’action. Ses sorties passent néanmoins par des contrôles spécialisés avant toute commande physique.
Rassembler plusieurs signaux
L’image décrit scène et objets, le texte précise l’intention, tandis que pose, charge et batterie décrivent l’état de la machine. Le modèle doit connaître l’origine et la date de chaque élément.
Formuler une proposition
À partir de ces modalités, il peut répondre à une question, choisir un outil ou suggérer une étape. Une proposition reste dépendante de ce qui a été observé et de ce qui est absent.
Isoler l’effet physique
Planificateur, contrôleur et règles de sécurité vérifient collision, limites, permissions et cohérence de l’état. Le langage ou l’image ne fournit jamais à lui seul l’autorisation d’agir.
Sources et références
- [1] Transformers Documentation — Hugging Face
- [2] Artificial Intelligence Risk Management Framework (AI RMF 1.0) — NIST