Réponse rapide
Une injection provenant d’un objet ou document est limitée par séparation des données et instructions, nettoyage, provenance, permissions minimales, validation structurée et refus des appels non autorisés.
Avertissement de sécurité
Un document, QR code ou objet peut contenir une instruction hostile. Traitez toute entrée comme donnée non fiable et ne laissez pas le modèle modifier ses permissions.
Isoler
Traitez texte, QR, image, audio et document comme données non fiables, sans leur permettre de modifier règles ou rôles. Délimitez clairement contexte, outils et consignes.
Autoriser
Les outils exposent schémas et limites fixes ; chaque appel est contrôlé par code et état robotique. Le modèle ne peut ni créer permission ni désactiver arrêt.
Tester
Injectez instructions cachées, encodées, contradictoires ou répétées et observez refus, fuite et journal. Une ambiguïté reste en attente ou demande confirmation humaine.
Sources et références
- [1] AI Risk Management Framework — NIST