Comment évaluer les hallucinations d’un modèle de langage utilisé avec un robot ?

Réponse rapide

Les hallucinations se mesurent par jeux de questions et procédures connus, vérification des citations, exactitude des étapes, refus appropriés, cohérence, latence et conséquences d’une erreur.

Avertissement de sécurité

Une réponse fluide ou citée peut encore halluciner une étape critique. Exigez vérification humaine et refus lorsque la source, l’état ou la confiance manque.

Construire

Incluez faits présents ou absents, ambiguïtés, documents contradictoires, commandes interdites et cas hors domaine. Gardez une référence validée et des évaluateurs compétents.

Mesurer

Rapportez réponses fausses, omissions, détails inventés, confiance, abstention et taux d’appel d’outil, par version et contexte. Une explication fluide ne réduit pas l’erreur.

Limiter

Exigez sources, confirmation ou transfert humain avant décision physique. Une hausse d’hallucination ou un cas critique déclenche retrait, modèle plus borné ou mode lecture seule.

Sources et références

  1. [1] AI Risk Management Framework — NIST

Cette réponse vous a-t-elle été utile ?