← Derniers articles
💬 NLP

Probabilistic distances-based hallucination detection in LLMs with RAG

Cet article propose une méthode non supervisée et efficace pour détecter les hallucinations dans les systèmes RAG en analysant les distances probabilistes entre les distributions des embeddings des tokens d'entrée et de sortie, démontrant ainsi des performances de pointe.

Auteurs originaux : Rodion Oblovatny, Alexandra Kuleshova, Konstantin Polev, Alexey Zaytsev

Publié 2026-02-26
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Rodion Oblovatny, Alexandra Kuleshova, Konstantin Polev, Alexey Zaytsev

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

🕵️‍♂️ Le Problème : Le Conteur qui Invente des Histoires

Imaginez un grand conteur (c'est l'IA, ou "LLM") qui a lu des millions de livres. Quand vous lui posez une question, il vous raconte une histoire. Parfois, il est très précis et s'appuie sur ce qu'il a lu. Mais parfois, il hallucine : il invente des faits, mélange les dates, ou raconte des choses qui n'existent pas, tout en ayant l'air très sûr de lui.

C'est particulièrement dangereux si le conteur utilise un livre de référence (c'est le système RAG : Retrieval-Augmented Generation) pour répondre. Si le livre dit "Le ciel est bleu" et que le conteur répond "Le ciel est vert", il y a un problème. Le but de ce papier est de créer un détective capable de repérer immédiatement quand le conteur commence à inventer.

🔍 La Solution : Le "Test de Respiration" dans le Cerveau de l'IA

Les chercheurs (Rodion, Alexandra, Konstantin et Alexey) ne regardent pas simplement le texte final. Ils regardent comment le cerveau de l'IA fonctionne pendant qu'il parle.

Imaginez que chaque mot que l'IA produit a une "signature électrique" ou une "empreinte digitale" cachée dans son cerveau (ce qu'on appelle les états cachés ou hidden states).

  1. L'idée de base :

    • Quand l'IA raconte une histoire vraie (basée sur le livre), la "signature" de sa réponse ressemble beaucoup à la "signature" de la question et du livre. C'est comme si elles dansaient la même valse.
    • Quand l'IA invente (hallucine), sa signature commence à danser une toute autre danse. Elle s'éloigne de la musique de la question.
  2. La mesure de l'écart (MMD) :
    Les chercheurs utilisent une règle mathématique appelée MMD (Maximum Mean Discrepancy). Imaginez que c'est un mètre laser qui mesure la distance entre deux groupes de danseurs :

    • Groupe A : Les mots de la question.
    • Groupe B : Les mots de la réponse.
    • Si la distance est petite : "Tout va bien, la réponse est cohérente."
    • Si la distance est grande : "Alerte ! La réponse s'éloigne trop de la réalité, c'est probablement un mensonge."

🎲 Pourquoi utiliser le "Wild Bootstrap" ? (Le Test de la Pièce de Monnaie)

Le problème, c'est que les distances peuvent varier selon la longueur de la phrase. Pour être sûr à 100% que l'écart est vraiment dû à une hallucination et pas juste à un hasard, les chercheurs utilisent une technique appelée Wild Bootstrap.

  • L'analogie : Imaginez que vous voulez savoir si un joueur de dés triche. Vous ne regardez pas juste un lancer. Vous lancez les dés 2000 fois en modifiant légèrement les règles à chaque fois (comme si vous souffliez sur les dés ou changez la table) pour voir à quoi ressemble un jeu "normal".
  • Dans leur méthode, ils simulent des milliers de scénarios "normaux" pour calculer une probabilité (p-value). Si la distance mesurée est plus grande que 99% des distances "normales", alors c'est une hallucination. C'est comme obtenir un score de confiance de 0 à 100%.

🧠 Le Secret : Regarder les "Yeux" individuels (Attention Heads)

Les modèles d'IA sont comme des géants avec des centaines de petits yeux (les têtes d'attention).

  • Les anciennes méthodes regardaient le géant de loin (au niveau de la "couche" entière). C'était flou, comme regarder une photo floue.
  • Cette nouvelle méthode demande au géant : "Montre-moi tes yeux les plus intelligents !"
  • Ils sélectionnent les 6 meilleurs yeux qui voient le mieux la vérité. En regardant à travers ces yeux précis, ils voient les mensonges beaucoup plus clairement que si ils regardaient l'ensemble du cerveau en vrac.

🌍 L'astuce du "Changement de Métier" (Transfert NLI)

Le plus génial de cette méthode, c'est qu'elle n'a pas besoin d'apprendre sur des exemples de mensonges spécifiques.

  • Les chercheurs ont entraîné leur détective sur un jeu de logique simple : "Si A est vrai, est-ce que B est vrai ?" (C'est la tâche NLI).
  • Ensuite, ils ont envoyé ce même détective vérifier des réponses d'IA.
  • Résultat : Le détective a compris que "mentir" dans une histoire de logique, c'est la même chose que "halluciner" dans une réponse d'IA. Il a réussi à repérer les mensonges même sans avoir jamais vu d'exemples de mensonges auparavant ! C'est comme un détective formé à repérer les faux billets qui arrive à repérer les faux documents administratifs sans nouvelle formation.

🏆 Pourquoi c'est important ?

  1. C'est rapide : Pas besoin de faire répéter la question 20 fois à l'IA pour vérifier (ce qui est lent et cher).
  2. C'est précis : Sur les gros modèles (comme LLaMA-13B), c'est l'une des meilleures méthodes au monde pour repérer les mensonges.
  3. C'est universel : Ça marche même si on change de domaine (médecine, droit, finance) car le détective a appris la logique de la "vérité" elle-même.

En résumé : Ces chercheurs ont créé un détective qui écoute le "battement de cœur" électrique de l'IA. Si le rythme s'accélère et s'éloigne de la question, le détective crie : "Attention, il invente !" Le tout en utilisant des mathématiques élégantes pour ne pas se tromper.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →