← Derniers articles
💬 NLP

Probing for Knowledge Attribution in Large Language Models

Cette étude propose un pipeline d'entraînement auto-supervisé nommé AttriWiki et des sondes linéaires capables d'identifier avec une grande précision la source de connaissance (contexte ou mémoire interne) à l'origine des réponses des grands modèles de langage, révélant ainsi un lien direct entre la confusion des sources et les hallucinations.

Auteurs originaux : Ivo Brink, Alexander Boer, Dennis Ulmer

Publié 2026-02-27
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Ivo Brink, Alexander Boer, Dennis Ulmer

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

🕵️‍♂️ Le Problème : Le Chatbot "Confiant mais Faux"

Imaginez que vous demandez à un agent de voyage (un chatbot) de réserver un vol d'urgence pour un enterrement. Il vous répond avec une assurance totale : "Oui, vous avez 90 jours pour demander un remboursement !".

Vous faites confiance, vous payez, et six mois plus tard, on vous refuse l'argent. Pourquoi ? Parce que la règle n'a jamais existé. Le chatbot a halluciné.

Le problème, c'est que les détecteurs actuels se demandent souvent : "Est-ce que la réponse est vraie ?". Mais ils ne se demandent pas assez : "D'où vient cette réponse ?".

  • Est-ce que le chatbot a lu votre demande et a utilisé les informations que vous lui avez données ? (C'est la mémoire contextuelle).
  • Ou est-ce qu'il a sorti une information de sa "tête" (ses entraînements passés), même si c'était faux ? (C'est la mémoire paramétrique).

Si le chatbot utilise sa propre "tête" pour répondre à une question qui exigeait de lire votre document, c'est une erreur de provenance. C'est comme si un avocat citait une vieille loi qu'il a apprise par cœur au lieu de lire le nouveau contrat que vous venez de lui donner.

🔍 La Solution : Le "Détecteur de Source" (Le Probe)

Les auteurs de cette étude (Ivo, Alexander et Dennis) ont eu une idée brillante : Et si on pouvait "lire dans les pensées" du modèle pour savoir d'où vient l'information ?

Ils ont créé un petit détecteur appelé un "probe" (une sonde). Imaginez que le cerveau du modèle (ses couches internes) est une grande pièce remplie de lumières qui clignotent quand il réfléchit.

  • Quand le modèle lit un texte, certaines lumières s'allument d'une certaine façon.
  • Quand il se souvient d'un fait appris par cœur, d'autres lumières s'allument différemment.

Leur "probe" est comme un chef de cuisine qui regarde les ingrédients dans le panier. Il ne goûte pas le plat final (la réponse), il regarde juste ce qui a été utilisé pour le cuisiner. Il peut dire : "Attends, cette réponse sent le 'contexte' (le texte fourni)" ou "Non, ça sent le 'par cœur' (la mémoire interne)".

🏗️ Comment ils ont entraîné ce détecteur ? (L'usine ATTRIWIKI)

Pour apprendre à ce détecteur à faire la différence, il faut des milliers d'exemples. Mais étiqueter tout cela à la main prendrait des années. Alors, ils ont construit une usine automatique appelée ATTRIWIKI.

Voici comment ça marche, avec une analogie de jeu de mémoire :

  1. Le Livre de Référence : Ils prennent des articles Wikipédia.
  2. Le Test de Mémoire : Ils demandent au modèle : "Peux-tu me dire qui est ce personnage sans que je te donne l'article ?"
    • Si le modèle connaît déjà le personnage, c'est de la mémoire interne.
    • Si le modèle ne le connaît pas, c'est de la mémoire contextuelle (il doit lire l'article).
  3. Le Jeu de l'Oie :
    • Cas A (Mémoire) : Ils cachent le nom du personnage dans l'article et demandent au modèle de le compléter. Le modèle doit utiliser sa mémoire.
    • Cas B (Contexte) : Ils gardent le nom dans l'article mais cachent un autre détail. Le modèle doit lire l'article pour répondre.

Cette usine génère automatiquement des milliers de paires de questions/réponses étiquetées. C'est comme un entraîneur personnel qui force le modèle à faire des exercices précis pour révéler ses habitudes de pensée.

📊 Les Résultats : Une Révélation Éclairante

Une fois l'usine terminée, ils ont entraîné leur petit détecteur (le probe) sur ces données. Les résultats sont impressionnants :

  1. C'est lisible : La différence entre "mémoire interne" et "lecture du texte" est clairement visible dans les couches intermédiaires et supérieures du cerveau du modèle. C'est comme si le modèle laissait une empreinte digitale de sa source de pensée.
  2. C'est très précis : Le détecteur réussit à deviner la source avec une précision de 96% (c'est énorme !).
  3. C'est transférable : Même si on l'entraîne sur des articles Wikipédia, il fonctionne aussi bien sur des questions générales (comme SQuAD ou WebQuestions) sans avoir besoin d'être réentraîné.
  4. Le danger de la confusion : Quand le modèle se trompe de source (il utilise sa mémoire alors qu'il devrait lire le texte), ses erreurs augmentent de 70%. C'est le lien direct entre "confusion de provenance" et "mauvaise réponse".

💡 Pourquoi c'est important pour nous ?

Ce travail ne dit pas seulement "Le modèle a menti". Il dit "Le modèle a menti parce qu'il a ignoré ce que vous lui avez donné pour se fier à ce qu'il croyait savoir".

C'est une avancée majeure pour :

  • La confiance : Savoir si une réponse vient d'une source vérifiable (votre document) ou d'une supposition du modèle.
  • La sécurité : Dans des domaines comme le droit ou la médecine, savoir si l'IA lit le dossier patient ou si elle improvise est crucial.
  • La correction : Si on sait que le modèle a ignoré le contexte, on peut lui dire : "Non, relis le document que je viens de te donner !".

En résumé

Imaginez que l'IA est un élève très brillant mais un peu arrogant.

  • Avant : On lui demandait : "As-tu la bonne réponse ?". S'il disait "Oui", on le croyait, même s'il avait triché en utilisant sa mémoire au lieu de lire le livre.
  • Aujourd'hui (grâce à cette étude) : On peut regarder ses notes de cours (les états cachés) et dire : "Attends, tu n'as pas lu le chapitre 3, tu as juste deviné avec ce que tu savais déjà. Recommençons."

C'est un pas de géant vers des IA plus honnêtes et plus transparentes, capables de nous dire non seulement ce qu'elles pensent, mais d'où elles tirent cette pensée.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →