← Derniers articles
💬 NLP

When Context Misleads: Surprisal, Energy and Attention Entropy as Metrics of Coherence Illusions in LLMs

Cet article démontre que les modèles de langue néerlandais présentent des illusions de cohérence semblables à celles de l'humain, où des contextes distracteurs réduisent la surprise pour des continuations incohérentes, tandis que l'entropie de l'attention et les mesures d'énergie révèlent les mécanismes partagés sous-jacents qui pilotent ces effets.

Auteurs originaux : Ece Takmaz, Nitin Kumar, Li Kloostra, Jakub Dotlacil

Publié 2026-06-23
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Ece Takmaz, Nitin Kumar, Li Kloostra, Jakub Dotlacil

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

L'idée principale : Quand votre cerveau (et l'IA) se fait piéger

Imaginez que vous lisez une histoire. Soudain, vous tombez sur un mot comme « encore ». Votre cerveau revient immédiatement au début de l'histoire pour découvrir ce qui se passe « encore ».

D'habitude, cela fonctionne parfaitement. Mais parfois, l'histoire est un piège. Il y a un « distracteur » — un événement similaire mentionné plus tôt qui ne correspond pas réellement, mais qui ressemble assez à la situation pour tromper votre cerveau.

La découverte de l'article :
Les chercheurs ont découvert que les Grands Modèles de Langage (LLM) — les cerveaux d'IA derrière des outils comme les chatbots — tombent dans le même piège. Tout comme les humains, lorsqu'une IA voit une histoire déroutante avec un distracteur correspondant, elle s'embrouille et pense que l'histoire est cohérente alors qu'elle ne l'est pas. Ils appellent cela une « illusion de cohérence ».


L'expérience : Le test du « Bol de fruits »

Pour tester cela, les chercheurs ont utilisé des histoires en néerlandais (car ils disposaient de données sur la lecture chez les humains en néerlandais). Voici une version simplifiée de la configuration :

  1. La mise en scène : Un personnage, appelons-la Megan, a faim.
  2. Le rebondissement : L'histoire mentionne deux choses :
    • Cible : Megan a mangé une pomme jaune.
    • Distracteur : Elle n'a pas mangé une poire verte.
  3. Le piège : La phrase suivante dit : « Le lendemain matin, Megan a encore mangé une poire ».

La réaction humaine :
Un lecteur humain voit « encore » et « poire ». Son cerveau est confus car l'histoire disait qu'elle n'avait pas mangé de poire. Cependant, parce que la « poire » a été mentionnée plus tôt (même si elle était niée), le cerveau glisse parfois et se dit : « Oh, elle a dû manger une poire à nouveau ! ». C'est l'illusion.

La réaction de l'IA :
Les chercheurs ont demandé à divers modèles d'IA de lire ces histoires. Ils ont constaté que les IA se comportaient exactement comme les humains :

  • Quand l'histoire était parfaitement logique, l'IA était calme.
  • Quand l'histoire était illogique (le piège), l'IA était « surprise » (un terme technique pour dire « c'est inattendu »).
  • Crucialement : Quand le piège incluait un distracteur correspondant (mentionner la poire plus tôt), l'IA était moins surprise. Elle est tombée dans l'illusion, pensant que l'histoire confuse était en fait correcte.

Comment ils ont mesuré le « Piège »

Les chercheurs n'ont pas seulement demandé à l'IA si elle était confuse ; ils ont regardé à l'intérieur du « cerveau » de l'IA pour voir comment elle réfléchissait. Ils ont utilisé trois outils spéciaux :

1. La Surprisal (Le compteur de « Hallement »)

Considérez la Surprisal (la surprise) comme un compteur de hallement.

  • Si vous lisez une phrase qui fait parfaitement sens, vous ne haletez pas. Le compteur est bas.
  • Si vous lisez quelque chose de bizarre, vous haletez. Le compteur monte haut.
  • Le résultat : Lorsque l'IA a lu l'histoire piège, elle a haleté (surprisal élevé). Mais quand l'histoire piège contenait un « distracteur » qui correspondait à la fin, l'IA a arrêté de haleter autant. Elle a été trompée en pensant que l'histoire était fluide.

2. L'Entropie de l'Attention (La lampe torche de la « Focalisation »)

Imaginez que l'IA possède une lampe torche qui éclaire les mots auxquels elle pense.

  • Faible Entropie (Focalisée) : La lampe est un faisceau étroit. L'IA regarde un mot spécifique.
  • Haute Entropie (Diffuse) : La lampe est un faisceau large et flou. L'IA regarde de nombreux mots à la fois, sans savoir lequel est important.
  • Le résultat : Quand l'IA était trompée, la lampe est devenue floue (entropie élevée). Elle regardait les mauvais mots parce que le distracteur la confondait. En désactivant les parties spécifiques de l'IA responsables de cette focalisation floue, les chercheurs ont pu voir que ces parties sont celles qui se font piéger.

3. L'Énergie (Le test de l'« Aimant »)

C'est un nouvel outil introduit par les chercheurs, emprunté à la physique. Imaginez que la mémoire de l'IA est un paysage de collines et de vallées.

  • Basse Énergie : L'IA trouve une « vallée » parfaite où le mot actuel s'insère parfaitement avec le passé. C'est comme un aimant qui s'enclenche.
  • Haute Énergie : L'IA est coincée sur une « colline ». Le mot ne s'ajuste pas bien, et l'IA doit lutter pour donner du sens.
  • Le résultat : Lorsque l'IA a été trompée par le distracteur, l'« énergie » a chuté. C'était comme si le mot s'insérait parfaitement, même si ce n'était pas le cas. Cela a confirmé que l'IA subissait la même illusion que les humains : elle ressentait un faux sentiment de connexion.

Pourquoi cela importe (selon l'article)

L'article ne dit pas que cela va réparer l'IA ou guérir des maladies. Il fait plutôt un point spécifique et important :

L'IA et les humains partagent un « bug » similaire.
Les humains et ces modèles d'IA reposent tous deux sur la récupération de la mémoire. Lorsque nous essayons de nous rappeler ce qui s'est passé plus tôt dans une histoire, nous utilisons des indices. Si un indice ressemble à la réponse (même s'il est faux), nos cerveaux (et les mathématiques de l'IA) sont détournés.

Les chercheurs ont montré que :

  1. Les IA sont dupées : Elles ne sont pas des machines logiques parfaites ; elles peuvent être distraites par le contexte, tout comme les humains.
  2. Nous pouvons voir le piège : En mesurant la « surprisal », l'« attention » et l'« énergie », nous pouvons voir exactement quand et comment l'IA tombe dans l'illusion.
  3. Un mécanisme partagé : La partie de l'IA qui est confondue est la même partie qui l'aide à comprendre les histoires normales. Ce n'est pas un bug ; c'est une caractéristique de la manière dont ces systèmes (et nos cerveaux) fonctionnent.

L'essentiel

Cet article est comme la révélation d'un tour de magie. Il montre que lorsque vous donnez à une IA une histoire avec une distraction habile, elle ne se contente pas de calculer la réponse ; elle est « distraite » d'une manière qui imite la confusion humaine. En étudiant cela, nous apprenons que l'IA et le cerveau humain pourraient utiliser des raccourcis similaires pour traiter le langage, des raccourcis qui peuvent parfois nous égarer tous les deux.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →