← Derniers articles
💬 NLP

Hallucination as Commitment Failure: Larger LLMs Misfire Despite Knowing the Answer

Ce papier remet en cause l'idée que les hallucinations proviennent uniquement d'un manque de connaissances, révélant que les grands LLMs adaptés par instruction hallucinent souvent parce qu'ils échouent à s'engager sur un concept correct déjà présent dans leur distribution de probabilité, dispersant au contraire la masse de probabilité sur des alternatives en raison d'un mécanisme d'affinement dépendant de l'échelle qui génère à la fois de l'utilité et des erreurs confiantes.

Auteurs originaux : Jewon Yeom, Jaewon Sok, Heejun Kim, Seonghyeon Park, Jeongjae Park, Taesup Kim

Publié 2026-05-22
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Jewon Yeom, Jaewon Sok, Heejun Kim, Seonghyeon Park, Jeongjae Park, Taesup Kim

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

L'Idée Principale : Ce n'est pas une question de « ne pas savoir »

La plupart des gens pensent que les hallucinations de l'IA (quand une IA invente des choses) se produisent parce que l'IA ne sait tout simplement pas la réponse. L'idée est : Si l'IA connaît le fait, elle dit la vérité. Si elle ne le connaît pas, elle devine.

Ce papier soutient que c'est faux.

Les chercheurs ont découvert que souvent, l'IA connaît la réponse. Elle possède l'information correcte « dans sa tête » au moment même où elle commence à parler. Cependant, elle choisit tout de même de dire la mauvaise chose. Ils appellent cela un « échec de l'engagement ».

L'Analogie : Le Chef Nervous

Imaginez un chef très talentueux (l'IA) à qui l'on demande : « Quelle est la capitale de la France ? »

  1. L'Ancienne Théorie : Si le chef ne connaît pas la réponse, il devine « Londres ». S'il la connaît, il dit « Paris ».
  2. La Nouvelle Théorie (Ce Papier) : Le chef sait que la réponse est Paris. En fait, il pense à « Paris » si intensément que son cerveau bourdonne du mot. Mais, parce qu'il pense à « Paris » de tant de façons différentes à la fois (par exemple, « Paris », « paris », « la ville lumière », « la capitale de la France »), son cerveau se confond.
    • Il a un fort sentiment pour « Paris », mais il est réparti sur toutes ces différentes phrases.
    • En même temps, il a une pensée très précise et concentrée sur « Londres » (peut-être parce qu'il a vu une photo du Big Ben plus tôt).
    • Même si le sentiment « Paris » est globalement plus fort, la pensée « Londres » est si précise et concentrée qu'elle gagne la course vers sa bouche. Il lance « Londres » avec assurance, même s'il savait que c'était Paris.

Comment Ils Ont Découvert Cela

Les chercheurs ont examiné comment les modèles d'IA « pensent » avant de parler. Ils se sont concentrés sur le tout premier mot généré par l'IA (l'étape de « l'engagement »).

Ils ont introduit une nouvelle façon de mesurer ce que l'IA sait, appelée Masse de Probabilité Sémantique.

  • Ancienne Méthode : L'IA a-t-elle choisi le mot exactement correct ? (Par exemple, a-t-elle dit « Paris » ?)
  • Nouvelle Méthode : L'IA avait-elle un fort sentiment concernant le concept de Paris, même s'il était réparti entre « Paris », « paris » et « la ville lumière » ?

Les Résultats :

  • Ils ont testé de nombreux modèles d'IA (du plus petit au plus énorme).
  • Ils ont découvert que 16 % à 47 % du temps où l'IA commettait une erreur, elle avait en réalité un fort « sentiment » pour la bonne réponse.
  • La Surprise : Plus le modèle d'IA était grand, plus cela se produisait souvent. Les modèles plus grands ne savaient pas seulement plus ; ils commettaient davantage de ces types spécifiques d'erreurs où ils connaissaient la réponse mais la donnaient tout de même incorrectement.

Pourquoi Cela Se Produit-il ? (L'Effet de « Raffinement »)

Le papier suggère que le Réglage par Instruction (l'entraînement de l'IA à être utile et à suivre les règles) modifie la façon dont l'IA pense.

Imaginez le cerveau de l'IA comme un paysage de collines et de vallées.

  • Avant l'Entraînement : Les collines sont plates et floues. L'IA est incertaine.
  • Après l'Entraînement : L'IA devient très décidée. Elle transforme ses pensées en pics nets et hauts.
    • Lorsque l'IA a raison, le pic pour la bonne réponse est si haut et net qu'il gagne facilement.
    • Mais, parfois l'IA se confond. La réponse « correcte » est divisée en plusieurs petites collines plates (car elle pense à « Paris », « paris », « France », etc.). Pendant ce temps, la réponse « incorrecte » est un seul pic unique, incroyablement net et haut.
    • Le processus de prise de décision de l'IA est comme une boule roulant sur une colline. Elle roule toujours vers le point le plus net. Même si le côté « correct » a plus de « surface de colline » au total, le côté « incorrect » a le sommet le plus net, donc la boule roule là-bas.

Les Deux Types d'Erreurs

Les chercheurs ont identifié deux façons dont cet « échec de l'engagement » se produit :

  1. Le Mauvais Premier Mot : L'IA commence la phrase avec le mauvais mot immédiatement (par exemple, dire « Moscou » au lieu de « Paris »), même si elle avait un fort sentiment pour Paris.
  2. Le Mauvais Chemin : L'IA commence avec le bon mot (par exemple, « Paris ») mais dévie immédiatement dans les mots suivants, transformant « Paris » en une histoire sur une autre ville.

La « Taxe d'Alignement »

Le papier conclut que ceci est un effet secondaire de rendre les modèles d'IA « utiles ».

  • Pour rendre une IA confiante et rapide, nous l'entraînons à être très décidée (pics nets).
  • Cela fonctionne très bien lorsque l'IA a raison.
  • Mais lorsque l'IA est légèrement confuse, cette même « détermination » la rend confiante et erronée. Elle n'hésite pas à choisir la mauvaise réponse car son cerveau est si bon pour choisir l'option « la plus nette », même si cette option est incorrecte.

Résumé

  • Les hallucinations ne sont pas toujours de l'ignorance. Parfois, l'IA connaît la réponse mais échoue à « s'engager » envers elle.
  • Les modèles plus grands ne sont pas parfaits. À mesure que les modèles grandissent, ils deviennent meilleurs pour être décidés, ce qui, ironiquement, les rend plus sujets à être confiants et erronés.
  • Le problème est la distribution. L'IA étale trop finement sa « connaissance » de la bonne réponse sur de nombreuses variations, tandis que la mauvaise réponse concentre tout son focus en un seul point net. L'IA choisit le point net, pas la bonne réponse.

Le papier suggère que pour résoudre ce problème, nous pourrions devoir apprendre à l'IA à regarder le « concept entier » (toutes les façons de dire « Paris ») plutôt que de simplement choisir le mot unique le plus net.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →