← 最新の論文
💬 NLP

Hallucination as Commitment Failure: Larger LLMs Misfire Despite Knowing the Answer

本論文は、幻覚が欠落した知識にのみ起因するという見解に挑戦し、大規模な指示調整済みLLM が幻覚を起こすのは、確率分布内に既に存在する正しい概念にコミットできず、有益さと確信ある誤りの両方を駆動する規模依存の鋭化メカニズムにより、確率質量を代替案に分散させてしまうためであることを明らかにする。

原著者: Jewon Yeom, Jaewon Sok, Heejun Kim, Seonghyeon Park, Jeongjae Park, Taesup Kim

公開日 2026-05-22
📖 1 分で読めます☕ さくっと読める

原著者: Jewon Yeom, Jaewon Sok, Heejun Kim, Seonghyeon Park, Jeongjae Park, Taesup Kim

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

「ハルシネーションはコミットメントの失敗である」という論文の解説を、平易な言葉と比喩を用いて以下に示します。

大きな考え方:それは「知らない」ことではない

多くの人は、AI のハルシネーション(AI が事実を捏造すること)は、AI が単に答えを知らないために起こると考えています。その考え方は次のようなものです:AI が事実を知っていれば真実を語り、知らなければ推測する。

しかし、この論文はその考え方が誤りであると主張しています。

研究者たちは、多くの場合、AI は答えを知っていることを発見しました。AI は話し始める瞬間、すでに頭の中に正しい情報を持っています。しかし、それでも間違ったことを言うことを選択します。彼らはこれを**「コミットメントの失敗」**と呼びます。

比喩:神経質なシェフ

「フランスの首都は何ですか?」と尋ねられた、非常に才能あるシェフ(AI)を想像してください。

  1. 古い理論: シェフが答えを知らなければ、「ロンドン」と推測します。知っているなら、「パリ」と答えます。
  2. 新しい理論(この論文): シェフは答えが「パリ」であることを知っています。実際、彼らは「パリ」という言葉に脳が buzzing(騒がしく)なるほど熱心に考えています。しかし、「パリ」という言葉を「Paris」、「paris」、「光の都」、「フランスの首都」など、さまざまな形で同時に考えているため、脳が混乱してしまいます。
    • 「パリ」に対する強い感覚を持っていますが、それはそれらすべての異なるフレーズに分散してしまっています。
    • 同時に、「ロンドン」についての非常に鋭く、集中した思考を持っています(以前、ビッグベンの写真を見たからかもしれません)。
    • 「パリ」の感覚は全体的には強いものの、「ロンドン」の思考はあまりに鋭く集中しているため、口に出すまでの競争に勝ちます。彼らは「パリ」だと知っていながら、自信を持って「ロンドン」と言い放ってしまいます。

これをどのように発見したか

研究者たちは、AI が話す前の「思考」のあり方を調べました。彼らは AI が生成する最初の単語(「コミットメントのステップ」)に焦点を当てました。

彼らは、AI が何を「知っている」かを測定する新しい方法、**意味的確率質量(Semantic Probability Mass)**を導入しました。

  • 古い方法: AI は正確な単語を選びましたか?(例:「パリ」と言いましたか?)
  • 新しい方法: AI は「パリ」、「paris」、「光の都」といった言葉に分割されていたとしても、「パリ」という概念について強い感覚を持っていたでしょうか?

発見:

  • 彼らは大小さまざまな多くの AI モデルをテストしました。
  • AI が間違いを犯した時間の**16% から 47%**において、実際には正解に対する強い「感覚」を持っていたことがわかりました。
  • 意外な事実: AI モデルが大きいほど、この現象はより頻繁に起こりました。大きなモデルは単に多くを知っているだけでなく、答えを知っていながらそれでも間違ってしまう、この特定の種類の間違いをより多く犯しました。

なぜこれが起こるのか?(「鋭化」効果)

この論文は、指示チューニング(AI を有用にし、ルールに従わせるための訓練)が AI の考え方をどのように変えるかを示唆しています。

AI の脳を丘陵地帯の風景だと想像してください。

  • 訓練前: 丘は平らでぼんやりとしています。AI は不確実です。
  • 訓練後: AI は非常に決定的になります。その思考を鋭く、高いスパイクに変えます。
    • AI が正しい場合、正解のスパイクはあまりに高く鋭いため、簡単に勝ちます。
    • しかし、AI が混乱することがあります。「正解」は「パリ」、「paris」、「フランス」など、多くの小さな平らな丘に分割されてしまいます(分散してしまいます)。一方、「不正解」は、単一の、信じられないほど鋭く高いスパイクになります。
    • AI の意思決定プロセスは、丘を転がるボールのようなものです。それは常に最も鋭い点に向かって転がります。「正解」側にはより多くの「丘の面積」があっても、「不正解」側には最も鋭い頂点があるため、ボールはそちらへ転がります。

2 種類の間違い

研究者たちは、この「コミットメントの失敗」が起きる 2 つの方法を発見しました。

  1. 最初の単語が間違っている: AI は文を「パリ」に対する強い感覚を持っていながら、即座に間違った単語(例:「モスクワ」)で始めてしまいます。
  2. 間違った道へ進む: AI は正しい単語(例:「パリ」)で始めますが、その直後の数語ですぐに軌道から外れ、「パリ」を別の都市に関する物語に変えてしまいます。

「アライメント税」

この論文は、これが AI モデルを「有用にする」ことの副作用であると結論付けています。

  • AI を自信があり、迅速にするために、非常に決定的(鋭いスパイク)になるよう訓練します。
  • これは AI が正しいときは非常にうまく機能します。
  • しかし、AI がわずかに混乱している場合、その同じ「決定的さ」が、自信を持って間違える原因となります。AI は間違った答えを選ぶことを躊躇しません。なぜなら、その脳は、たとえその選択肢が誤っていても、「最も鋭い」選択肢を選ぶのが非常に得意だからです。

まとめ

  • ハルシネーションは常に無知ではありません。 時には AI は答えを知っていますが、それに「コミット」することに失敗します。
  • 大きなモデルは完璧ではありません。 モデルが大きくなるにつれて、決定的になる能力が高まりますが、皮肉なことに、これにより自信を持って間違える傾向が強まります。
  • 問題は分布にあります。 AI は正解の「知識」を、多くのバリエーションに薄く分散させてしまいます。一方、不正解は 1 つの鋭い場所にすべての焦点を当てます。AI は正解ではなく、その鋭い場所を選びます。

この論文は、これを修正するためには、単一の最も鋭い単語を選ぶのではなく、AI に「全体概念」(「パリ」と言うすべての方法)を見るよう教える必要があると示唆しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →