← 最新の論文
💬 NLP

When Context Misleads: Surprisal, Energy and Attention Entropy as Metrics of Coherence Illusions in LLMs

本論文は、オランダ語の言語モデルが人間のような一貫性の錯覚を示すことを実証しており、そこでは、妨害となる文脈が不整合な継続のサプライザルを減少させる一方で、アテンションのエントロピーおよびエネルギー指標が、これらの効果を駆動する共通のメカニズムを明らかにしている。

原著者: Ece Takmaz, Nitin Kumar, Li Kloostra, Jakub Dotlacil

公開日 2026-06-23
📖 1 分で読めます☕ さくっと読める

原著者: Ece Takmaz, Nitin Kumar, Li Kloostra, Jakub Dotlacil

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ビッグアイデア:あなたの脳(とAI)が騙されるとき

物語を読んでいる場面を想像してみてください。突然、**「また(again)」**という言葉が出てきました。すると、あなたの脳は即座に物語の最初へと遡り、「何が」起きたのかを「また」繰り返しているのかを探し始めます。

通常、これは完璧に機能します。しかし、時としてその物語は「仕掛け」になっています。そこには「ディストラクター(注意をそらすもの)」が存在します。それは、以前に言及された似たような出来事ですが、実際には文脈に合わないものの、脳を騙すには十分すぎるほど似ているものです。

論文の発見:
研究者たちは、チャットボットなどの背後にあるAIの脳である「大規模言語モデル(LLM)」も、これと同じ罠に陥ることを発見しました。人間と同様に、AIも混乱を招くような物語の中で、一致するディストラクターを目にすると、混乱し、本来は成立しないはずの物語を「筋が通っている」と誤認してしまうのです。彼らはこれを**「コヒーレンス・イリュージョン(一貫性の錯覚)」**と呼んでいます。


実験:「フルーツボウル」テスト

これを検証するために、研究者たちはオランダ語の物語(人間がオランダ語を読む際のデータがあるため)を使用しました。以下は簡略化されたセットアップです。

  1. 設定: メガンというキャラクターがお腹を空かせています。
  2. ひねり: 物語の中で2つのことが言及されます。
    • ターゲット: メガンは黄色いリンゴを食べました。
    • ディストラクター: 彼女は緑色の梨は食べませんでした。
  3. 罠: 次の文章でこう続きます。「翌朝、メガンはまたを食べた。」

人間の反応:
人間の読者は「また」と「梨」という言葉を目にします。物語では「梨を食べなかった」と言われているため、脳は混乱します。しかし、「梨」が以前に(否定されてはいるものの)言及されていたため、脳は時として、「ああ、彼女はまた梨を食べたんだな!」と勘違いしてしまい、滑り落ちてしまいます。これが**「錯覚」**です。

AIの反応:
研究者たちは、様々なAIモデルにこれらの物語を読ませました。その結果、AIは人間と全く同じ挙動を示すことが分かりました。

  • 物語が完全に論理的であれば、AIは落ち着いています。
  • 物語が不合理(仕掛けがある状態)だと、AIは「驚き(技術的な用語で『予想外であること』)」を感じます。
  • 決定的な点: その仕掛けに一致するディストラクター(以前に梨に触れていること)が含まれていると、AIの驚きは軽減されました。AIは、混乱した物語が実はスムーズであるかのように錯覚し、騙されてしまったのです。

「仕掛け」をどのように測定したか

研究者たちは、単にAIが混乱しているかどうかを尋ねたのではなく、AIがどのように考えているのかを、その「脳」の内部を覗き込むことで調べました。彼らは3つの特別なツールを使用しました。

1. Surprisal(サプライザル:驚きの度合い/「ハッとする」メーター)

Surprisalを「ハッとするメーター」と考えてください。

  • 完璧に意味が通じる文章を読んでいるとき、あなたは「ハッ」としません。メーターは低くなります。
  • 奇妙な文章を読んだとき、あなたは「ハッ」とします。メーターは高くなります。
  • 発見: AIが仕掛けのある物語を読んだとき、AIは「ハッ」としました(高いサプライザル)。しかし、仕掛けの物語に(結末と一致する)ディストラクターが含まれていると、AIの「ハッ」とする度合いは減少しました。AIは、物語がスムーズであると思い込まされ、騙されたのです。

2. Attention Entropy(アテンション・エントロピー/「フォーカス」ライト)

AIが考えている単語に対して、懐中電灯を照らしていると想像してください。

  • 低エントロピー(集中): 懐中電灯の光は鋭いビームです。AIはある特定の単語を注視しています。
  • 高エントロピー(拡散): 懐中電灯の光は広く、ぼやけたビームです。AIは多くの単語を一度に見ようとしており、どの単語が重要なのか確信が持てていません。
  • 発見: AIが騙されたとき、この懐中電灯はぼやけていました(高いエントロピー)。ディストラクターによって混乱したため、AIは間違った単語を見ていたのです。この「ぼやけたフォーカス」の原因となっているAIの特定のパーツをオフにすることで、研究者たちは、まさにこれらのパーツが騙されているのだということを突き止めました。

3. Energy(エネルギー/「磁石」テスト)

これは研究者が物理学から借りてきた、新しいツールです。AIのメモリを、丘と谷がある風景だと想像してください。

  • 低エネルギー: AIは、現在の単語が過去の内容と完璧にフィットする「谷」を見つけます。それはまるで、磁石がカチッと吸い付くような感覚です。
  • 高エネルギー: AIは「丘」の上で立ち往生しています。単語がうまく適合せず、AIは理解しようと苦戦しています。
  • 発見: ディストラクターによってAIが騙されたとき、この「エネルギー」が低下しました。たとえ実際には合っていなくても、まるで単語が完璧にフィットしているかのように感じられたのです。これにより、AIが人間と同じ錯覚(false sense of connection)を経験していることが確認されました。

なぜこれが重要なのか(論文による説明)

この論文は、AIを修理したり病気を治したりすることを目的としているのではありません。代わりに、非常に具体的で重要な点を指摘しています。

AIと人間は、似たような「バグ(不具合)」を共有している。
人間もAIも、物語の記憶を呼び出すプロセス(メモリ・リトリーバル)に依存しています。私たちが以前何が起きたかを思い出そうとする際、私たちは手がかりを使います。もし手がかりが、答えと似ている場合(たとえそれが間違いであっても)、私たちの脳(そしてAIの数学的処理)はその手がかりにハイジャックされてしまうのです。

研究者たちは以下のことを示しました:

  1. AIは騙される: AIは完璧な論理機械ではありません。人間と同様に、文脈によって騙されることがあります。
  2. 仕掛けを見抜ける: 「サプライザル」「アテンション」「エネルギー」を測定することで、AIがいつ、どのようにして錯覚に陥っているのかを正確に見ることができます。
  3. 共通のメカニズム: AIを混乱させている部分は、通常の物語を理解するのに役立っている部分でもあります。これは「バグ」ではなく、これらのシステム(および人間の脳)が機能するための「機能(フィーチャー)」なのです。

結論

この論文は、手品の見破り方に似ています。巧妙なディストラクション(注意をそらすもの)を含む物語を与えたとき、AIは単に答えを計算しているのではなく、人間が感じる混乱と同じように「注意を逸らされて」しまうことを示しています。これを研究することで、AIと人間の脳が、時には私たち両方を迷わせることもある「ショートカット(近道)」を使って、言語を処理している可能性があることを学べるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →