← 最新の論文
💬 NLP

How Context Shapes Truth: Geometric Transformations of Statement-level Truth Representations in LLMs

本論文は、文脈が大規模言語モデル内の真理ベクトルをどのように変容させるかに関する初の幾何学的特性化を提供し、文脈が一般に真理表現の大きさを増幅させる一方で、より大規模なモデルは、大きさの違いではなく活性化空間における方向の変化を通じて、関連する文脈と矛盾する文脈を区別していることを明らかにしている。

原著者: Shivam Adarsh, Maria Maistro, Christina Lioma

公開日 2026-06-09
📖 1 分で読めます☕ さくっと読める

原著者: Shivam Adarsh, Maria Maistro, Christina Lioma

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

大規模言語モデル(LLM)を、あらゆる思考や情報が異なる本として表現されている、巨大な多層階の図書館だと想像してみてください。この図書館の中では、ある言明に関する「真実」は言葉として書かれているのではなく、特定の方向を指す特定の矢印として保存されています。

モデルがある言明を「真実」だと考えているなら、矢印はある方向を指します。もし「偽」だと考えているなら、矢印は反対方向を指します。あなたが共有した論文は、モデルに回答させる前に、追加の情報(コンテキスト)を読ませたとき、これらの「真実の矢印」に何が起こるのかを調査しています。

以下に、その研究結果を簡単な比喩を用いて解説します。

1. 矢印の3段階の旅

研究者たちは、これらの真実の矢印が図書館の異なる「フロア(層)」をどのように移動していくかを観察しました。彼らは一貫した3段階のパターンを発見しました。

  • 地下室(初期レイヤー): モデルが言明を読み始めたとき、コンテキストを含む「真実の矢印」とコンテキストを含まない「真実の矢印」は、全く異なる方向を向いています。それらは背中合わせに立っている二人の人のように、**直交(オーソゴナル)**しています(90度の角度になっています)。モデルはまだ生の単語を処理している段階であり、追加のコンテキストによって真実が理解されたわけではありません。
  • メインホール(中間レイヤー): 情報が上に進むにつれて、矢印は突然整列し始めます。それらは収束し、ほぼ同じ方向を指すようになります。これがモデルが「理解した」瞬間です。モデルは意味を処理しており、追加のコンテキストがあろうとなかろうと、核となる「真実」の概念は同様に表現されます。
  • 屋根裏部屋(後半レイヤー): 最終的なフロアでは、興味深いことが起こります。矢印が完全に整列したままの場合もあれば、再び離れ始める場合もあります。これは主に、追加のコンテキストがモデルがすでに「知っている」ことと矛盾する場合に起こります。それは、モデルが内部で議論をしているようなものであり、どちらの情報を信じるべきか決めるために、矢印が揺れたり方向が変わったりします。

2. 音量を上げる(大きさ/マグニチュード)

研究者たちは、これらの矢印の長さも測定しました。

  • 発見: コンテキストを加えると、一般的に矢印は長くなります。
  • 比喩: 真実の言明と偽の言釈の違いは、部屋の中に立っている二人の間の距離のようなものです。コンテキストがないとき、彼らは5フィート離れているかもしれません。コンテキストを加えると、モデルは彼らをさらに遠ざけ、おそらく10フィートにします。「真実と嘘の分離」はより明確になり、判別しやすくなります。コンテキストは、正解と不正解の違いをより鮮明にするスポットライトのような役割を果たします。

3. 大きなモデル vs 小さなモデル:異なる戦略

この研究は、大きなモデルと小さなモデルが、この「追加情報」をどのように扱うかについて、ナビゲーターの違いのように発見しました。

  • 大きなモデル(例:LLaMA, Mistral): これらのモデルは、巨大な地図を持つ熟練の地図製作者のようです。関連するコンテキストを得ると、彼らは矢印の方向を変えます。彼らは、新しい、より正確な角度に向かって物理的に向きを変えます。彼らは、ニュアンスを理解したことを示すために、脳内の余白を利用して、全く新しい方向を指します。
  • 小さなモデル(例:Qwen, SmolLM): これらのモデルは、より小さな地図を持っています。彼らは、他のアイデアにぶつかることなく矢印の方向を変える余裕が常にあります。代わりに、彼らは矢印を長くすることで、信号を「増幅」し、方向を変えるのではなく、コンテキストを理解したことを示します。

4. 良いコンテキスト vs ランダムなノイズ

研究者たちは、コンテキストが実際に有用な場合と、それが単なるランダムなデタラメ(ランダムな単語のリストや、シャッフルされた段落など)である場合の違いをテストしました。

  • 結果: 関連性のある、役立つコンテキストは、ランダムなノイズよりもモデルの「真実の矢印」に大きな反応を引き起こします。
  • 例外: コンテキストが矛盾している(モデルの学習内容に反することを示している)場合、それは最も大きな幾何学的な変化を引き起こします。それはモデルが衝撃を受けているようなもので、二つの相反する事実を調和させなければならないため、矢印は激しく揺れ動きます。
  • 法的テキストの問題: 興味深いことに、コンテキストが非常に複雑でテクニカルな法的テキストであった場合、モデルはそれをランダムなノイズと区別するのに苦労しました。「矢印」はほとんど動きませんでした。言語が非常に高密度で専門的すぎると、モデルはそれが役立つ手がかりなのか、ランダムな文章なのかを判別できないようです。

まとめ

要約すると、この論文は、LLMがコンテキスト付きの言明を読んだとき、単に言葉を「読む」だけでなく、内部的な思考の幾何学的形状を物理的に作り変えていることを示しています。

  1. 初期段階では、思考は混乱しており、あらゆる方向を向いています。
  2. 中間段階では、真実を見つけるために整列します。
  3. 後半段階では、「真実の矢印」は長くなり(確信が高まり)、あるいは(コンテキストがトリッキーな場合は)方向が変化します。
  4. 大きなモデルは、理解を示すために矢印の方向を変え、小さなモデルは矢印の長さを変えます。

これは、「AIにおける真実」とは静的なスイッチではなく、AIが何を読んでいるかによって変化するダイナミックな形状であることを理解する助けとなります。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →