← 最新の論文
💬 NLP

Localizing Anchoring Pathways in Language Models

本論文は、7B–8B規模のQwenおよびLlamaモデルにおけるアンカリング効果の内部メカニズムを調査し、エッジレベルの属性特定手法がノードレベルの手法よりも関連する決定シグナルをより正確に局在化させること、および、これらの経路はモデル内のアンカー方向間では一貫しているものの、ベースモデルとインストラクションチューニング済みモデルの間では大きく変化することを明らかにしている。

原著者: Hillary N. Owusu, Sarah Wiegreffe, Naomi H. Feldman

公開日 2026-06-12
📖 1 分で読めます☕ さくっと読める

原著者: Hillary N. Owusu, Sarah Wiegreffe, Naomi H. Feldman

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

大規模言語モデル(LLM)を、非常に賢いが少し騙されやすい「名探偵」だと想像してみてください。あなたがその探偵に謎解きを出し、同時に、会話の中に全く無関係な数字を紛れ込ませるとします。例えば、「ちなみに、宝くじの当選番号は15だったよ」と言い添えてから、「月が地球を公転するのに何日かかる?」と尋ねるような具合です。

たとえ探偵が「答えは27日である」と知っていたとしても、その無関係な「15」という数字のせいで、答えが15の方へ引き寄せられてしまうかもしれません。これを**アンカリング(係留)**と呼びます。これは、無関係な数字が判断を特定の方向に引き寄せてしまう認知バイアスのことです。

この論文は、機械工学のチームがその探偵を分解し、その脳の「どこで」その「騙されやすさ」が発生しているのかを正確に突き止めようとする試みのようなものです。彼らは、**「おい、あの無関係な数字が重要だぞ!」という信号を運んでいるのは、コンピュータ内の具体的にどの電線とスイッチなのか?**を知りたいのです。

以下に、彼らがどのように行い、何を見つけたのかを分かりやすく説明します。

1. セットアップ:制御されたゲーム

探偵に長いエッセイを書かせる代わりに、研究者たちはテストを選択式のゲームに変えました。

  • 質問: 「月の公転周期は?」 (正解:27日)
  • 罠: 数字を含む文章を付け加えます。これには「低いアンカー」(15)または「高いアンカー」(49)のいずれかが使われます。
  • 目的: 単にその数字が言及されただけで、モデルの確信度がどれほど間違った答え(15または49)へとシフトしたかを測定しました。

彼らは、人間と同じように、モデルも実際に騙されることを確認しました。

2. 手法:配線を辿る

「騙されやすさの回路」を見つけるために、研究者たちは**回路局在化(Circuit Localization)**という手法を用いました。

  • 比喩: モデルを、数百万の道路(エッジ)が近隣地域(ノード)を繋いでいる巨大な都市だと想像してください。
  • 従来の方法: 以前の研究者は、交通量が多い場所を探すために、ノード(構成要素)という「近隣地域全体」を見ていました。
  • 新しい方法: この論文では、**個々の道路(エッジ)**を見ることがはるかに優れていることを見出しました。それは、問題が「ダウンタウン」という地域全体にあるのではなく、具体的には「ダウンタウンと郊外を繋ぐたった一つの橋」にあると気づくようなものです。

彼らは、エッジレベルの手法(接続部分を見る方法)が、ノードレベルの手法(構成要素単体を見る方法)よりも、バイアスを見つける上ではるかに正確であることを発見しました。「騙されやすさ」は、特定の脳の部位に固着しているのではなく、情報が移動する**経路(パスウェイ)**の中に存在するのです。

3. 知見:マップが明らかにしたこと

A. 「低い」アンカーと「高い」アンカーは同じ道を共有している

モデルが低い数字(15)によって騙されたとしても、高い数字(49)によって騙されたとしても、交通量はほぼ全く同じ道路を通っていました。

  • 比喩: それは川のようなものです。水が速く流れていても(高いアンカー)、あるいはゆっくり流れていても(低いアンカー)、やはり同じ川床を通ります。モデルには、数字が大きくても小さくても影響を受ける、共通の「感受性経路」が存在します。

B. 「ベースモデル」対「指示チューニング済みモデル」

研究者たちは、同じモデルの2つのバージョンをテストしました:

  1. ベースモデル: 未学習の、生の探偵。
  2. 指示チューニング済みモデル: ルールに従い、礼儀正しく回答するように訓練された探偵。

驚きの事実: 両者は同じ一般的な「川床」(ネットワークの同じ層)を使用していますが、最も重要な「特定の道路」は、トレーニング後に変化しました。

  • 比喩: ドライバーに新しいルートを教える場面を想像してください。彼らは依然として同じ街の中を運転しますが、目的地に到達するために通る具体的な通りは変わっています。「指示チューニング(学習)」によって、最も重要な接続が再配線されたのです。生のモデルで完璧に機能していた回路が、訓練後のモデルでは必ずしも機能するとは限りませんでした。

4. 全体像

この論文は、アンカリングが単なるモデルの知識の「バグ」ではないことを証明しています。それは、無関係な数字がモデルの意思決定経路をハイジャックするという、特定の、機械的なプロセスなのです。

  • 重要なポイント: バイアスは、孤立したパーツではなく、**接続(エッジ)**を通じて伝わります。
  • 重要なポイント: 低いアンカーと高いアンカーは同じ「高速道路」を共有していますが、モデルに新しいルールを教えること(指示チューニング)によって、その高速道路のどの「出口」が最も重要になるかが変わります。

要約すると、研究者たちはAIの内部にある「騙されやすさ」をマッピングし、モデルがランダムな数字に気を取られたときに、どのワイヤが信号を運んでいるのかを明らかにしました。これにより、モデルが単に「間違っている」のではなく、自身を迷わせる特定の、予測可能な経路を辿っていることが分かったのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →