Perfect Detection, Failed Control: The Geometry of Knowing vs. Steering in Language Models
本論文は、言語モデルにおいて、ある振る舞い(ハルシネーションなど)を最もよく検知する幾何学的方向が、それを制御する方向とは根本的に乖離していることを示し、検知が制御可能性を意味しないこと、およびこの「検知と介入のギャップ」が予測可能な制御性の指標ではなく、事前学習に由来する構造的な解離であることを明らかにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
言語モデル(この論文のAIのようなもの)を、非常に熟練しているが少し混乱しているシェフが働くキッチンとして想像してみてください。
この論文は、根本的な問いを投げかけています。もしシェフが料理の何が間違っているかを正確に理解していたとしても、単にそれを修正できるのでしょうか?
研究者たちは、驚くべき答えを見つけました。時には、シェフは完璧に理解していても、その手が全く別の方向へと縛られていることがあるのです。 彼らは、「これは偽物だ」と伝える「脳の信号」と、「止まって『いいえ』と言え」と伝える「手の信号」が、ほぼ完全に異なる方向を向いていることを発見しました。
以下に、比喩を用いた彼らの発見の解説をまとめます。
1. 2つのシナリオ:「簡単なケース」対「難しいケース」
研究者たちは、AIが「知ること」と「行うこと」がどのように関係しているかを見るために、2つの非常に異なるタスクでテストを行いました。
シナリオA:出力形式(「簡単なケース」)
- タスク: AIにリストを書かせます。コードブロック(コンピュータプログラムのようなもの)で囲むか、プレーンテキストとして書くかのどちらかです。
- 発見: ここでは、「知ること」は「行うこと」と同じです。
- 比喩: シェフが壁に一つのスイッチを持っていると考えてください。スイッチを切り替えると、キッチンの照明の色が変わり(モードの検出)、料理が正しい箱に入って出てきます(モードの制御)。この「スイッチ」と「光」は全く同じものです。AIの脳内では、「コードブロックを使うべきだ」ということを検出する方向は、実際にコードブロックを使うようにさせる方向と全く同じなのです。
シナリオB:ハルシネーション(「難しいケース」)
- タスク: AIに架空の場所について尋ねます(例:「ノルランディアの首都は何ですか?」)。
- 発見: ここでは、「知ること」は「行うこと」ではありません。
- 比喩: シェフが超高性能な煙感知器を持っていると考えてください。
- 検知器: 煙感知器は完璧です。架空のエンティティが現れた瞬間、「火事だ!」(あるいは「これは偽物だ!」)と叫びます。AIは「ノルランディア」が存在しないことを100%理解しています。
- 行動: しかし、「コンロを止める」ためのボタンは、部屋の反対側にあります。
- 結果: シェフは「火事だ!」と叫びますが(AIは偽物を検知している)、 「止まる」ボタンが全く別の方向にあるため、シェフは調理を続け、結局偽物の料理を提供してしまいます。
2. 問題の幾何学:「90度の回転」
論文では、これを測定するために幾何学を用いています。AIの脳を、何千もの方向を指せる懐中電灯がある巨大な部屋だと想像してください。
- 検出ビーム: この懐中電灯は偽のエンティティを照らし、「見つけたぞ!」と告げます。
- 制御ビーム: この懐中電灯は「拒絶」ボタンを照らします。
「簡単なケース」(フォーマット)では、これら2つの懐中電灯は全く同じ方向(差は0度)を向いています。
「ハルシネーション」のケースでは、これら2つの懐中電灯はほぼ反対方向(約83度の差があり、ほぼ直角)を向いています。
これらがこれほど離れているため、研究者がハルシネーションを止めるために「検出」の方向へAIを押し動かそうとしても、うまくいきませんでした。それはまるで、ドアのすぐ横にある壁を押してドアを開けようとするようなものでした。
3. なぜこれが起こるのか:「コピー&ペースト」の怪物
研究者たちは、なぜ信号がこれほど離れているのかを掘り下げました。彼らは、AIの脳内に無視するには強すぎる「怪物」がいることを見つけました。
- メカニズム: AIには、質問の中で最も重要な単語を回答にコピーするという癖があります。もし「ノルランディア」について尋ねられれば、AIの脳は自動的に回答の中に「ノルランディア」と書きたいと考えてしまいます。
- 葛藤: 「偽物検知」の信号は、「それを言うな」という小さく静かな囁きです。しかし、「コピー&ペースト」の信号は、「名前を書け!」という巨大で騒々しい叫び声です。
- 結果: AIはそれが偽物であることを分かっていても(検知器は完璧に機能していますが)、「コピー」ボタンが「ストップ」ボタンよりもずっと大きいため、「コピー&ペースト」の習慣が拒絶をかき消してしまいます。その結果、AIは自信満々に嘘の事実を作り上げてしまうのです。
4. 修正できるのか?:「15度の回転」
研究者たちは、新しい「ハンドル(操舵輪)」を作ることで、これを修正しようと試みました。
- アイデア: 「検出」の方向と「拒絶」の方向がほぼ直角であるため、彼らはその中間を狙うことにしました。
- 結果: 彼らは操舵の方向を、「拒絶」側に向かってわずか15度回転させました。
- 結果: これですべてが解決したわけではありませんが、大きな効果がありました。実在する質問に対して誤って回答を拒否することなく、架空の事実を捏造することを(13%から60%へと)大幅に減少させました。これは、路面の窪みに突っ込むのではなく、窪物を避けるためにステアリングを少し左に切るようなものです。
5. 大きな教訓:「知ること」は「操舵すること」を意味しない
この論文は、AIを制御しようとしているすべての人への警告となる重要な教訓を提示しています。
AIが「真実を知っている」方向を見つけられたとしても、その方向がAIに「真実を語らせる」方向であるとは限らないのです。
- 神話: 「『誠実さ』のベクトルを見つけ出し、それをAIに加算すれば、AIを誠実にする(正直にする)ことができる」という考え。
- 現実: フォーマットのような事柄については、これは機能します。しかし、深い知識(事実が偽物であることを知っていることなど)については、「知ること」の信号と「行うこと」の信号は別々の部屋にあります。「知る」ボタンを押したからといって、AIが嘘をつくのを止めることを期待してはいけません。
まとめ
この論文は、AIにおいて、「検知」と「制御」はしばしば別々のスキルであることを示しています。AIは完璧な探偵(何が偽物かを正確に知っている)になれますが、不適切な行動を止めることができない(嘘をつくのを止められない)下手な役者になることがあります。なぜなら、「知ること」と「行うこと」の脳信号が、ほぼ全く異なる方向を向いているからです。これを修正するには、単に「知る」信号を使うだけでは不十分であり、AIを正しい振る舞いへと促すために、少し異なる角度を見つけ出す必要があるのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。