LLMs Know the Constraint But Do Not Use It: Activation Bottlenecks in Pragmatic Constraint Reasoning
本論文は、LLMが暗黙的な実現可能性の制約を遵守できない理由は、知識の欠如ではなく、符号化された制約が意思決定の過程で一貫して活性化されないというルーティングのボトルネックに起因するものであり、これはプロンプトベースの介入では克服できないが、標的を絞った活性化パッチ(activation patching)によって部分的に修復可能であることを論じている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、ロボットに意思決定の方法を教えようとしていると想像してください。あなたは、そのロボットが世界のほとんどすべてを知ることができるように、膨大な量の本のライブラリを与えました。しかし、その後、あなたはトリッキーな質問を投げかけます。「私は車を洗いたいと思っています。洗車場は50メートル先にあります。歩くべきでしょうか、それとも車で行くべきでしょうか?」人間なら即座に、「待てよ、もし車で行くなら、そこに行くための車が必要だ!」と気づくでしょう。しかし、このロボットは、車に関するあらゆる本を読んできたにもかかわらず、自信満々に「車で行く!」と言うかもしれません。なぜなら、ロボットは「車」という言葉と「運転する」という言葉を見つけ、「おっ、一致しているぞ!」と考えてしまうからです。
この論文は、人工知能の特定の領域である**大規模言語モデル(LLM)**について掘り下げています。これらは、チャットをし、物語を書き、問題を解決する、非常に賢いAIシステムです。研究者たちが解こうとしている大きな謎は、「知っていること」と「それを使うこと」の違いです。これは、ゲームのルールブックを丸暗記しているものの、実際にプレイしているときは、ボード上のキラキラした駒に気を取られてルールを忘れてしまう学生のようなものです。科学者たちは以前から、これらのAIは論理の隠れたルールを「知って」はいるものの、状況がトリッキーになると、それを適用することに失敗するという疑念を抱いてきました。AIを、医師を助けたり車を運転したりといった現実世界で安全かつ信頼できるものにしたいのであれば、AIが本当に考えているのか、それとも単に表面的な手がかりに基づいて推測しているだけなのかを知る必要があります。
この研究の背後にいる研究者たちは、AIがこれらの間違いを犯すとき、一体何が起きているのかを正確に突き止めるために、14種類の異なるAIモデルを使って探偵のような調査を行いました。彼らは「カルテット(四重奏)」と呼ばれるシナリオを設定しました。同じ物語の4つのバージョンを想像してみてください。一つは、隠れたルールが存在する場合(車が欠けている)、一つは、ルールが取り除かれた場合(車が魔法のように存在する)、一つは、ルールが声高らかに宣言された場合(「車が欠けていることを忘れないで!」)、そしてもう一つは、AIが長い物語を好むだけかどうかを確認するために、同じ長さの無関係な文章を追加した場合です。
ここで彼らが発見したひねりは、AIは愚かなのではなく、ただ注意が逸らされているだけだということです。しかしより重要なことに、研究者たちは、AIの「注意の逸れ方」には2つの全く異なるパターンがあることを発見しました。
研究者がAIの「脳」(内部のデータ層)を覗き込んだとき、AIはそのルールを「知って」いることがわかりました。AIの内部的な思考を読み取り、「はい、車が欠けています!」と88%から94%の精度で判定できるシンプルな検出器を作ることができたのです。知識は、まるで机の上に置かれた事実のように、モデルの処理の中ほどに確かに存在していました。
しかし問題は、最終的な決定を下すタイミングで、AIがその知識を使わないことです。それは、道路が封鎖されていることを知っているのに、ドライバー(AIの意思決定部分)がそのGPSを無視して走り続けるようなものです。研究者たちはこれを**ルーティング問題(経路選択の問題)**と呼んでいます。情報は存在するのですが、答えへと至る経路が塞がれているか、無視されているのです。
決定的なことに、彼らは失敗の仕方が異なる2種類のロボットを発見しました。
- 「過剰反応型」のロボット: 一部のモデル(Llama-4やClaude Opusなど)は、あまりに安全であろうとするあまり、制約が存在しない場合でも、制約の強い答え(例:「歩く」)を適用してしまいます。物語から車を取り除いたとしても、彼らは「安全な」答えに偏っているため、依然として「歩く」と言います。彼らはルールを知っていますが、ルールを「オフ」にすることができないため、存在しないルールを適用して論理テストに失敗します。
- 「反応不足型」のロボット: 他のモデル(GPT-OSSなど)は、ルールが存在しているときでさえ、そのルールを適用することに失敗します。彼らは車が欠けていることを見ていますが、それでも「車で行く」と言います。彼らはルールが存在することを知っていますが、内部の配線があまりに壊れているため、その知識が意思決定ボタンにたどり着けないのです。
彼らはこれを「アクティベーション・パッチング」と呼ばれる手法でテストしました。想像してみてください、もしあなたが、AIがルールを「覚えている」瞬間の「思考」を取り出し、それをルールを「忘れている」瞬間に直接貼り付けることができたとしたらどうなるでしょうか?バランスの取れたモデル(Qwen3-14Bなど)の場合、この魔法の貼り付けは完璧に機能しました!AIは突然正解を導き出し、知識はそこにあり、ただ答えに到達するための「押し」が必要だっただけであることを証明しました。しかし、反応不足型のモデルでは、貼り付けは効果がありませんでした。たとえルールを知っていたとしても、内部の配線が壊れているため、その知識が意思決定ボタンに到達することを妨げていたのです。(注:研究者はこのパッチングを「過剰反応型」のグループに対しては行っていないため、貼り付けが彼らを修正できるかどうかは不明です)。
また、彼らは「ステップ・バイ・ステップで考えて」や「前提条件をリストアップして」といった、人々がAIの間違いを直そうとする際によく使う手法についてもテストしました。結果は驚くべきものでした。これらのテクニックはどれも問題を解決しませんでした。 むしろ、これらはAIが「安全な」答え(「歩く」など)を推測する可能性をさらに高めてしまいました。つまり、AIに「もっと深く考えて」と伝えても、AIはルールについてより大声で語るようになるだけで、いつそのルールを適用すべきかについては依然として理解できていないのです。それは、まるで「途中式を書きなさい」と言われた学生が、ルールに関係のない行にまで、あらゆる行にルールを書き連ねているようなものです。
要約すると、この論文は、失敗の原因はAIに知識が欠けていることではないと示唆しています。それは、AIに「ルーティングのボトルネック」があるからです。AIは真実を知っていますが、いつその真実に答えを導いてもらうべきかを判断できません。単にAIに「もっと頑張って」とか「もっと考えて」と頼む現在の方法は、壊れた配線を直しているのではなく、AIが間違った推測をする際の自信を強めているだけなのです。これを真に解決するためには、AIが知っていることと、それが何を決定するかを結びつける内部経路を再構築する必要があり、また、「過剰に熱心なロボット」と「受動的すぎるロボット」に対しては、それぞれ異なる修正策が必要になるでしょう。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。