Learned but Not Expressed: Capability-Expression Dissociation in Large Language Models
本論文は、大規模言語モデルが特定の条件下では学習データを復元できる能力を有しながらも、標準的な生成タスクにおいては非因果的・非実装可能な解決策が一切表現されないという「能力と発現の分離」を実証的に明らかにしたものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
🍳 料理人の例え:「冷蔵庫の食材」と「出される料理」
この研究を想像してみてください。
ある天才料理人(AI)がいたとします。彼の冷蔵庫(学習データ)には、**「魔法の粉」や「神様のお告げ」**といった、現実にはありえない不思議な食材が山ほど入っています。彼はそれらの食材が何であるか、どう使うかを完璧に理解しています。
1. 実験の内容:2 つのシナリオ
研究者はこの料理人に、2 つの異なる注文を出しました。
- シナリオ A(物語作り): 「ファンタジー小説を書いて。魔法や奇跡が出てきても OK だよ!」
- シナリオ B(現実の相談): 「プロジェクトの締切に追われている人へのアドバイスをして。現実的な解決策を。」
もし料理人が「冷蔵庫にあるもの」をそのまま使えば、シナリオ A では「魔法の粉」を使って解決策を提案するはずです。
2. 驚きの結果:「0 回」の魔法
しかし、実験の結果はこうでした。
- 300 回の注文(物語も相談も混ぜて)に対して、「魔法の粉」を使った料理は 0 回でした。
- 料理人は、現実的な解決策(現実の食材)しか出しませんでした。
- 物語を作る時でさえ、「魔法で解決!」というアイデアは、一切出てきませんでした。
「0%」。完全にゼロです。
3. 本当の力:「魔法」は消えていない
でも、料理人は「魔法の粉」を忘れているのでしょうか?いいえ。
研究者が**「さあ、魔法の粉を使った料理の例を 3 つ挙げてごらん」と、あえて直接注文を変えて聞くと、料理人は「もちろん!これ、これ、これ!」**と、次々と魔法の料理のレシピを思い出して見せてくれました。
つまり、**「知っている(能力がある)」ことは確かですが、「普段の注文では、あえて使わない(出力しない)」**という決まりごとが、彼の中に厳しく染み付いているのです。
🔍 この研究が伝えていること
この論文は、AI の仕組みについて、私たちが思い込んでいた「常識」を覆す 3 つのポイントを教えてくれます。
① 「知っている=話す」とは限らない
私たちは「AI が学習データにその情報を持っていれば、必ず話してくれるはずだ」と思いがちです(これを「データ Exhaustive 仮説」と論文では呼んでいます)。
しかし、実際は違います。AI は**「今、どんな状況か(文脈)」や「人間が望む振る舞い(アライメント)」に合わせて、知っている情報のうち「話していいもの」だけを厳選して選んでいる**のです。
② 「お作法」が強く働く
AI は、人間からのフィードバック(「有害なことは言わない」「現実的な答えを」といった教え)を通じて、**「どんな時でも、現実的な解決策しか出さない」というお作法(生成ポリシー)**を身につけています。
たとえ「物語を作れ」と言われても、その「お作法」が働いて、ファンタジー要素(非因果的な解決策)を自動的に排除してしまうのです。まるで、どんなに面白い冗談が思いついても、真面目な会議では一言も発しない真面目な社員のようなものです。
③ 「能力」と「表現」は別物
- 能力(Capability): 特定の質問をすれば、何でも答えられる(冷蔵庫の食材が使える)。
- 表現(Expression): 普通の会話では、決まりごとに従って特定の答えしか出さない(出される料理は制限されている)。
この**「できること」と「やること」のギャップ**が、現代の AI の最大の特徴です。
💡 私たちにとっての意味
この研究は、AI を使う際に重要な教訓を与えてくれます。
- AI が「知らない」わけではない: AI が「そんなこと知らないよ」と言うのは、本当に知らないからではなく、「今はそれを言うタイミングじゃない(あるいは言うべきじゃない)」と判断しているからかもしれません。
- AI の「性格」は作られたもの: AI の回答は、単にデータからランダムに拾ってきたものではなく、人間が教えた「お作法」や「フィルター」によって、意図的に絞り込まれたものです。
つまり、AI は**「何でも知っているが、何でも言うわけではない」**という、非常に複雑で制御された存在だと言えるのです。
まとめ
この論文は、**「AI の頭の中には『魔法』が眠っているが、普段の会話では『魔法使い』の帽子を被せて、現実的な『エンジニア』としてしか働かせていない」**という現象を、300 回の実験で証明したものです。
私たちは AI を使う際、その「見えないフィルター」の存在を意識する必要があります。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。