Soft Guidance Starts to Outperform CoT Prompting as LLMs Improve
この論文は、大規模言語モデルが向上するにつれて、標準的なfew-shotのChain-of-Thoughtプロンプティングは、注意を逸らすフォーマットやスタイルの制約を導入することで性能を阻害することが多く、推論タスクにおいては単純なzero-shotのアプローチの方がより効果的になる、と主張している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
ロボットに謎解きを教える方法を想像してみてください。長い間、最も効果的な方法は、人間が思考の全ステップを詳細なレシピのように書き出した、たくさんの例をロボットに見せることでした。この手法は「思考の連鎖(Chain-of-Thought)」プロンプティングと呼ばれ、「まずこれを行い、次にこれを行い、最後に答えはこれだ」と書かれたトレーニングマニュアルを与えるようなものでした。これは、考えずに答えを推測しがちだった古い単純なロボットたちには、驚異的な効果を発揮しました。
しかし今、私たちはより賢く、より高度なロボットを構築しています。これらの新しいモデルは、非常に多くの本を読み、自力で多くのパズルを解いてきたため、たとえマニュアルを与えられなくても、自然にステップバイステップで考え始めることができます。彼らは論理という内部コンパスを持っているのです。科学者たちが投げかけている大きな疑問は、もしロボットがすでに考え方を知っているのなら、それでもまだ詳細なレシピで手取り足取り教える必要があるのか? ということです。あるいは、そのレシピ自体が、思考の書き方に関するルールを押し付けることで、ロボットを混乱させ、邪魔をしてしまうのではないか? ということです。この論文は、私たちの古い教育方法が、最新かつ最も賢い生徒たちの足を引っ張っていないかを確認するために、まさにその問いを掘り下げています。
「導かれすぎた」ロボット:助けすぎが仇となる時
この研究において、研究者たちは現在利用可能な最も賢い数学解決ロボットをテストすることに決めました。彼らは、従来の例示を示す手法(フューショット・プロンプティング)が依然として最善の方法なのか、それとも実はロボットの性能を低下させているのではないかを確認したいと考えました。
このように考えてみてください。あなたが長年料理をしてきた熟練のシェフだとします。あなたはレシピがなくても、完璧なスフレの作り方を正確に知っています。そこで、誰かがあなたに「まず卵を割り、次に泡立て、最後に350度で焼く」と書かれた付箋を渡し、それを厳密に守るよう強要したとします。あなたはイライラするか、あるいはそのメモを完璧に守ることに集中しすぎるあまり、自分自身の料理の直感を忘れてしまうかもしれません。指示に気を取られて、料理を台無しにしてしまうことさえあるでしょう。
研究者たちは、現代のAIでまさにこれが起きていることを発見しました。これらの高度な「推論特化型」モデルに対し、標準的な手法(人間が解いた同様の問題の例をいくつか示す方法)を用いて数学の問題を解かせたところ、モデルのパフォーマンスは低下しました。
例えば、Mathstral というモデルを例に挙げてみましょう。研究者が例示を与えずに(「ゼロショット」アプローチ)、自力で問題を解かせた場合、正答率は約**83.8%でした。しかし、標準的な「トレーニングマニュアル」である人間が書いた例を与えたところ、スコアは約74.2%**にまで落ち込みました。これは大きな差です! まるで、ロボットが数学を解くことよりも、例題のスタイルやフォーマットを模倣することに夢中になりすぎて、肝心の計算を忘れてしまったかのようです。
論文は、この現象が起こる理由として、標準的な例示がロボットに対して、人間の例にスタイルを合わせることを強いてしまうからだと示唆しています。モデルはフォーマットや特定の文章構造に従うこと、そして自分用に作られたものではない「箱」に収まることを気にしなければなりません。これは「ガイダンスによる注意散漫(guidance-distraction)」というトレードオフを生み出します。ガイダンス(例示)は助けとなるはずのものですが、これらの超賢いモデルにとっては、核心となる問題解決から注意を逸らしてしまう邪魔者となってしまうのです。
「ステップバイステップで考えよう」のトリック:まだ有用だが、魔法の力は弱まっている
研究者たちは、「Zero-Shot CoT」と呼ばれるよりシンプルなトリックもテストしました。これは、例を一切示さず、質問に「ステップバイステップで考えましょう(Let's think step by step)」というフレーズを加えるだけというものです。
Llamaのような古い汎用ロボットにとっては、このトリックは依然として非常に効果的でした。それは、彼らの推論スキルを目覚めさせるための優しい後押しとして機能し、スコアを大幅に向上させました。しかし、推論特化型の超賢いモデルにとっては、このトリックによる恩恵はごくわずかでした。Mathstralの場合、スコップは**83.8%から86.1%**へと微増しただけでした。
著者らは、これらのモデルはすでにステップバイステップで考えることに非常に長けているため、以前ほど「後押し」を必要としていないのだと主張しています。彼らはこれを、エンジニアがプログラムのあらゆる機能を手動で設計しなければならなかったコンピュータ科学の初期時代と比較しています。やがてコンピュータはそれらの機能を自ら学習できるほど賢くなり、手動での設計は不要になりました。論文は、「ステップバイステップで考えましょう」というフレーズは、かつては不可欠であったが、今ではそれほど大きな変化をもたらさない小さな付け足しに過ぎなくなっている、と示唆しています。
なぜ古いやり方が失敗するのか
最も驚くべき発見の一つは、研究者がモデル自身が生成した例を使用することで問題を解決しようとした(つまり、スタイルを一致させた)場合でも、最も賢いモデルにおいては、単純な「例示なし」のアプローチに勝てなかったことです。
結局のところ、問題は例が人間によるものかどうかではなく、例の「構造」にあることが分かりました。モデルに特定のパターンに従うことを強いると、モデルが最も得意とする方法で問題を解決する自然な能力を制限してしまうのです。論文は、推論特化型モデルにおいて、より多くの例を見せたり「より良い」例を選んだりしても、この問題は解決しないと明言しています。実際、最も高度なモデルにおいては、例示によってガイドしようとすればするほど、むしろ彼らの足を引っ張ることになる可能性があることが判明しました。
まとめ:ロボットの直感を信じること
では、これはAIのテストの未来にとって何を意味するのでしょうか? 著者らは、モデルの測定方法を変える必要があると提案しています。長い間、標準的なテストは、モデルにいくつかの例を示し、それをどれだけ上手くコピーできるかを見るものでした。しかし、この論文は、最新の最も賢いモデルにとって、そのテストは不公平であることを示しています。それは、レーシングカーのドライバーを、速度制限のある学区内で運転させて実力を測るようなものです。それでは真の実力を示すことはできません。
代わりに、研究者たちは、例示や特別な指示を与えず、モデルに直接質問を投げかけ、彼らが自力で何を導き出すかを見るべきだと主張しています。この「ゼロショット」手法こそが、モデルが実際にできることの真の姿を映し出します。
この論文は、Chain-of-Thoughtプロンプティングが永遠に死に絶えると主張しているわけではありません。より単純なモデルや、モデルに少し助けが必要な特定のタスクにおいては、依然として有用かもしれません。しかし、強力なモデル――特に推論のために設計されたモデル――にとって、古い教え方は邪魔なものとなっています。モデルが賢くなればなるほど、彼らにはガイダンスよりも、自ら考えるための自由が必要なのです。彼らが本当にどれほど賢いのかを知る最良の方法は、おそらく、手を引くのをやめて、彼ら自身のやり方でパズルを解かせてみることなのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。