Policy of Thoughts: Scaling Test-Time Training for LLM Reasoning via Online Policy Evolution
本論文は、テスト時の実行を、フィードバックを内面化しモデルの推論戦略を進化させるために、Group Relative Policy Optimizationを通じて一時的なLoRAアダプターを動的に更新するオンライン最適化プロセスとして扱うことで、LLMの推論能力を強化するフレームワークであるPolicy of Thoughts (PoT) を導入しており、これにより4Bモデルが複雑なコーディングベンチマークにおいて、はるかに大規模な最先端モデルを大幅に上回る性能を発揮することを可能にしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、非常にトリッキーなパズル、例えば複雑なコーディング・チャレンジや、長い思考の連鎖を必要とする数学の問題を解こうとしていると想像してください。あなたには、多くの事実を知っているものの、時としてループに陥り、同じ間違いを何度も繰り返してしまう超スマートなアシスタント(大規模言語モデル)がいます。AIの世界では、このアシスタントは通常、「凍結された」脳を持って働いています。つまり、一度思考を開始すると、その途中で根本的な戦略を変更することができないのです。もし間違った方向に進んでしまったら、運良く正解に辿り着くか、あるいは多くの異なる経路を同時に試すことを期待して、ただその間違った道を歩み続けることになります。これは、壁にぶつかった時にそこから学ぶのではなく、壁にぶつかるまであらゆる廊下を盲目的に走り回って迷路から抜け出そうとするようなものです。
長い間、これらの難しい問題を解決する最善の方法は、単にコンピューターに何百万もの推測を試させるために、より多くの時間と計算能力を与えることでした。しかし、この論文はよりスマートな方法を提案しています。それは、コンピューターにただ「一生懸命やらせる」のではなく、「試行しながら学習させる」という方法です。これは、ビデオゲームのキャラクターが、単にリスポーンして再び挑戦するのではなく、直前に自分を倒した特定の罠から実際に学び、次の試行に向けて即座に戦略を調整するようなものです。この研究の背後にいる研究者たちは、こう問いかけています。「もし私たちのAIが、直前の推測が失敗したか成功したかに基づいて、リアルタイムで自身の推論ルールを更新できるとしたらどうだろうか?」これは、スクリプトに従うだけのロボットと、直面するあらゆる新しい課題に対して自らの脳を適応させ、進化させるロボットの違いです。
「思考のポリシー(Policy of Thoughts)」:プレイしながら学ぶことをAIに教える
PoT(Policy of Thoughts)をご紹介しましょう。これは、問題解決を一度限りの推測としてではなく、AIと問題そのものとの間の、ライブで進化し続ける対話として扱う新しいフレームワークです。浙江大学やLMUミュンヘンなどの大学の研究チームである著者らは、AIの戦略が探索中に固定されたまま動かないという従来の方法が、私たちの足を引っ張っていると主張しています。彼らは、AIがテストの「最中」に、自身の失敗から学ぶ「セカンドチャンス」を得る、つまり、その場で自己学習を行うシステムを提案しています。
ポパー的パズル:推測、検証、そして進化
核心となるアイデアは、科学は「推測と反駁(はんばく)」を通じて進歩すると信じた有名な哲学者、カール・ポパーに触発されています。平易な言葉で言えば、これは、ある推測を行い、それを現実に対してテストし、もし失敗したならば、次に改善された推測ができるよう、なぜ失敗したのかを正確に学ぶ、ということを意味します。
PoTはこの哲学をAIに具現化させます。サイクルの仕組みは以下の通りです:
- 推測(Conjecture/The Guess): AIは問題を見て、いくつかの異なる可能な解決策を生成します(地図上に3つの異なるルートをスケッチするように)。
- 反駁(Refutation/The Reality Check): システムは、これらの解決策を実際の環境(コードコンパイラなど)で実行します。もしコードがクラッシュしたり誤った答えを出したりした場合、それが「反駁」となります。
- 進化(Evolution/The Learning): ここが魔法の部分です。失敗した推測を単に捨て去るのではなく、PoTはその失敗を利用して、AIの内部的な「ポリシー(思考の戦略)」を更新します。AIの考え方に、この問題に特化した微細かつ即時的な調整を加えます。
- 反復(The Repeat): AIは、今行った特定のミスを回避するための準備を整えた、新しく更新された脳を持って、再び挑戦します。
「一時的な脳」のトリック
あなたはこう思うかもしれません。「もしAIがすべての問題から学ぶとしたら、混乱したり、以前知っていたことを忘れてしまったりしないだろうか?」著者らは賢明な解決策を用意しています。彼らは、LoRA(Low-Rank Adaptation)と呼ばれる手法を使用していますが、これはAIに、軽量で取り外し可能な「思考の帽子」を与えるようなものです。
AIには、膨大な知識の永久的なライブラリ(ベースモデル)があると想像してください。困難な問題に直面したとき、AIは特別な軽量の「思考の帽子」(LoRAアダプター)を被ります。この帽子により、AIはこの特定のパズルのために、戦略を迅速に学習し適応させることができます。パズルが解決された(あるいは時間が終了した)とき、帽子は脱がされ、捨てられます。永久的なライブラリには影響を与えず、混乱もさせません。これは、AIが一般的な知識を損なうことなく、あらゆる新しい問題に対して適応の達人になれることを意味します。
結果:小さな脳、大きな勝利
研究者たちは、精密なステップ・バイ・ステップの論理を必要とするため、極めて難しいとされるコーディング・チャレンジでこのアイデアをテストしました。彼らは比較的小さなAIモデル(わずか40億パラメータ)を使用し、そこにPoTフレームワークを適用しました。
結果は驚くべきものでした。この小さなモデルは、PoTを用いることで、LiveCodeBench V6と呼ばれる難度の高いベンチマークにおいて、**49.71%**の問題を解決しました。これを比較対象として捉えると:
- この同じ特定のベンチマークにおいて、29.71%を記録した巨大な商用モデルであるGPT-4oを打ち破りました。
- 他の大型モデルのベースライン性能を大幅に上回り、動的な学習を備えた小さなモデルが、より大規模なシステムの静的な推論を凌駕できることを証明しました。
- Gemini-2.5-Flash(総合60.91%)やClaude-Opus-4(総合55.22%)のようなモデルは、より広範で混合されたベンチマークで高いスコアを獲得していますが、PoTによって強化された4Bモデルの49.71%という数値は、厳格なLiveCodeBench V6において、50倍以上小さいモデルがこれほどの成果を出したことを示しており、適応的な推論が巨大なモデルとの差を埋められることを証明しています。
最も印象的なことは、PoTで強化されたモデルは、競合する巨大なモデルよりも50倍以上小さいということです。このモデルは、より大きな脳を持っていたから勝ったのではなく、持っている脳のよりスマートな使い方を知っていたから勝ったのです。
なぜこれが重要なのか
この論文は、AIの推論の未来は、単にモデルを大きく大きくしていくことではないと示唆しています。それは、モデルに「即座に考える(think on its feet)」能力を与えることです。テスト時のプロセスをトレーニングセッションに変えることで、AIは失敗した経路にエネルギーを浪費することをやめ、そのエネルギーを即座に戦略を改善するために使い始めることができます。
著者らは、この手法は明確なフィードバック(コードが実行されるか、あるいはクラッシュするか)がある場合に最も効果的であることを発見しました。フィードバックが曖昧な場合、恩恵は小さくなりますが、それでもプラスの効果は見られました。また、このアプローチは、最初に使用したモデルだけでなく、異なる種類のモデルでも機能することも示されました。
要約すると、PoTは、難しい問題を解くための最善の方法は、単に「より一生懸命やること」ではなく、「より速く学ぶこと」であることを示唆しています。AIに、個々の挑戦に対して自らの推論戦略を進化させることを許容することで、私たちはより小さく、より効率的なコンピュータから、超スマートな結果を得ることができるのです。これは、「正しい答えを探す」ことから、「正しい答えの見つけ方を学ぶ」ことへの転換なのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。