Learning When to Think: Adaptive Reasoning for Test-Time Compute Allocation
本論文は、Group Relative Policy Optimizationを通じて「NoThink」、「Short」、「Long」の推論モードの選択を学習させることで、テスト時計算量を適応的に割り当てる手法を導入し、様々なベンチマークにおいて精度を維持または向上させつつ、大幅なトークン削減を実現する方法を提案する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
大規模言語モデルは、人間が難しい数学の問題を紙に書き留めて解く時のように、問題を一連の長い中間ステップへと分解することで、複雑な問題を解決する驚くべきスキルを獲得してきました。この「思考の連鎖(chain-of-thought)」として知られるステップ・バイ・ステップのアプローチにより、これらのシステムは数学やコーディングのタスクにおいて高い精度に到達することができます。しかし、この能力には大きな代償が伴います。モデルはしばしば必要以上に膨大なテキストを生成し、膨大な計算資源と時間を消費してしまうのです。たとえ単純な問題であっても、モデルは長大で冗長な説明を行い、即座に解決できるはずのタスクに対してリソースを浪費することがあります。研究者たちは以前から、これらのシステムには特定の課題にどれほどの労力が必要かを判断する能力が欠けており、その結果、簡単な質問にも難しい質問と同じような重い処理が行われる状況を招いているのではないかと疑っていました。
アムステルダム自由大学の研究チームは、モデル自身にこの判断を行わせる方法を模索しました。彼らは、数学の問題を解くように訓練された、15億パラメータを持つ比較的規模の小さい推論モデルを用いました。常に一定の時間をかけて思考するように強制する代わりに、回答の冒頭でモデルに単純な選択肢を与えました。つまり、思考せずに即座に回答するか、短く推論するか、あるいは長く深い推論を行うかを、モデル自身に決めさせたのです。モデルは、回答が正しいかどうか、およびそこに到達するまでの効率性に基づいてフィードバックを受け取る「強化学習」という手法を用いて訓練されました。目標は、モデルが問題の難易度に応じて自らの労力を調整することを学習し、簡単なタスクでは時間を節約しつつ、難しい問題を解くためには十分なリソースを割けるようにすることでした。
研究者たちは、モデルが自身の動作モードを示すために、最初のトークンとして単一の単語を出力するシステムを設計しました。もしモデルが「NoThink(思考なし)」を選択した場合、直接回答を試みます。「Short(短め)」を選択した場合は、短い説明が許可されますが、使用できる単語数には厳格な制限が設けられます。「Long(長め)」を選択した場合は、制限なく長々と推論を行うことが許可されます。モデルがこれらの選択を確実に守るようにするため、研究者たちは短いモードに対して回答の長さにハードリミット(硬い制限)を課しました。もしモデルが「Short」モードを選択しながらも制限を超えて記述した場合、最終的な答えが正しかったとしても、システムはその試行を不正としてマークしました。これにより、モデルは冒頭で選んだラベルが自身の振る舞いに実質的な結果をもたらすことを学習せざるを得なくなりました。
モデルが単に選択を無視して、常に最も安全な「最も長い選択肢」にデフォルト設定してしまうのを防ぐため、研究者たちはモデルが受け取る報酬を調整しました。非常に短い回答に対しては「NoThink」と「Short」のモードにより高い報酬を与え、一方で「Long」モードは長さに関わらず一定の報酬を与えるようにしました。これにより、最適な戦略は問題の内容によって決まるような環境が作られました。つまり、些細な質問に対しては最も早い回答が最高スコアをもたらし、一方で困難な問題には「Long」モードによる拡張された努力が必要になるという仕組みです。また、モデルがすべての問題に対して単一の戦略のみを使用する状態に陥らないよう、3つの選択肢すべてを使用するように緩やかに促すバランシング・メカニメントも追加されました。
結果として、モデルは問題の難易度を分類することを学習できました。500個の保持された数学問題のセットにおいて、モデルは簡単な問題を「NoThink」または「Short」モードへ、難しい問題を「Long」モードへと振り分け始めました。訓練の過程を通じて、モデルの精度は元の修正されていないバージョンとほぼ同一を維持しましたが、回答の平均的な長さは大幅に減少しました。研究者たちは、この新しいポリシーによって、平均生成単語数が41パーセント減少し、回答の長さが約4,800トークンから約2,800トークンに削減されたことを見出しました。これは、モデルが同じ数の問題を正しく解きながら、半分以下の計算量で実行できたことを意味します。
極めて重要な点は、この効率化が、モデルが未だ見たことのない問題に対する性能を犠牲にしていないことです。別の初等数学の文章題を用いたテストにおいて、モデルはさらに多くのテキストを節約し、トークン数を76パーセント削減しながら高い精度を維持しました。深い推論がほぼ不可欠となる非常に難易度の高い競技数学のセットにおいては、モデルはほぼすべての質問に対して正しく「Long」モードを選択し、ショートカットによる時間の浪費を行うことなく、ベースラインと同等のパフォーマンスを発揮しました。この研究は、推論モデルが自らの努力を自己調節し、問題が要求する場合にのみより多くの思考時間を割り当てることができることを示しています。これは、人工知能をより効率的にするための道筋を示唆しており、システムを単に饒舌にするのではなく、賢く、かつ経済的なものにできる可能性を提示しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。