← 最新の論文
🤖 machine learning

AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning

本論文は、参照軌跡から密なステップごとの報酬を推論するために、Adversarial Inverse Reinforcement LearningとGroup Relative Policy Optimizationを組み合わせた統一フレームワークであるAIRL-Sを導入するものであり、これによりラベル付きのプロセスデータの必要性を排除しつつ、数学、科学、およびコード生成のベンチマークにおいてGPT-4oレベルの性能を達成する堅牢かつ費用対効果の高いテスト時スケーリングを可能にする。

原著者: Can Jin, Yang Zhou, Qixin Zhang, Hongwu Peng, Di Zhang, Zihan Dong, Marco Pavone, Ligong Han, Zhang-Wei Hong, Tong Che, Dimitris N. Metaxas

公開日 2026-08-27
📖 1 分で読めます☕ さくっと読める

原著者: Can Jin, Yang Zhou, Qixin Zhang, Hongwu Peng, Di Zhang, Zihan Dong, Marco Pavone, Ligong Han, Zhang-Wei Hong, Tong Che, Dimitris N. Metaxas

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

大規模言語モデルは、テキストの生成、問題解決、コードの記述が可能な、現代の人工知能システムの背後にある強力なエンジンです。長年、研究者たちは「思考の連鎖(chain of thought)」として知られる手法を用い、モデルにステップ・バイ・ステップで問題を考えさせる方法を教えることで、システムをより賢くしようと試みてきました。しかし、モデルに優れた推論を教えることは困難です。なぜなら、コンピュータは最終的な答えが正しいか間違っているかは理解できても、そこに至るまでの各ステップが論理的であったかどうかまでは理解できないことが多いからです。これを解決するために、科学者たちは主に2つのアプローチを試してきました。一つは、タスクの最後にのみ報酬を与える方法ですが、これは不安定で非効率になる可能性があります。もう一つは、推論プロセスのあらゆるステップをチェックするための別のガイドを使用する方法ですが、このガイドを作成するには通常、数千もの例に対して高価な専門家によるラベル付けが必要であり、モデルが新しい思考方法を始めた際に、そのガイドが機能しなくなることがよくあります。

研究チームは、これら2つのアプローチを単一の自己改善ループへと統合した「AIRL-S」と呼ばれる新しいシステムを導入しました。すべてのステップに対して人間のラベルに頼る代わりに、このシステムは高品質な推論の例を観察することによって、独自の内部ガイドを作成することを学びます。そして、このガイドを使用してモデルを訓練すると同時に、実世界での使用中に最適な答えを探索する際にも役立てます。数学、科学、コーディングを含む8つのベンチマークを用いたテストにおいて、研究者たちは、この手法が初期バージョンと比較して平均で9パーセント性能を向上させたことを見出しました。結果として得られたシステムは、多大なコストを要する人間の監督を必要とすることなく、GPT-4oのような最も高度な商用モデルと同等の性能を発揮しました。

核心となる革新は、システムがどのように自らの仕事を判断するかという点にあります。従来、モデルにステップ・バイ・ステップで推論することを教えるには、「プロセス報酬モデル」が必要でした。これは、人間がすべての正しいステップと誤ったステップに印をつけたデータで訓練された別個のプログラムです。これは時間がかかり、コストもかかります。新しい手法は、敵対的学習と呼ばれる技術を用いることで、この問題を回避します。システムがゲームをしている様子を想像してみてください。一方のパートが推論ステップを生成しようとし、もう一方のパートがそれらの生成されたステップと、一連の高品質な参照例とを区別しようとします。この競争を通じて、システムは人間から明示的に教えられることなく、優れた推論ステップがどのようなものかを認識することを学びます。この学習されたガイド、すなわち報酬モデルは、緻密かつ詳細になり、最終的な結果だけでなく、推論プロセスのあらゆるステップに対してフィードバックを提供します。

システムがこの内部ガイドを学習すると、それは2つの方法で同時に使用されます。第一に、学習フェーズにおいてモデルがより良いステップを踏めるよう、ガイドを使用してメインモデルを訓練します。第二に、同じガイドを保持し、実際の問題解決フェーズにおける検証器として機能させます。モデルが困難な問題を与えられたとき、それは多くの異なる可能性のある解を生成することができます。学習されたガイドは、これらの潜在的な解の各ステップをスコアリングし、システムが最も論理的な経路を選択するのを助けます。これにより、モデルを教えるために使用されるツールと、テスト中に思考を助けるために使用されるツールが同一であるという、統一されたパイプラインが構築されます。研究者たちは、このガイドが堅牢であることを実証しました。それは異なるモデルや異なる探索戦略に適用された場合でも効果的に機能しており、学習された知識が一般的であり、転移可能であることを示唆しています。

このアプローチの結果は、幅広い困難なタスクにわたって測定されました。研究者たちは、複雑な数学コンテスト、科学的推論の問題、コーディングの課題を含む8つの標準的なベンチマークを用いてモデルをテストしました。標準的なオープンソースの言語モデルから始まったこのモデルは、この新しい手法による訓練後に平均精度が9パーセント向上しました。特定の数学および科学のタスクにおいては、その向上はさらに高く、13パーセントに達しました。高価な人間のラベル付きデータや他の高度な強化学習技術を用いて訓練された他のモデルと比較して、この新しいシステムは一貫して優れた性能を示しました。それは、パラメータ数が大幅に少ないにもかかわらず、トップクラスの商用モデルであるGPT-4oの性能に匹敵しました。このことは、推論プロセスの質が、単にモデルの規模を大きくすることよりも重要であることを示唆しています。

本研究の重要な発見は、2つの異なるタイプの学習信号がどのように連携するかという点です。システムは、自己学習されたガイドからの詳細なステップ・バイ・ステップのフィードバックと、伝統的な手法による最終的な結果の報酬を組み合わせます。研究者たちは、どちらか一方の信号だけに頼ることは効果が低いことを見出しました。ステップ・バイ・ステップのガイドはモデルがより良い推論経路を探索するのを助け、一方で最終的な結果の信号はモデルが正しい答えを得ることに集中し続けることを保証しました。これら2つの信号が適切にバランスされると、互いに強化し合い、より安定した訓練とより良い結果をもたらしました。さらに、システムは、一度に多くの解を試みる手法や、可能性のツリーを構築する手法など、さまざまな探索手法を改善するために、この学習されたガイドを使用できることを示しました。このガイドは、モデルが最善の選択をするために中間ステップの価値を評価しなければならない複雑な探索シナリオにおいて、特に効果的でした。

この研究の意義は、単にテストのスコアを高めることにとどまりません。ステップ・バイ・ステップの推論に対する高価な人間の注釈への依存を排除することで、この手法は人工知能を向上させるための、よりスケーラブルで費用対効果の高い方法を提供します。これは、モデルが自らの教師となり、高品質な例を観察し、自分自身と競い合うことで、自身の推論能力を洗練させていけることを示唆しています。研究者たちは、彼らのアプローチが、数学やコーディングのように、最終的な答えが自動的に検証可能なタスクに特に適していると指摘しています。この手法は強力ですが、著者らは、それが現在これらの検証可能な結果に依存しており、単一の正解が存在しないオープンエンドなタスクを扱うにはさらなる開発が必要であることも認めています。それにもかかわらず、訓練と推論時の探索を単一の効率的なシステムへと統合する能力は、大規模言語モデルをより信頼性が高く、有能な推論器にするための重要な一歩となります。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →