← 最新の論文
🤖 AI

MASPRM: Multi-Agent System Process Reward Model

本論文は、最終的な結果に基づいて学習され、中間的なエージェントのメッセージをスコアリングするマルチエージェント・システム・プロセス報酬モデルであるMASPRMを紹介しており、これは、より効果的なステップレベルのビームサーチおよびモンテカルロ木探索を可能にすることで、既存のモデルと比較して推論ベンチマークにおける推論時の探索性能を大幅に向上させている。

原著者: Milad Yazdani, Mahdi Mostajabdaveh, Zirui Zhou, Ying Xiong

公開日 2026-07-16
📖 1 分で読めます☕ さくっと読める

原著者: Milad Yazdani, Mahdi Mostajabdaveh, Zirui Zhou, Ying Xiong

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、とてもトリッキーなパズル、例えば複雑な数学の問題や論理パズルを解こうとしているところだと想像してください。人工知能の世界には、大規模言語モデル(LLM)と呼ばれるものがありますが、これらは非常に賢いものの、時として注意力が散漫な学生のようなものです。難しい質問を投げかけると、彼らは一気に答えようとしますが、途中で行き詰まったり、早い段階でミスをしたりして、間違った道を進み続けてしまうことがよくあります。これを解決するために、科学者たちは「マルチエージェント・システム」を使い始めました。これは、一人の学生が一人で取り組むのではなく、「学習グループ」として考えるものです。そこには、問題を読み取る「リーダー(読解者)」、戦略を立てる「プランナー(計画者)」、計算を行う「ソルバー(解決者)」、そして作業をチェックする「ベリファイア(検証者)」がいます。彼らは特定の順序に従って、メモをやり取りしながら進めていきます。

しかし、ここには落とし穴があります。もしこの学習グループを自由に走らせてしまうと、すでに間違っているアイデアについて議論するために、膨大な時間とエネルギー(計算資源)を浪費してしまう可能性があります。それはまるで、友人たちがミステリーを解こうとしているのに、誰一人として「待て、この手がかりは筋が通っていない」と言わないために、的外れな手がかりを追いかけ続けているようなものです。この無駄を防ぐために、研究者たちは「モンテカルロ木探索(MCTS)」のような「探索アルゴリズム」を使用します。これは、コーチが「次のステップについては5つの異なる経路を試してみて、どれが最も有望そうかを確認し、その上で最も有望なものに集中しよう」と指示するようなものです。しかし、ここで大きな問題が生じます。コーチはどうやって「どの経路が有望か」を知るのでしょうか? 通常、コーチは最終的な答えが正しいか間違っているかを知ることでしか判断できません。つまり、途中のステップが適切であったかどうかは分からないのです。この論文は、コーチがゲームの途中でより良い判断を下せるよう、新しいツールを紹介しています。

論文:MASPRM

ブリティッシュコロンビア大学とファーウェイの研究者によるこの論文は、まさにその問題に取り組んでいます。彼らは MASPRM(Multi-Agent System Process Reward Model)と呼ばれるものを作り上げました。MASPRMは、「スーパーコーチ」あるいは「プロセスの審判」と考えることができます。これは、グループが成功したかどうかを最終的な答えが出るまで待つのではなく、学習グループの会話が行われている「最中」に、そのプロセスを監視し、エージェント間でやり取りされるすべてのメモに対してスコアを付けるものです。

以前は、もしAIチームがステップ3でミスをしたとしても、最終的な答えが間違っていたという最後の一瞬まで、システムはそのことに気づけませんでした。その時には、AIはすでに間違った経路を探索するために膨大なエネルギーを浪費してしまっていたのです。MASPRMはこの状況を変えます。それは「ルーテッド・トランスクリプト(経路化された書き起こし)」、つまりエージェント間で送られたメッセージの順序リストを見て、「このプランナーからの特定のメッセージは素晴らしいアイデアだ、このまま進めよう」とか、「このソルバーのメッセージはどこにも辿り着かない、この枝(分岐)をすぐに切り捨てよう」といったスコア付けを行います。

コーチの訓練方法

この論文の最も興味深い部分の一つは、このスーパーコーチをどのように訓練したかという点です。通常、コンピュータにステップごとの判断を教えるには、人間が各ステップに対して「良い」か「悪い」かのラベルを付ける作業が必要であり、それは非常にコストがかかり時間がかかります。著者たちは、巧妙なショートカットを見つけ出しました。彼らは、MCTSと呼ばれる探索手法を用いて、AIエージェントに何千回ものシミュレーションを実行させました。これらのシミュレーションの中で、エージェントたちは多くの経路を探索します。そして、各経路の最後に、答えが正しいか(+1)間違っているか(-1)が判明します。

次に、彼らは「バックプロパゲーション(誤差逆伝播法)」という数学的なトリックを用いました。木の葉の部分が最終的な結果であるような「木」を想像してください。もし一つの葉が「勝利」であれば、その勝利の価値は枝を遡って伝わり、それ以前のステップを価値あるものに見せます。もし「敗北」であれば、その価値はマイナスとして遡ります。MASPRMは、人間が一度も「このステップは良かった」と言わなくても、会話の履歴を見るだけで、これらの値を予測することを学習しました。それは、有望な会話と行き止まりの議論の違いを、それらが最終的に正しい答えに辿り着いたかどうかを見るだけで、自律的に学習したのです。

研究結果

チームは、GSM8KおよびMATH(数学問題)、ならびにMMLUおよびLOGIQA(一般的な知識と論理)という4つの有名なベンチマークでこの新しいコーチをテストしました。彼らはMASPRMを以下の2つの手法と比較しました:

  1. ポリシー・ライクリフッド(方策尤度):これは、目標に対する真の理解なしに、単に「次にくる単語はこれらしい」と推測している状態です。
  2. ORM(結果報酬モデル):これは、途中のステップを無視して、最終的な答えだけをチェックする、従来型のコーチです。

結果は極めて明白でした。研究者がMCTSと「ステップレベル・ビームサーチ」という手法を用いて探索をガイドしたところ、AIの解決能力は大幅に向上しました。

  • 15億パラメータのモデル(より小さく高速なAI)では、MASPRMは従来のORMと比較して、成功率を2.0〜3.0ポイント向上させました。
  • 70億パラメータのモデル(より大きく、より賢いAI)では、その向上は劇的で、4.1〜14.5ポイントもの跳ね上がりを見せました。
  • 最も困難なテストであるGSM8Kにおいて、7BモデルとMASPRMの組み合わせは、**Hit@1で82.9%**に達しました。これは、最初の一手で正解に辿り着く確率がほぼ83%であることを意味します。

論文は、MASPRMが特に「ステップワイズ・サーチ(段階的探索)」において優れていることを示唆しています。これは、AIが「次にどのエージェントが話すべきか」や「次の文章は何であるべきか」といった一連の決定を下さなければならない場合です。MASPRMはこれらの中間ステップを判断できるため、AIが悪質なアイデアに時間を浪費することを防ぎます。また、MASSRPMはAIの選択の信頼性も高めました。「最善の」予測と「5番目に良い」予測の差が縮まり、これはAIが自身のトップの選択肢に対してより自信を持っていることを意味します。

限界と未来

著者らは、これがすべてを解決する魔法の杖ではないことも慎重に述べています。彼らのシステムは、エージェントが固定されたスケジュール(誰がいつ話すかという厳格な順序)を持ち、かつ最終的な答えが明確にチェックできる(数学の問題のように特定の数値がある)場合に最も効果を発揮します。彼らは、単一の「正解」が存在しないオープンエンドなタスクや、エージェントが動的に役割を変化させるシステムにおいては、この手法はまだ模索段階であることを認めています。また、コーチがグループ全体の会話ではなく、一つのエージェントが見ている情報のみを見た場合、パフォーマンスが低下することも分かっており、最高のパフォーマンスを得るためには「グローバルな視点(チームのチャット全体を俯瞰する視点)」が極めて重要であることを示唆しています。

要約すると、MASPRMは、AIチームにリアルタイムで自己修正を教えるための画期的な成果です。間違ったことに気づくまで最後まで待つのではなく、今や彼らには、悪い経路を早期に察知してチームを正しい軌道に戻し、時間を節約してより良い結果をもたらすコーチがいるのです。これは、複雑な推論タスクにおいて、重要なのは単に「より大きな脳」を持つことではなく、思考プロセスが行われている最中に、それをより良く導く方法を持つことであるということを示唆しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →