← 最新の論文
🤖 AI

Recursive Agentic Reasoning

本論文は、3つの再帰的推論オペレータ(GROW、PRUNE、およびBRANCH)からなる統一的なフレームワークを導入し、広範な評価を通じて、繰り返しの分岐(branching)が多様なモデルやベンチマークにおいて他のテスト時推論手法を一貫して上回ること、そして、誤解を招く比較結論を避けるためのペアリングされた評価プロトコルの極めて重要な重要性を明らかにしている。

原著者: Shengxin Zhang, Xiaomin Wu, Xiyang Wu, Jing Xie

公開日 2026-08-26
📖 1 分で読めます☕ さくっと読める

原著者: Shengxin Zhang, Xiaomin Wu, Xiyang Wu, Jing Xie

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

コンピュータプログラムが困難な問題を解決しようとする際、しばしば単一の思考の筋道、つまり答えへと導く一連の言葉を生成します。長年、研究者たちは、これらのプログラムにより多くの時間とより多くの試行を与えることで、より賢くすることができるのではないかと考え続けてきました。最初の答えを受け入れる代わりに、コンピュータにやり直しをさせたり、問題をより小さな断片に分解させたり、あるいは複数の異なる解決策を生成させてその中から最善のものを選ばせたりすることはできるのでしょうか。この問いは、現代の人工知能研究の核心に位置しています。現在、この分野は、推論を向上させるために余剰な計算資源をどのように費やすかという、多くの異なる戦略で溢れています。モデルに自身の答えを洗練させるよう求める手法もあれば、複雑なタスクを一連の単純なステップへと分解させる手法もあり、また、多くの独立した試行を生成させてその結果に対して多数決を行う手法もあります。これらのアプローチはそれぞれ、異なるテスト問題や異なる採点ルールを用いて個別にテストされてきたため、同じ計算予算(コンピューティング・バジェット)を用いた場合に、どの戦略が実際に最も効果的なのかを知ることは不可能でした。

ある研究チームは、これらの異なる戦略を、システムが問題を解決するために自身を呼び出す行為である「再帰(リカーション)」という単一のプロセスのバリエーションとして扱うことで、この論争に決着をつけようと試みました。彼らは、コンピュータが行うこれら3つの明確に異なる方法を定義しました。第一に、彼らが「グロウ(成長)」と呼んだ手法は、単一の思考の筋道を取り上げ、コンピュータにそれを拡張させ、同じ経路を何度も洗練させるものでした。第二に、「プルーン(剪定)」は、困難な問題を順序立てられた一連の小さな質問へと分解させ、それらを一つずつ解決し、最後に答えを再び繋ぎ合わせることをコンピュータに求めるものでした。第三に、「ブランチ(分岐)」は、一度に5つの全く異なる解決策を生成させ、その中で最も多く現れたものを選択させるものでした。公平な比較を確実にするため、研究者たちはこれら3つの手法を、標準的なシングルパス(一回限りの試行)の試行とともに、全く同じ問題セットを用い、全く同じコンピュータモデル上で実行しました。彼らは、複雑な多段階の論理パズルから大学院レベルの学術的な質問に至るまで、5つの異なるタイプの課題にわたってこれらの手法をテストし、利用可能な最も高度なAIモデルのうち3つを使用しました。

この制御された実験の結果は明白であり、かつ、いくぶん驚くべきものでした。「ブランチ」法、すなわち複数の解決策を生成して最善のものを投票によって選ぶ戦略は、彼らが実施したすべてのテストケースにおいて、回答の正確性を向上させました。平均して、この手法は標準的な単一試行と比較して、正解率をほぼ6パーセントポイント向上させました。対照的に、他の2つの手法は一貫性を欠いていました。「グロウ」法、すなわち単一の経路を深める手法は、ほとんどのケースでパフォーマンスを向上させましたが、特定の種類の困難な問題を解く際にはコンピュータの性能を悪化させました。「プルーン」法、すなわち問題を分解する手法は、ランダムなノイズと区別がつかないほど、ごくわずかな改善しか示しませんでした。データは、どの問題に対してどの手法を使うかを決定するための複雑なシステムは不要であることを示唆していました。単に複数の経路を試し、コンセンサス(合意)を得た勝者を選ぶという手法が、全体として優れた選択肢であったのです。

研究者たちは、なぜこの投票法がこれほど上手くいったのかを理解するためにさらに深く掘り下げ、その理由は予想とは異なるものであることを発見しました。一般的な信念では、複数の回答を生成することが役立つのは、コンピュータが多くの異なる論理的経路を探索し、その中から正しいものを見つけることができるからだとされてきました。しかし、データが示したのは、主な利点が別の源泉、すなわち「失敗からの回復」にあるということでした。これらの高度なコンピュータモデルに長時間思考を求めると、答えを書き終える前に割り当てられたメモリ空間を使い果たしてしまうことがよくあります。単一の試行では、これは空白の応答となり、誤答としてカウントされます。しかし、コンピュータに5回試行させる場合、5回の試行すべてが全く同じ瞬間に失敗する確率は非常に低くなります。投票システムは、空白の回答を自動的に破棄し、成功した試行から有効な回答を選択します。研究者たちは、標準的な手法が回答を出力できずに失敗した頻度と、投票法がスコアをどれほど向上させたのかとの間に強い関連性があることを見出しました。最も困難なテストにおいて、投票法は空白の失敗回答の割合を半分に減少させました。

この発見は、人工知能をより賢くする方法についての考え方を変えるものです。これは、コンピュータに何度も試行させることから得られる利益の大部分が、単に技術的な限界によって失われるはずの回答を回収しているだけであることを示唆しています。研究者たちはまた、将来の研究に対する重要な教訓も強調しました。それは、「結果をどのようにカウントするか」が極めて重要であるということです。初期の分析において、彼らはネットワーク接続の失敗やタイムアウトを誤答としてカウントした場合、投票法が一部のタスクにおいてパフォーマンスが悪化するように見えることを発見しました。これは、投票法の方が試行回数が多いため、技術的な不具合に遭遇する機会も増えるからです。すべての手法が正常に回答できた問題のみに厳密に比較することで、研究者たちは真のパフォーマンスを明らかにしました。彼らの研究は、現在利用可能な最も有能なモデルにとって、最も信頼できる方法は「複数回試行してコンセンサスを得る」という最も単純な戦略であり、その利点は、より巧妙な解決策への経路を見つけることよりも、むしろコンピュータに思考を完結させることにあることを実証しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →