✨ 要約🔬 技術概要
ロボットにパズルを解かせたり、詩を書かせたり、あるいはビデオゲームのキャラクターを勝利に導くためのトレーニングを行ったりすることを想像してみてください。人工知能の世界では、これを「最適化(optimization)」と呼びます。通常、人間はサイドラインに立つ厳格なコーチのような役割を果たします。彼らは「これを試し、次にあれを試し、もし失敗したら戻って別のことを試せ」といった、硬直したゲームプランを設計します。ロボット(大規模言語モデル)は単なるプレイヤーであり、人間というコーチが大きな戦略を決定する間、指示に従って小さな変更を盲目的に実行するだけなのです。しかし、もしロボット自身がコーチになれるとしたらどうでしょうか? もしロボットがスコアボードを見つめ、なぜ負けたのかを理解し、ゲームのルールを変更することを決め、あるいは自分が行き詰まっていることに気づいて全く新しいアプローチが必要だと自ら判断できるとしたら? この論文は、まさにその問いを探求しています。単一のスマートなAIエージェントが、人間が書いたスクリプトに思考方法を指示されることなく、自らの最適な解への探索を管理する方法を学ぶことができるのでしょうか?
COLM 2026カンファレンスで発表されたこの研究の背後にいる研究者たちは、「ReASearch」と呼ばれる新しいシステムを紹介しています。これは、ロボットにただのハンマーではなく、スイスアーミーナイフを手渡すようなものだと考えてください。かつてのAIオプティマイザー(最適化器)は、固定されたコンベアベルトを持つ工場の組立ラインのようなものでした。人間が設計したアルゴリズムが、次にどの候補となる解をテストするか、どれだけの時間を費やすか、そしていつ諦めるかを決定していました。AIの仕事は、現在の解に対して小さな編集をささやくことだけでした。ReASearchはこの脚本を覆します。それは、コードを実行するためのPythonインタープリタや、過去のミスを記憶するためのメモリファイル、そして実験を実行する能力といった一連のツールをAIエージェントに与え、その上でエージェント自身にすべてを決定させるのです。エージェントは自問します。「まずこのアイデアを小さなサンプルでテストすべきか? 今、同じ間違いを二度繰り返さなかったか? 現在の計画を捨てて、以前試したより優れた計画に戻るべきか?」 エージェントは単に推測しているのではなく、プロセスを通じて推論し、進展しながら戦略を構築しているのです。
チームはこの「自己コーチング型」エージェントを、テキストプロンプトを賢くするための微調整から、数学パズルを解くためのコンピュータプログラムの進化、さらには機械学習のトレーニングワークフローの最適化に至るまで、14種類の異なる課題でテストしました。結果は驚くほど強力なものでした。多くの場合、ReASearchは、特定のハードコードされたルールを持つ人間の専門家によって構築された特化型システムを打ち負かしました。例えば、「サークルパッキング(円を正方形の中にできるだけ密に詰め込む作業)」と呼ばれるタスクでは、このエージェントは人間がこれまでに見つけた最高の結果よりも優れた解を発見しました。他のタスクでは、パフォーマンスを2%から、時には40%という大幅な向上を実現しました。
本当に興味深いのは、エージェントが「どのように」それを行ったかです。研究者たちは、エージェントが、誰に教えられたわけでもないのに、自然と熟練した科学者やチェスのグランドマスターのように振る舞い始めたことを見出しました。エージェントは、あるアイデアを確定させる前に、それを「再確認」し始めました。新しい道が袋小路に突き当たったとき、以前のより安全なバージョンの解へと「差し戻す(リバート)」ことを学びました。また、同じエラーを繰り返さないために、「学んだ教訓」のジャーナルを記録し始めました。最も印象的なのは、問題を解決するために2つの異なるテクニックを組み合わせる必要があることを、エージェントが自力で理解したことです。これは通常、深い人間的洞察を必要とする発見です。この論文は、AIに適切なツールを与え、プロセスを通じて推論させることで、以前は人間が設計したアルゴリズムによって管理される必要があると考えていた複雑な探索戦略を、AIが内面化できることを示唆しています。結局のところ、オプティマイザーは分離された硬直したコントローラーである必要はなく、オプティマイザーそのものがエージェントになれるのです。
技術要約:オプティマイザ(最適化器)はエージェントである (ReASearch)
問題提起
テキストベースのアーティファクト(具体的にはシステムプロンプト、プログラム、および機械学習(ML)ワークフロー)の最適化は、現代のAIにおける中心的な課題であり続けている。従来のアプローチでは、通常、外部の設計されたアルゴリズム制御器(例:進化探索、バンディット、ベイズ最適化、またはテキスト勾配)に依存して、探索ポリシーを管理してきた。これらのフレームワークにおいて、大規模言語モデル(LLM)は、硬直した定義済みのループ内で局所的な編集を実行するだけの、ステートレスな「変異体」または「提案生成器」として機能している。著者らは、この分離によって根本的な問いが未解決のまま残されていると主張する。すなわち、**「探索ポリシーのどれほどの割合を、単一の推論エージェントによって内部化できるか?」**という問いである。
手法:ReASearch
本論文は、ツールを使用するLLMエージェントに最適化ループの全権を委ねる、統一された「コントローラー・ライト(制御器を最小化した)」フレームワークであるReASearch (Reasoning-driven Agentic Search:推論駆動型エージェント探索)を導入する。外部の数学的メタヒューリスティックに探索、予算配分、および候補選択を指示させるのではなく、ReASearchは最適化プロセス全体を、エージェントが自律的に呼び出す一連のツールとして公開する。
コア・アーキテクチャ
統一エージェント・ループ: システムは、単一のタスク非依存のエージェント・スキャフォールド(足場)を採用している。エージェントは、ドメインのガイダンスと現在の最適化状態を含むシステムプロンプト、およびそのインタラクション履歴を受け取る。
ツールベースのインターフェース: すべての最適化操作はツールとしてパッケージ化されている。エージェントは、自身の推論に基づいて次に呼び出すべきツールを決定する。主なツールは以下の通りである:
実行と分析: python_exec により、エージェントは分析スクリプトを記述し、統計量を計算し、失敗パターンの診断をプログラム的に行うことができる。
評価: ドメイン固有のツール(例:validate_candidate、run_experiment、evaluate)により、エージェントは仮説をテストできる。
編集: edit_code や edit_train_file といったツールは、メインエージェントのコンテキストをクリーンに保つために、変更をサブエージェントへとルーティングする。
メモリ: 永続的な lessons.md ファイルとコンテキスト圧縮メカニズムにより、エージェントはコンテキストウィンドウを越えて、長期的な洞察(何が機能し、何が失敗し、次に何を試すべきか)を保持することができる。
ドメイン適応: 同じエージェント・スキャフォールドが、利用可能なツールとシステムプロンプトを変更するだけで、3つの異なるドメインに適用される:
プロンプト最適化: エージェントは訓練ミニバッチを適応的にサンプリングし、検証セットで候補を評価し(過学習を防ぐための集計メトリクスを使用)、失敗モードを診断する。
プログラム進化: 単一インスタンスの難問(例:ARC-AGI-2、円充填問題)に対してコードを反復的に修正する。コードの編集と検証にはサブエージェントを使用し、仮説形成のための永続的な推論コンテキストを維持する。
MLワークフロー最適化: エージェントは訓練スクリプトを修正し、時間制限付きの実験を実行し、訓練曲線を分析してボトルネック(例:学習率スケジュールの選択、アーキテクチャの選択、正則化)を診断する。
創発的挙動
本論文では、明示的なコントローラーによって実装される複雑な探索挙動が、ハードコーディングされることなく、エージェントの推論プロセスから自然に創発することを観察している:
二重検証 (Double-Verification): 高価な検証を行う前に、有望な利得をさらなるサンプルで再確認する。
仮説駆動型の改訂 (Hypothesis-Driven Revision): 蓄積された証拠に基づいて構造的な仮説を形成し、それをテストする。
リバートによる回復 (Revert-Based Recovery): ある経路が失敗した場合、盲目的に継続するのではなく、以前の既知の良好なブランチに意図的に戻る。
適応的探索 (Adaptive Exploration): 予算制約や観察された分散に基づいて探索戦略を調整する。
主な貢献
統一フレームワーク: ReASearchは、テキストベースの最適化を逐次的な推論問題として描き出し、単一のエージェント設計がプロンプト、プログラム、およびMLワークフローを最適化できることを示した。
性能向上: 14の多様なタスクにおいて、ReASearchは同一の計算予算内で、特化型の最先端システム(例:GEPA、AdaEvolve、Claude Code)と同等またはそれ以上の性能を一貫して示した。利得は強力なドメイン固有のベースラインに対して**2%から40%**に及ぶ。
人間レベルの発見: 円充填問題やハイロン三角形問題などの特定のタスクにおいて、ReASearchは従来の人間による最良の結果を上回る解を発見した。
探索ロジックの内部化: 本研究は、最前線のツール使用エージェントが、これまで外部の数学的メタヒューリスティックに委ねられていた候補検証、因果診断、適応的探索といった、探索ロジックのかなりの部分を内部化できることを実証した。
実験結果
著者らは、3つのカテゴリにわたってReASearchを特化型のベースラインと比較評価した:
プロンプト最適化: AIME、GSM8K、HotpotQA、およびTerminal-Bench 2.0において、ReASearchはGEPAを上回った。例えば、Terminal-Bench 2.0では、GEPAの**42.22%に対し、ReASearchは 53.33%**の精度を達成した。エージェントは構造化されたタスク理解を構築し、単なるピーク検証スコアではなく、完全な最適化履歴に基づいて最終的なプロンプトを選択することに成功した。
プログラム進化:
円充填 (Circle Packing): ReASearchは、n = 32 n=32 n = 32 において2.940という結果(既知の最良人間結果である2.939に匹敵またはわずかに上回る)を達成し、AdaEvolveを大幅に上回った。
ハイロン三角形 (Heilbronn Triangle): エージェントは探索空間を圧縮するための数学的対称性(D4対称性)を特定し、ベースラインが失敗した場面で、近最適解(n = 12 n=12 n = 12 で0.03260)を達成した。
ARC-AGI-2: ReASearchは、ブルートフォース的な探索ではなく、反復的な分析を用いて変換ルールを導出することで、ARC-AGI-2において**50.0%**のテスト精度(Sonnet 4.6)を達成した。これはAdaEvolveの12.5%から4倍の改善である。
MLワークフロー最適化: Claude Code(AutoResearch設定)と比較して、ReASearchはIMG-100(83.99% vs 78.59%)、Atari Q*bert(4500 vs 1250 reward)、およびMuJoCo(5267 vs 3986 reward)において明確な優位性を示した。特筆すべきは、Kaggleのクリプト予測タスクにおいて、ReASearchは15回の実験以内にリーダーボードの順位を36位から6位 へと押し上げた一方で、ベースラインは停滞したことである。
意義と主張
本論文は、**「推論は単にタスクを解決するためだけではなく、それ自体が強力なオープンエンドな探索のエンジンになり得る」**と論じている。ReASearchの意義は、「オプティマイザ(最適化器)」は別個の、手作業で設計されたアルゴリズム制御器である必要はないということを示した点にある。代わりに、適切なツールを備えた単一の推論駆動型エージェントは、これまで外部のメタヒューリスティックの領域であった予算管理、失敗診断、戦略適応といった複雑な探索ポリシーを内部化できるのである。
著者らは、このアプローチがより柔軟で、潜在的に強力なパラダイムを提供すると主張している。そこでは、教訓を蓄積し、因果的な失敗について推論し、長期的な展望にわたって戦略を適応させるエージェントの能力が、多様なモダリティにわたって優れたパフォーマンスをもたらす。本研究は、「探索者(searcher)」と「解決者(solver)」の区別が消滅し、エージェントがその両方を担う未来を示唆している。
毎週最高の AI 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。 登録 ×