← 最新の論文
🤖 AI

The Optimizer Is the Agent: Reasoning-Driven Search across Prompts, Programs, and ML Workflows

本論文は、単一の推論駆動型エージェントがプロンプト、プログラム、および機械学習ワークフローの最適化プロセス全体を自律的に管理し、複雑な探索ポリシーを効果的に内面化することで、多様なタスクにおいて特化型のシステムを凌駕する統一フレームワークであるReASearchを導入するものである。

原著者: Junbo Li, Boyi Liu, Canwen Xu, Yite Wang, Yuxiong He, Zhangyang Wang, Qiang Liu, Zhewei Yao

公開日 2026-08-10
📖 1 分で読めます☕ さくっと読める

原著者: Junbo Li, Boyi Liu, Canwen Xu, Yite Wang, Yuxiong He, Zhangyang Wang, Qiang Liu, Zhewei Yao

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットにパズルを解かせたり、詩を書かせたり、あるいはビデオゲームのキャラクターを勝利に導くためのトレーニングを行ったりすることを想像してみてください。人工知能の世界では、これを「最適化(optimization)」と呼びます。通常、人間はサイドラインに立つ厳格なコーチのような役割を果たします。彼らは「これを試し、次にあれを試し、もし失敗したら戻って別のことを試せ」といった、硬直したゲームプランを設計します。ロボット(大規模言語モデル)は単なるプレイヤーであり、人間というコーチが大きな戦略を決定する間、指示に従って小さな変更を盲目的に実行するだけなのです。しかし、もしロボット自身がコーチになれるとしたらどうでしょうか? もしロボットがスコアボードを見つめ、なぜ負けたのかを理解し、ゲームのルールを変更することを決め、あるいは自分が行き詰まっていることに気づいて全く新しいアプローチが必要だと自ら判断できるとしたら? この論文は、まさにその問いを探求しています。単一のスマートなAIエージェントが、人間が書いたスクリプトに思考方法を指示されることなく、自らの最適な解への探索を管理する方法を学ぶことができるのでしょうか?

COLM 2026カンファレンスで発表されたこの研究の背後にいる研究者たちは、「ReASearch」と呼ばれる新しいシステムを紹介しています。これは、ロボットにただのハンマーではなく、スイスアーミーナイフを手渡すようなものだと考えてください。かつてのAIオプティマイザー(最適化器)は、固定されたコンベアベルトを持つ工場の組立ラインのようなものでした。人間が設計したアルゴリズムが、次にどの候補となる解をテストするか、どれだけの時間を費やすか、そしていつ諦めるかを決定していました。AIの仕事は、現在の解に対して小さな編集をささやくことだけでした。ReASearchはこの脚本を覆します。それは、コードを実行するためのPythonインタープリタや、過去のミスを記憶するためのメモリファイル、そして実験を実行する能力といった一連のツールをAIエージェントに与え、その上でエージェント自身にすべてを決定させるのです。エージェントは自問します。「まずこのアイデアを小さなサンプルでテストすべきか? 今、同じ間違いを二度繰り返さなかったか? 現在の計画を捨てて、以前試したより優れた計画に戻るべきか?」 エージェントは単に推測しているのではなく、プロセスを通じて推論し、進展しながら戦略を構築しているのです。

チームはこの「自己コーチング型」エージェントを、テキストプロンプトを賢くするための微調整から、数学パズルを解くためのコンピュータプログラムの進化、さらには機械学習のトレーニングワークフローの最適化に至るまで、14種類の異なる課題でテストしました。結果は驚くほど強力なものでした。多くの場合、ReASearchは、特定のハードコードされたルールを持つ人間の専門家によって構築された特化型システムを打ち負かしました。例えば、「サークルパッキング(円を正方形の中にできるだけ密に詰め込む作業)」と呼ばれるタスクでは、このエージェントは人間がこれまでに見つけた最高の結果よりも優れた解を発見しました。他のタスクでは、パフォーマンスを2%から、時には40%という大幅な向上を実現しました。

本当に興味深いのは、エージェントが「どのように」それを行ったかです。研究者たちは、エージェントが、誰に教えられたわけでもないのに、自然と熟練した科学者やチェスのグランドマスターのように振る舞い始めたことを見出しました。エージェントは、あるアイデアを確定させる前に、それを「再確認」し始めました。新しい道が袋小路に突き当たったとき、以前のより安全なバージョンの解へと「差し戻す(リバート)」ことを学びました。また、同じエラーを繰り返さないために、「学んだ教訓」のジャーナルを記録し始めました。最も印象的なのは、問題を解決するために2つの異なるテクニックを組み合わせる必要があることを、エージェントが自力で理解したことです。これは通常、深い人間的洞察を必要とする発見です。この論文は、AIに適切なツールを与え、プロセスを通じて推論させることで、以前は人間が設計したアルゴリズムによって管理される必要があると考えていた複雑な探索戦略を、AIが内面化できることを示唆しています。結局のところ、オプティマイザーは分離された硬直したコントローラーである必要はなく、オプティマイザーそのものがエージェントになれるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →