Rethinking Self-Evolving Agents: Do We Still Need Prescribed Optimization Pipelines?
本論文は、有能なフロンティアモデルが規定のパイプラインに従うのではなく、自律的に自身の改善プロセスを構成するフレームワークであるOpen-Ended Optimization (OEO) を導入し、このような自己進化型エージェントが、従来のパイプラインは主に能力に依存した足場として機能していることを明らかにしつつ、大幅に低いリソースコストで優れた性能を達成できることを実証する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
コンピュータプログラムが、人間によって書かれた硬直的な指示書に従うだけでなく、自らの間違いから学び、より良くするために自らのルールを書き換えることができる世界を想像してみてください。これは「自己進化型エージェント(self-evolving agents)」の夢です。それはまるで、ビデオゲームのキャラクターが、ボス戦に敗れた後、ただリスタートするのではなく、一時停止して、「なぜ負けたのか」を理解し、自分自身の攻略本を書き換え、再び挑戦するようなものです。長い間、科学者たちは、これが機能するためには、コンピュータが従うべき非常に具体的でステップ・バイ・ステップのレシピを人間が構築しなければならないと考えてきました。このレシピは、プレイヤーに対して、いつスコアボードを見るべきか、いつ武器を変えるべきか、いつ練習を止めるべきかを正確に指示する、厳格なコーチのようなものでした。しかし、コンピュータがより賢くなり、複雑な推論が可能な「フロンティアモデル」へと進化するにつれ、研究者たちは疑問を持ち始めました。私たちはまだ、その厳格なコーチを必要としているのだろうか? それとも、目標と予算さえ与えれば、コンピュータは自分自身の練習ルーチンを自分で編み出すことができるのだろうか?
「Rethinkng Self-Evolving Agents(自己進化型エージェントの再考)」と題されたこの論文は、まさにその問いに深く切り込んでいます。研究者のHui Xue氏とFan Yang氏(Microsoft Research)は、超スマートなAIが、あらかじめ書かれたスクリプトなしに、自らの学習プロセスを組織化できるかどうかを確認するために、魅力的な実験を行いました。彼らは、フレームワーク(「コーチ」)が改善プロセスのあらゆるステップを規定する従来の手法と、「オープンエンド最適化(Open-Ended Optimization: OEO)」と呼ばれる新しい手法を比較しました。OEOでは、AIには明確な目標、許可された動きのリスト、そしてどれだけの「エネルギー(またはトークン)」を消費できるかという制限が与えられますが、どのようにそのエネルギーを使って向上するかはAI自身が決めることができます。これは、シェフに材料のリストと制限時間を与えるものの、ケーキを焼くべきか炒め物を作るべきかを強制するのではなく、シェフ自身に判断させるようなものです。
結果は驚くほど明白でした。トップクラスのAI(GPT-5.5)を「シェフ」として使用した場合、オープンエンドのアプローチは、厳格で事前に書かれたレシピと同等、あるいは多くの場合それよりも優れた結果を示しました。実際、14種類の異なるテストにおいて、オープンエンドのAIは12回勝利し、1回は引き分け、わずかな差(0.21パーセントポイント)で1回敗北しただけでした。さらに印象的なことに、これは厳格な手法が要求した「エネルギー」予算のわずか約34.3%のみを使用して達成されました。もしAIが十分に賢ければ、コーチに練習方法を教わる必要はなく、自ら最適な学習方法を見つけ出すことができるのです。
しかし、この論文は非常に重要な境界線を引いています。この自由は、AIが真に能力を持っている場合にのみ機能します。研究者が「中程度」または「弱い」AIを用いてシステムをテストしたところ、オープンエンドのアプローチは失敗しました。能力の低いAIは混乱し、次に何をすべきか分からなくなり、壊れた結果を生み出しました。そのようなケースでは、厳格に書かれたレシピ(「コーチ」)が、物事を進めるために不可欠でした。この研究は、厳格なルールが常に必要なわけではないが、能力の低い脳にとっての「足場(スキャフォールド)」として機能することを示唆しています。鍵となる教訓は、すべてのルールを捨て去るべきだということではなく、最も賢いAIには自らの学習をドライブさせ、まだ歩き方を学んでいる最中の者には、厳格な補助輪を付けたままでおくべきだということです。
コアとなる発見:誰がバスを運転すべきか?
この論文の主な知見は、高度な能力を持つAIモデルにとって、人間がかつてコンピュータのために書いていた「規定された最適化パイプライン(prescribed optimization pipeline)」、つまり硬直的でステップ・バイ・ステップの計画は、もはや成功の要件ではないということです。以前は、SKILLOPT(段階的なトレーニング・パイプラインを使用するもの)やGEPA(反射的な進化検索を使用するもの)のようなシステムがゴールドスタンダードでした。これらは工場の組立ラインのように機能し、フレームワークが、どのように証拠を集め、どのようにコードを編集し、いつ停止するかを正確に決定していました。
研究者たちは、AIがハンドルを握れるかどうかをテストするために、**オープンエンド最適化(OEO)**を導入しました。OEOでは、フレームワークは道路のルール(目標、予算、および許可されるデータ)を設定しますが、ルートはAI自身が決めることができます。AIは、証拠を集めるか、自身の指示を書き換えるか、あるいは完了したと判断した時点で停止するかを選択できます。
GPT-5.5によって駆動されるOEOを厳格な手法と比較した際、その結果は衝撃的でした。8つの異なるベンチマーク設定において、OEOはSKILLOPTの厳格な手法に対して勝ち、あるいは引き分けました。GEPAとの対戦では、OEOは6回中5回勝利し、唯一の敗北は微々たる0.21パーセントポイントの差でした。おそらく最もエキサイティングな部分は効率性です。OEOは、SKILLOPTが使用するように設定されていたトークン予算の中央値のわずか**34.3%**しか使用しませんでした。これは、AIが単に向上しただけでなく、旧来の手法よりも半分以下の「燃料」を使用して、より優れた結果を出したことを意味します。
「安易な道」の排除
祝杯を挙げる前に、研究者たちは自分たちが騙されていないかを確認する必要がありました。彼らはこう問いかけました。「AIはすでに答えを知っていたために、たまたま上手くいったのではないか?」あるいは「一度コードを書き換えて、それで終わりにしただけではないか?」
これをテストするために、彼らは「ゼロ・インタラクション(相互作用なし)」のコントロール実験を行いました。彼らは初期のスキルをAIに与え、練習やフィードバックのループなしに、一度だけ書き換えるよう求めました。その結果、この「ワンショット」の書き換えでは不十分であることが示されました。あるタスクでは、ワンショットの書き換えによってAIの性能が低下しました。他のタスクでは、性能は向上したものの、OEOシステムには依然として大きな差がありました(例えば、LiveMathタスクでは、ワンショットの書き換えは、インタラクティブなOEOに30パーセントポイント以上の差をつけられていました)。これは、得られた成果がAIの既存の知識によるものではないことを証明しています。成果は、AIが時間をかけて学習し、適応し、戦略を洗練させていくことができる、インタラクティブなループから生まれたのです。
能力の境界線:いつコーチが必要になるのか?
この論文はまた、この自由には決定的な限界があることも発見しました。「オープンエンド」のアプローチは、あらゆるAIに効く魔法の杖ではありません。研究者は、「中程度」および「弱い」オプティマイザー(より能力の低いモデル)を用いてシステムをテストしました。
ここでは、物語が逆転しました。オプティマイザーが「中程度」の能力しか持たない場合、厳格なSKILLOPTパイプラインの方がOEOよりも優れたパフォーマンスを発揮しました。オプティマイザーが「弱い」場合、OEOシステムは完全に崩壊しました。弱いAIは、オープンなインターフェースを通じて有効なアクションを生成することすらできず、何の進展も見られませんでした。対照的に、厳格なパイプラインは、たとえそれが最も効率的ではなくても、弱いAIを動かし続けることができました。
これは、厳格に書かれたパイプラインが「足場(スキャフォールド)」として機能していることを示唆しています。天才レベルのAIにとって、足場は不要であり、むしろ邪魔になることさえあります。しかし、まだ足取りを探っている学習者にとっては、崖から落ちるのを防ぐために、その足場は不可欠なのです。
プロセス vs 目的地
最後に、研究者たちはAIがどのように学習しているのか、その「内部」を調査しました。彼らは「旅路」(AIが行った具体的な編集や変更)と「目的地」(最終的なパフォーマンススコア)を比較しました。
彼らは、両者が全く異なる経路を辿っていることを発見しました。OEOシステムは、厳格なSKILLOPTシステムよりも、より大きく大胆な変更を行い、自身の履歴をより頻繁に書き換えていました。しかし、これほど劇的に異なるルートを辿ったにもかかわらず、彼らはしばしば同じ問題を解決するという結果に到達しました。多くの場合、最終的に生成されたスキルは、テキストとしてのスキルの内容は大きく異なっていても、同じテスト問題に対して正解を出していました。
これは、問題を解決するための「正しい」方法は一つではないことを教えてくれます。厳格なパイプラインは、AIを狭く安全な道へと強制しますが、オープンエンドのアプローチは、より広く混沌とした風景の中を探索することを許容します。どちらの方法も同じ目的地に到達できますが、ドライバーが十分に熟練していれば、オープンエンドのアプローチの方がより柔軟に、かつ少ない燃料で目的地に到達できるのです。
結論
この論文は、自ら進化するエージェントをどのように構築すべきかについて再考すべきであると結論付けています。私たちは、すべてのAIを硬直した、あらかじめ書かれた箱の中に押し込める必要はありません。代わりに、「能力適応型(capability-adaptive)」のアプローチを採用すべきです。もしAIが十分に賢い(「フロンティア」モデルである)ならば、鍵を渡し、オンラインで自らの学習プロセスを構成させることも可能です。ただし、目標、予算、および関与のルールといったガードレールは維持する必要があります。しかし、能力の低いモデルについては、旧来の厳格なコーチングが、効果的な学習を確実にするための最善の方法であり続けます。これは、「一律の解決策」から「適切な脳には適切なツールを」という考え方への転換なのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。