← 最新の論文
🤖 machine learning

PACEvolve++: Improving Test-time Learning for Evolutionary Search Agents

PACEvolve++ は、学習可能なアドバイザーとフロンティアモデルを用いて戦略的仮説の選択と実装を分離し、多様な工学および科学タスクにおいてより迅速な収束と安定したテスト時学習を実現するためにフェーズ適応型トレーニング戦略を採用する、進化探索エージェント向けの強化学習フレームワークを導入する。

原著者: Minghao Yan, Bo Peng, Benjamin Coleman, Ziqi Chen, Zhouhang Xie, Shuo Chen, Zhankui He, Noveen Sachdeva, Weili Wang, Ed H. Chi, Shivaram Venkataraman, Wang-Cheng Kang, Derek Zhiyuan Cheng, Beidou Wang

公開日 2026-05-11
📖 1 分で読めます☕ さくっと読める

原著者: Minghao Yan, Bo Peng, Benjamin Coleman, Ziqi Chen, Zhouhang Xie, Shuo Chen, Zhankui He, Noveen Sachdeva, Weili Wang, Ed H. Chi, Shivaram Venkataraman, Wang-Cheng Kang, Derek Zhiyuan Cheng, Beidou Wang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

超効率的な新機械を発明しようとしている自分を想像してください。あなたは、少しカオスだが brilliant な「アイデア生成器(小さな AI)」と、極めて熟練した「マスター・ビルダー(強力な AI)」を持っています。

この発明プロセスを自動化しようとするこれまでの大半の試みでは、同じ AI が両方の役割を担わされていました。つまり、アイデアを考え出し、かつ機械を構築するのです。もし機械が機能しなかった場合、その AI はアイデアが悪かったのか、それともビルダーが単にミスを犯したのかを区別できませんでした。これは、建設チームが間違ったレンガを使ったせいで屋根が漏れているのに、建築家に責任を転嫁するようなものです。

PACEvolve++ は、役割を分離し、「アイデア生成器」が作業中により賢くなる方法を教えることで、この問題を解決する新しいシステムです。その仕組みを簡単に分解して説明します。

1. 2 チーム戦略

すべてのことを 1 つの AI が行うのではなく、PACEvolve++ は 2 人のチームを使用します。

  • アドバイザー(ストラテジスト): これは小さく、学習可能な AI です。その唯一の役割は、現在の最良の機械を分析し、新しいアイデアをブレインストーミングし、どれが新規性があるかを推測し、次に試す最良のアイデアを選ぶことです。これは「何を試すか」を学びます。
  • フロンティアモデル(ビルダー): これはすでにコーディングに非常に長けた、巨大で強力な AI です。アドバイザーが選んだアイデアを受け取り、それを実際に機能するコードに変換します。これは「どのように構築するか」という重労働を担います。

これらを分離することで、システムはコードが完璧かどうかを気にすることなく、アドバイザーの戦略能力を向上させることができます。コードが失敗した場合、それは戦略の問題ではなく、構築の問題です。

2. 「フェーズ適応型」コーチ

最大の課題は、完璧な解に近づくにつれて「ゲーム」が変化することです。論文は、探索の進捗度合いに応じてアドバイザーをコーチングする必要があると主張しています。

  • フェーズ 1:野生の探索(序盤)

    • 状況: 始めたばかりです。アイデアは散らばっており、中には狂気の、退屈な、あるいは brilliant なものがあります。
    • コーチング: システムはアドバイザーに伝えます。「アイデアの全体像を見て、平均よりも優れているものはどれか?新しい方向性を探し出せ!」
    • 比喩: 新しいキャンプ場を探すスカウトを想像してください。始めのうちは網を広げ、多くの谷や丘を見て回ります。コーチは、絶対的に最善でなくても、有望なエリアを「見つけた」こと自体を評価します。
  • フェーズ 2:微調整(終盤)

    • 状況: 素晴らしい場所を見つけましたが、今は数インチの高さを削るか、景色を改善しようとしている段階です。アイデア間の違いは微小です。
    • コーチング: システムはルールを変更します。「どのアイデアが平均より優れているか?」と問うのをやめ、「この特定のアイデアが実際に『最良の記録』を押し上げたか?」と問うように切り替えます。
    • 比喩: 今やスカウトは発見した最良の丘の上に立っています。コーチは「良い」丘には関心を示さず、現在のチャンピオンを「厳密に上回る」場所を見つけられたかどうかだけを気にします。もし新しい場所が単に「まあまあ」であれば、評価されません。これにより、システムが微小で無意味な違いに混乱するのを防ぎます。

3. なぜこれが重要なのか

過去、AI システムが解を進化させようとした際、最初から最後まで同じ「コーチング」手法を使用しようとしたため、行き詰まったりクラッシュしたりすることがよくありました。

  • 「序盤」のルールを遅すぎまで使用すると、AI は微小な違いに混乱し、暴走します(不安定性)。
  • 「終盤」のルールを早すぎに使用すると、AI は探索を放棄し、同じ安全なアイデアを繰り返すだけで(行き詰まり)、進歩しなくなります。

PACEvolve++ は、探索が進むにつれて自動的にコーチングスタイルを切り替えます。最初は広範な探索を促し、記録を破る微小な改善のみを評価するように、スムーズに「完璧な詳細」へと移行します。

結果

著者らは、この手法を 3 つの困難な実世界の工学タスクでテストしました。

  1. コンピュータのワークロードのバランス調整: 異なるコンピュータチップ間でタスクを均等に共有させること。
  2. レコメンデーションシステム: アプリがユーザーに次の動画や製品を提案する方法を改善すること。
  3. タンパク質設計: タンパク質の構造変化がその機能にどう影響するかを予測すること。

3 つのケースすべてにおいて、PACEvolve++ は従来の手法よりも速く、より優れた解を見つけました。単に良い答えを見つけただけでなく、システムが途中でクラッシュしたり混乱したりすることなく、最良の答えをより迅速に見つけ出しました。

要約すると: PACEvolve++ は、AI に発明の方法を教えるより賢い方法です。これは戦略家とビルダーの間に仕事を分担し、状況が要求するまさにその瞬間に、教え方を「探索せよ」から「詳細を完璧にせよ」へと変化させます。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →