← 最新の論文
🤖 AI

MARS: Modular Agent with Reflective Search for Automated AI Research

MARS は、予算を考慮したモンテカルロ木探索による計画、モジュール化された設計・分解・実装パイプライン、および比較的反射的記憶を統合することで複雑な機械学習エンジニアリングのボトルネックを克服し、MLE-Bench において最先端の性能を達成する自律型 AI 研究のための新規フレームワークである。

原著者: Jiefeng Chen, Bhavana Dalvi Mishra, Jaehyun Nam, Rui Meng, Tomas Pfister, Jinsung Yoon

公開日 2026-05-21
📖 1 分で読めます☕ さくっと読める

原著者: Jiefeng Chen, Bhavana Dalvi Mishra, Jaehyun Nam, Rui Meng, Tomas Pfister, Jinsung Yoon

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

高価な料理コンテストで優勝しようとしていると想像してください。ただし、非常に厳しいルールがあります:料理に使えるのは 24 時間のみで、玉ねぎを切るのに費やすすべての分が、あなたのお金として差し引かれるというものです。

この問題を解決しようとするほとんどのコンピュータプログラムは、一度にすべてを切り始めようとするアマチュア料理人のようです。彼らは、すべてを一度に行おうとする巨大で無秩序なレシピ(「モノリシックなスクリプト」)を書きます。もしスープを焦がしたら、彼らは鍋全体を捨てて、最初からやり直します。彼らは水を沸かすのにどれだけの時間がかかるかなど気にしません。スープが美味しくなることだけを望んでいるのです。AI 研究の現実世界において、これは災難です。なぜなら、AI モデルのトレーニングは巨大な鍋でスープを沸かすようなもので、多くの時間と電力を要するからです。

この論文は、MARS(Modular Agent with Reflective Search:反省的探索を備えたモジュール型エージェント)を紹介しています。これは、専門家のチームと賢いノートを持ったマスターシェフのようです。

以下に、MARS の仕組みを 3 つの簡単な部分に分けて説明します。

1. 「予算を考慮した」探索(賢いプランナー)

「最高のレシピを当てる」というゲームをしていると想像してください。ただし、材料と時間には限られた予算があります。

  • 従来の方法: 10 時間かかるレシピであっても、思いつくすべてのレシピを試します。もしそれがわずかに美味しくなるなら、他の何も作れなくなるほど時間が尽きても、それを選びます。
  • MARS の方法: MARS は予算を考慮した MCTS(モンテカルロ木探索)という戦略を使用します。これは時計を見ながら考える賢いプランナーのようなものです。レシピ A は 1 時間かかり、味は「まあまあ」で、レシピ B は 10 時間かかり、味がわずかに良い場合、MARS はレシピ A を選びます。わずかな改善のために 9 時間を浪費することは悪い取引だと知っているからです。それは常に、「この改善は追加の時間とお金の価値があるのか?」と問いかけます。

2. モジュール化された構築(組立ライン)

1 つの巨大な 50 ページのレシピを書く代わりに、MARS は調理プロセスを小さく分離されたステーションに分割します。

  • 従来の方法: 1 人のシェフが、1 つの混乱したスクリプトを書きます。ソースが間違っていた場合、それを修正するために 50 ページの文書全体を書き直す必要があります。
  • MARS の方法: MARS は**「設計 - 分解 - 実装」**というパイプラインを使用します。異なる「エージェント」(専門料理人)を特定のタスクに割り当てます。
    • エージェント Aは野菜(データ)を扱います。
    • エージェント Bはスパイス(モデルアーキテクチャ)を扱います。
    • エージェント Cは調理(トレーニング)を扱います。
      ソースが塩辛すぎた場合、MARS は「スパイスエージェント」の指示のみを変更します。野菜や肉には手を触れません。これにより、コードの修正が容易になり、テストがしやすくなり、システム全体がクラッシュする可能性が大幅に減ります。

3. 比較的反省的メモリ(「なるほど!」ノート)

これが最も魔法のような部分です。通常のキッチンでは、料理が失敗した場合、「うまくいかなかった」と言って次に進むかもしれません。

  • 従来の方法: AI エージェントは、料理が失敗した理由を忘れることが多いです。特定の原因を学んでいないため、同じ間違いを繰り返す可能性があります。
  • MARS の方法: MARS は**「比較的反省的メモリ」*を保持します。新しい料理が古いものより良くなった場合、MARS は単に「お疲れ様でした」と言うだけではありません。探偵のように行動します。古いレシピと新しいレシピの正確な*違いを比較します。
    • 例: 「ああ!新しい料理が良いのは、塩をひとつまみ追加し、かつ 2 分長く調理したからです。鍵となったのは時間ではなく塩でした。」
    • これを**「教訓」**として書き留めます。後で、全く異なる料理を試す際、「ねえ、塩はこの種の問題に役立つと学んだよ」と言い、その教訓を探索の全く異なる枝に応用できます。
    • 論文によると、MARS が使用した教訓の**63%**は、これらの「枝間転移」から得られたものでした。つまり、ある種類の問題から学び、それを全く異なる問題に成功裏に適用したのです。これが「なるほど!」の瞬間です。

結果

研究者たちは、MARS をMLE-Benchでテストしました。これは、テキスト分析から画像認識まで、75 種類の異なる課題を含む、巨大で困難な料理コンテストのようなものです。

  • コンペティション: 他の AI エージェント(AIDE や AIRA など)はこれらの問題を解決しようとしましたが、しばしば行き詰まり、無秩序なコードを書いたり、報われない高価な実験に時間を浪費したりしました。
  • 勝者: MARS は、他のオープンソースシステムよりも多くのメダル(金、銀、銅)を獲得しました。単に運が良かっただけではなく、効率的でした。高価で価値の低い実験に時間を浪費せず、構造化された方法で間違いから学ぶことで、より良い解決策を迅速に見つけ出しました。

要約すると: MARS は単に「ランダムなことを試す」だけの AI 研究者ではありません。時間を慎重に計画し、大きな問題を小さく管理しやすいピースに分解し、何が成功し何が失敗したのかの正確な詳細をノートに記録します。これにより、競合他社よりもはるかに速く学習し、改善することが可能になります。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →