← 最新の論文
💬 NLP

AdaptEvolve: Improving Efficiency of Evolutionary AI Agents through Adaptive Model Selection

本論文は、本質的な生成信頼性に基づいて各改良ステップに最も適切な大規模言語モデルを動的に選択することで進化的AIエージェントの効率を向上させるフレームワーク「AdaptEvolve」を導入し、高い精度を維持しながら推論コストを約38%削減することを示す。

原著者: Pretam Ray, Pratik Prabhanjan Brahma, Zicheng Liu, Emad Barsoum

公開日 2026-04-27
📖 1 分で読めます☕ さくっと読める

原著者: Pretam Ray, Pratik Prabhanjan Brahma, Zicheng Liu, Emad Barsoum

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたが複雑なプログラミングパズルを解くことを目的とした、ハイリスクなコーディング競技を運営していると想像してください。あなたを助けるために利用可能な、2 種類の審査員がいます。

  1. ジュニアインターン(小規模モデル): 高速で安価、かつルーチンワークの処理に優れています。しかし、非常に難しくトリッキーな問題では行き詰まったり、ミスを犯したりする可能性があります。
  2. シニアエキスパート(大規模モデル): 極めて賢く、最も難しいパズルを解く能力を持っていますが、非常に遅く、雇用コストが高く、回答を得るまでに長い時間がかかります。

問題点:
従来の「進化的」AI システム(AI が試行、失敗、学習、再試行を繰り返すもの)では、システムは通常、1 人の審査員を選び、プロセス全体を通じてその人に固執します。

  • インターンのみを使用する場合、コストは節約できますが、最も難しいパズルを解決できない可能性があります。
  • エキスパートのみを使用する場合、すべてを解決できますが、莫大な費用がかかり、時間がかかりすぎます。
  • 一部のシステムは、誰を呼ぶかを決定する「ルールブック」(静的ルーティング)を使用しようとしますが、これらのルールは硬直的です。インターンが実際に自信を持っている時や、問題が突然難しすぎた時に気づくことができません。

解決策:AdaptEvolve
この論文の著者は、AdaptEvolveという新しいシステムを作成しました。これは、インターンの作業を監視し、その瞬間に「インターンに仕事を完了させるか、それともシニアエキスパートを呼び出すか」を決定する、賢くリアルタイムなマネージャーのようなものです。

以下に、簡単なアナロジーを用いてその仕組みを説明します。

1. 「自信の脈動」に耳を傾ける

外部の専門家に問題の難しさを推測させるのではなく、AdaptEvolve はインターン自身の「雰囲気」に耳を傾けます。

  • インターンがコードを入力している間、システムは彼らの自信を確認します。
  • 高自信: インターンはスムーズにコードを入力し、答えに確信を持っており、コードは堅牢に見えます。システムは「素晴らしい!続けよう、インターン。君ならできる」と言います。
  • 低自信: インターンは躊躇したり、後戻りしたり、あるいはコードが不安定(高い「エントロピー」または不確実性)に見えます。システムは「うーん、これはリスクが高そうだ。停止!この特定の部分はシニアエキスパートに任せるために呼び出そう」と言います。

2. 「ウォームアップ」と「適応型マネージャー」

これらの呼び出し方を学ぶために、システムは素早いウォームアップ(50 問の練習ラウンドのようなもの)を行います。

  • インターンがこれら 50 問を解決する様子を観察し、「ここでインターンが躊躇したときは失敗した。あそこで自信を持っていたときは成功した」と記録します。
  • このデータに基づいて、シンプルな決定木(フローチャート)を構築します。
  • 重要なのは、このマネージャーが適応的であることです。競技が難しくなる(AI がより難しい問題を解けるように進化していく)につれて、マネージャーはルールをその場で更新します。問題がよりトリッキーになれば、マネージャーはより早くエキスパートを呼ぶように学習します。時代遅れになる静的なルールブックに依存しません。

3. 結果:両方の利点

この論文は、コーディングベンチマーク(LiveCodeBench や MBPP など)でこれをテストしました。彼らが発見したことは以下の通りです。

  • コスト削減: 安価なインターンに簡単な作業を任せ、絶対に必要な場合のみ高価なエキスパートを呼ぶことで、総計算コストを約**38%**削減しました。
  • 性能: 品質はほとんど失われませんでした。システムは「すべてエキスパート」のシステムが解けた問題の**97.5%**を依然として解決しました。
  • 効率性: これは「パレートフロンティア」を作成しました。これは、お金に対して最大の価値を得られる完璧なバランスを見つけたという意味の、少し難しい表現です。

要約アナロジー
あなたが車を運転していると想像してください。

  • 従来の方法: 遅くても燃費の良いエコノミーカーで全行程を運転する(難しいことは何も解決しない)か、あるいはガソリンを大量に消費するレーシングカーで運転する(すべてを解決するが莫大な費用がかかる)かのどちらかです。
  • AdaptEvolve: 高速道路ではエコノミーカーで運転します。しかし、前方に急峻で岩だらけの山道(難しい問題)が見えた瞬間、車のスマートシステムが即座にあなたをレーシングカーに乗り換えます。山を通過したら、再びエコノミーカーに戻ります。ガソリンを節約しつつ、山も征服できます。

この論文が主張していないこと:

  • 自動テスト可能なコードという「答え」が存在しない、詩の作成や数学の証明のような非コーディングタスクにおいて、これが機能すると主張しているわけではありません。
  • 人間のコーディングを完全に代替すると主張しているのではなく、AI コーディングプロセスをより安価で迅速にするために使用されると主張しているだけです。
  • AI がコードを生成し、それをテストし、時間とともに改善する「進化的」システムに特化して焦点を当てています。

要約すると、AdaptEvolveは、AI 自身の「直感」(自信)を利用して、いつ安価なツールを使用し、いつ高価なエキスパートを呼ぶかを決定するスマートなスイッチであり、品質を犠牲にしすぎることなくお金を節約します。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →