← 最新の論文
🤖 AI

What Do Evolutionary Coding Agents Evolve?

本論文は、進化型コーディングエージェントの性能向上が、真のアルゴリズム的革新ではなく、既存知識の再調整や再利用といった多様なメカニズムに起因する傾向があることを明らかにするため、進化コーディングのトレースデータセットであるEvoTraceと、リプレイベースの手法であるEvoReplayを導入し、コード行の頻繁な決定論的循環がその証拠であることを示す。

原著者: Nico Pelleriti, Sree Harsha Nelaturu, Zhanke Zhou, Zongze Li, Max Zimmer, Bo Han, Sebastian Pokutta

公開日 2026-05-20
📖 1 分で読めます☕ さくっと読める

原著者: Nico Pelleriti, Sree Harsha Nelaturu, Zhanke Zhou, Zongze Li, Max Zimmer, Bo Han, Sebastian Pokutta

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

AI プログラマーのチームが、箱に円を詰める新しい方法を設計したり、より高速なビデオゲームエンジンを作成したりするなど、複雑なパズルを解こうとしている様子を想像してみてください。一人が独りで作業するのではなく、彼らは「進化型コーディング」と呼ばれるシステムを使用します。

その仕組みは以下の通りです。AI がコードの断片を生成し、それをテストしてスコアを評価します。その後、そのコードに小さな変更(突然変異)を加え、新しいバージョンをテストし、より良い結果を出したものを残します。これを数千回繰り返し、時間をかけてコードを「進化」させます。これは、自然が動物を進化させるのとよく似ています。

しばらくの間、誰もがこれらの AI エージェントが問題を解決するための、すばらしく全く新しい思考法を発見しているものだと考えていました。しかし、この論文はシンプルかつ懐疑的な問いを投げかけます。「彼らは実際に何を進化させているのか?」

この問いに答えるため、研究者たちは「EvoTrace」と呼ばれる巨大な「ブラックボックス・レコーダー」を構築しました。これはこれらの AI 実験におけるフライトレコーダーのようなものです。最終的なスコアだけでなく、すべてのステップ、追加または削除されたすべてのコード行、AI が目にしたすべてのプロンプト、そして犯したすべてのミスを記録します。さらに「EvoReplay」というツールも開発され、これにより実験を一時停止し、巻き戻して、「もしこの一点を変えたらどうなるか?」と問いかけることができます。

彼らが発見した 4 つの主要な点を、日常の比喩を用いて説明します。

1. 「微調整屋」対「建築家」

AI がスコアを向上させたとき、実際には何が変化したのでしょうか?

  • 現実: ほとんどの場合、AI は新しい戦略を生み出しているわけではありません。単に「ノブを微調整」しているだけです。
  • 比喩: ラジオを持っていると想像してください。AI は時間の 90% を、音量を上げ下げしたり、チューニングダイヤルをわずかに調整したり(1.85 から 1.90 へ数値を変更するなど)することに費やします。ゼロから全く新しいラジオを構築しようと決めることはめったにありません。
  • 発見: スコアの大幅な上昇につながる変化(新しいライブラリの追加やコードのセクションの完全な書き換えなど)は稀です。AI はそのエネルギーの大部分を、小さくて退屈な調整に費やしています。

2. 「忘れっぽい庭師」(循環)

これが最も驚くべき発見でした。

  • 現実: AI はコード行を削除し、数ステップ後にそれを再び追加し続けています。
  • 比喩: 雑草を抜いて立ち去り、5 分後に戻って、全く同じ場所に全く同じ雑草を植える庭師を想像してください。彼はこの行為を繰り返し行います。
  • 発見: AI が追加する新しいコードの約 30% は、実際には以前に削除したコードです。まるで AI は短期記憶しか持っておらず、直前に破棄したものを忘れ、同じアイデアを「再進化」させる時間を浪費しているかのようです。これはどの AI モデルを使用しても、ほぼすべての実行で起こります。

3. 「機械の中の幽霊」(再現性)

AI に全く同じ指示で問題を再度解かせた場合、同じ結果が得られるでしょうか?

  • 現実: いいえ。
  • 比喩: 完璧なスープを作るシェフを想像してください。同じレシピと材料を使って再度作らせると、彼らは「異なる」スープを作ります。見た目も同じではなく、材料の順序も異なるかもしれません。
  • 発見: しかし、コード が異なっていても、スープの味 は同じです。AI は全く異なるコードを使用して高いスコアを再現できます。つまり、「スコア」は実在するものですが、特定の解決策は単に帽子から引いた幸運な引き当てに過ぎず、唯一無二の傑作ではありません。

4. 「単純なチューナー」(チューニングの隔たり)

AI の成功のどれほどが、新しいアルゴリズムを見つけることではなく、単に適切な数値を見つけることによるものなのでしょうか?

  • 現実: 改善の大部分は、単純な数値のチューニングから来ています。
  • 比喩: 自動車レースを想像してください。AI は数週間かけて、精巧な新しいエンジン(構造)を構築します。しかし、研究者たちは、平均的なエンジンを取り、燃料混合比やタイヤ空気圧(ハイパーパラメータ)を数時間調整するだけで、ほぼ同じ速度が出せることを発見しました。
  • 発見: 多くの数学タスクにおいて、単に「中途半端な」解決策の数値を微調整するだけの単純なコンピュータ・プログラムは、複雑な進化探索の最終スコアに匹敵し、あるいはそれを上回ることさえあります。AI は必ずしも問題を解決する新しい方法を発見したわけではありません。単に、古い方法に対する完璧な設定を見つけたのです。

全体像

この論文は結論として、これらの AI エージェントがスコアを向上させているのを見たとき、自動的に「新しい科学を発見している」と想定すべきではないと述べています。

多くの場合、彼らが行っているのは以下の通りです:

  1. 数値の微調整(ハイパーパラメータのチューニング)。
  2. 同じコードの忘却と再記憶(循環)。
  3. テストへの過剰適合(授業を学ぶのではなく、テストの答えを暗記すること)。

著者らは、これらのエージェントが本当に賢いのかを理解するためには、目的地(最終スコア)だけでなく、旅路(トレース)を見る必要があると主張しています。彼らが新しい家を建てているのか、それとも古い家の家具をただ入れ替えているのかを知る必要があるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →