← 最新の論文
🤖 AI

EvoClaw: Evaluating AI Agents on Continuous Software Evolution

既存のベンチマークが孤立したタスクに限定されているのに対し、本論文は「DeepCommit」パイプラインを用いて「Milestone DAG」を再構築し、長期にわたるソフトウェア進化におけるシステム整合性の維持やエラー蓄積の抑制を評価する新たなベンチマーク「EvoClaw」を提案するとともに、先行するモデルが連続的な環境では孤立タスクに比べて著しく性能が低下することを明らかにしています。

原著者: Gangda Deng, Zhaoling Chen, Zhongming Yu, Haoyang Fan, Yuhong Liu, Yuxin Yang, Dhruv Parikh, Rajgopal Kannan, Le Cong, Mengdi Wang, Qian Zhang, Viktor Prasanna, Xiangru Tang, Xingyao Wang

公開日 2026-03-17
📖 1 分で読めます☕ さくっと読める

原著者: Gangda Deng, Zhaoling Chen, Zhongming Yu, Haoyang Fan, Yuhong Liu, Yuxin Yang, Dhruv Parikh, Rajgopal Kannan, Le Cong, Mengdi Wang, Qian Zhang, Viktor Prasanna, Xiangru Tang, Xingyao Wang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

🦁 エボクロウ(EvoClaw):AI 開発者の「持久力」を測る新しいテスト

この論文は、**「AI が単発のタスクをこなすのは得意だけど、長い期間にわたってソフトウェアを育て続けるのは苦手ではないか?」**という疑問に答えるための研究です。

まるで、**「一発屋の天才」ではなく「生涯現役の職人」**を育てるための新しい評価基準を作ったようなものです。


🏗️ 従来のテスト:「一発勝負」の料理コンテスト

これまでの AI の評価(SWE-bench など)は、**「料理コンテスト」**に似ています。

  • ルール: 「今日はパスタを作ってください」と言われ、AI がパスタを作る。
  • 結果: 美味しければ合格。
  • 問題点: 「明日はパスタの残りをリメイクしてグラタンにしてください」と言われたとき、昨日のパスタが冷めて硬くなっていたり、鍋が汚れていたりしても、AI は「昨日の話は関係ない」として、新しい鍋でゼロから作り直そうとします。

現実のソフトウェア開発は、**「昨日のコードの上に、今日の変更を加え、明日の機能を実装する」**という、積み重ねの連続です。しかし、従来のテストでは、その「積み重ね」の難しさが測れていませんでした。

🌱 新しいテスト:「庭師」の持久力を試す

この論文が提案する**「EvoClaw(エボクロウ)」は、「庭師」**のテストです。

  • シナリオ: 庭(既存のコード)に、新しい花(機能)を植え、雑草(バグ)を抜き、季節に合わせて手入れを続ける。
  • 難しさ: 昨日植えた花が枯れていたら、今日の花も育ちません。過去のミスが積み重なると、庭全体が荒廃してしまいます。
  • 目的: AI が、**「過去のミスに気づき、新しい機能を追加しながら、庭全体を健康に保てるか」**を測ります。

🔍 3 つの重要な発見

このテストで 12 種類の最新 AI を試したところ、驚くべき結果が浮かび上がりました。

1. 「一発屋」と「持久力」のギャップ

  • 結果: 単発のタスクなら 80% 以上の高得点を取る AI でも、連続したタスクでは38% 以下に急落しました。
  • 比喩: 短距離走のオリンピックチャンピオンが、マラソンに出たらバテて倒れてしまうようなものです。AI は「新しい機能を作る力」はあるのに、「過去のコードを壊さずに続ける力」が圧倒的に不足しています。

2. 「雪だるま効果」の恐怖

  • 現象: 最初の小さなミス(バグ)が、次のタスクに伝染し、さらに次のタスクで増幅していきます。
  • 比喩: 雪だるまを転がすと、最初は小さくても、転がすたびに雪がついて巨大化し、最後には制御不能になります。AI はこの「雪だるま(バグの蓄積)」を止めることができず、最終的に開発が止まってしまいます。

3. 「精度」の限界

  • 発見: AI は新しい機能(Recall)を追加する能力は維持していますが、既存の機能を壊さない(Precision)能力がすぐに限界に達しました。
  • 比喩: 壁に新しい絵を描くのは上手でも、**「新しい絵を描くために、古い絵を塗りつぶしてしまわない」**という慎重さが欠けています。

🛠️ 解決策:「マイルストーン(道しるべ)」という考え方

この研究では、AI の評価を正しく行うために、**「DeepCommit(ディープコミット)」**という新しい仕組みを使いました。

  • 問題: 開発履歴(コミットログ)は、細かい「メモ書き」や「誤字修正」が混じっていて、AI には「どこからどこまでが一つの機能か」が分かりにくいです。
  • 解決: AI が自動的に、**「意味のあるまとまり(マイルストーン)」**を見つけ出し、それを道しるべ(DAG:有向非巡回グラフ)として整理しました。
    • 例: 「バグ修正」「新機能追加」「リファクタリング」を、バラバラの小さな石ではなく、**「大きなブロック」**として AI に渡すことで、AI が開発の全体像を把握しやすくしました。

🎯 結論:AI は「職人」になるにはまだ修行が必要

この論文は、**「AI が単発のコードを書くことはできるが、長期的なプロジェクトを一人で責任持って維持・進化させることは、まだ非常に難しい」**と示しています。

  • 現状: AI は「指示されたことを即座にやる」のは得意ですが、「自分の過去の失敗から学び、システム全体を守りながら成長する」のは苦手です。
  • 未来: 真の自律型 AI 開発者になるためには、単にコードを書くだけでなく、**「技術的負債(過去のツケ)を溜め込まない」「長期的な視点でシステムを維持する」**という、人間のような「職人芸」を身につける必要があります。

一言で言うと:

「AI は優秀な『新人エンジニア』ですが、まだ『プロジェクトリーダー』や『ベテラン職人』としての持久力と、過去のミスを修正しながら未来を築く力には、大きなギャップがあります。」

この研究は、そのギャップを埋めるための第一歩であり、AI が本当に実社会の複雑なシステムを維持・進化させるための重要な指標となりました。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →