RoadmapBench: Evaluating Long-Horizon Agentic Software Development Across Version Upgrades
RoadmapBench は、実際のオープンソースのバージョンアップグレードに基づいた 115 の複雑で長期的なコーディングタスクのベンチマークを導入し、最先端の AI エージェントが大規模かつ多目標のソフトウェア開発において著しく困難に直面しており、最も高度なモデルを用いてもタスクの 40% 未満しか解決できないことを実証するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
超賢明で AI 搭載のジュニア開発者チームを雇うと想像してください。彼らが実際の仕事をこなせるかどうかを知りたいのです。レシピのたった一つのタイプミス修正だけでなく、500 ページに及ぶ巨大な料理本を完全に書き換え、新しい章を追加し、材料の計量方法を変更し、壊れたオーンを修理する。しかも、旧バージョンを使い続ける人々のために、古いレシピが引き続き機能するように保つのです。
これがまさに論文「ROADMAPBENCH」が扱う内容です。
以下に、この論文を平易な言葉で解説します。
1. 問題:「タイプミス」対「大規模改装」
長らく、AI コーディングアシスタントは小さく簡単なタスクでテストされてきました。「この段落のこの一文を修正できますか?」と問うようなものです。AI は通常、「はい!」と答え、A+ を獲得します。
しかし、現実世界のソフトウェア開発は、一文を修正することではありません。高層ビルの改装なのです。50 階ものすべての階で、配管、電気配線、エレベーターシステムを変更し、建物が崩壊することなく、これらを一度に行わなければならないのです。
著者らは、既存のテストが容易すぎると気づきました。それは、建築家に漏れのある蛇口を修理させるようなもので、実際の仕事は病院に新しい翼を設計することなのに、です。そこで彼らは、ROADMAPBENCHと呼ばれる、はるかに困難な新しいテストを構築しました。
2. 新しいテスト:「バージョンアップ」チャレンジ
ROADMAPBENCH は、AI にバグ修正をさせる代わりに、ロードマップを与えます。
- 設定: AI は、実在のソフトウェアプロジェクト(人気のあるオープンソースツールなど)の旧バージョンを備えたデジタル作業場に放り込まれます。
- ミッション: AI には「ロードマップ」文書が手渡されます。この文書は、「このソフトウェアの次バージョンでは、この 5 つの新機能を追加し、この 3 つの動作を変更し、この 2 つのバグを修正する必要があります」と述べています。
- 規模: これは些細な変更ではありません。平均して、AI は51 個の異なるファイルにまたがる3,700 行のコードを書き換えなければなりません。まるで、AI に映画の脚本全体を書き換え、衣装を変更し、シーンを再撮影することを、一度に行うよう求めるようなものです。
- ルール: AI は「答えの鍵」(ソフトウェアの新しいバージョン)を覗き見ることができません。指示のみからそれを導き出さなければなりません。
3. 結果:AI はまだ「ジュニア」である
研究者らは、Anthropic、OpenAI、Google などの企業から提供された最新バージョンを含む、利用可能な最も賢い AI モデル 13 種をテストしました。これらのモデルを ROADMAPBENCH テストに臨ませました。
結果は深刻でした:
- 最も賢い AI(Claude-Opus-4.7)でさえ、タスクの**39.1%**しか成功しませんでした。
- 最も弱い AIは、タスクの**5.2%**しか成功しませんでした。
比喩:
もし、人間のジュニア開発者に家の改装を頼み、10 回中 4 回しか正しく仕上げられなかったなら、「まだ学習中だ」と言うでしょう。この論文は、複雑で長期的なソフトウェアプロジェクトにおいては、最も高度な AI でさえもまだ「学習」段階にあることを示しています。
4. 失敗はどこで起こるのか?
この論文は単に失敗を数えただけでなく、なぜ失敗したのかを分析しました。彼らは、AI の「賢さ」に基づいたパターンを見つけました。
- 強力なモデル: これらは通常、コードをコンパイル(ビルド)でき、機能の大部分を書き上げることができました。しかし、詳細で失敗しました。まるで完璧な家を建てたものの、ドアノブが反対側についていたり、スイッチが実際にはライトを点灯しなかったりするかのようです。彼らは全体像を理解していましたが、小さく精密なロジックを見逃していました。
- 弱いモデル: これらはしばしば、家を建てることさえできませんでした。屋根の設置を忘れたり、台所を地下室に入れようとしたりしました。彼らは基本的な建設レベルで失敗しました。
5. これが重要な理由(論文によると)
著者らは、AI を「タイプミスの修正」でテストし続けるべきではないと主張します。それは誤った安心感を与えるからです。AI がバグを修正できるからといって、新しい機能を作れるわけではありません。
ROADMAPBENCHは、新しく正直な物差しです。それは、AI が向上している一方で、長く複雑で多段階のソフトウェアプロジェクトを処理する能力は、依然として解決されていない巨大な課題であることを示しています。現在の AI は、数ステップの指示にはよく従える非常に才能ある見習いのようですが、プロジェクトが大きくなり複雑になると混乱してしまいます。
まとめ
- 古いテスト: 「この壊れた単語を修正できますか?」(AI: はい!)
- ROADMAPBENCH: 「ここにはソフトウェアシステム全体をアップグレードする計画があります。できますか?」(AI: 試してみますが、詳細を間違えたり、ステップを忘れたりするかもしれません。)
- 結論: まだそこには到達していません。AI は賢いですが、主要なソフトウェアプロジェクトの主任エンジニアになるには、まだ準備ができていません。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。