A Unified Issue Resolution Benchmark for Requirement Clarification, Planning, and Code Generation for Coding Agents
本論文は、最終的なパッチの成功だけでなく、要件の明確化や実装計画といった中間的な推論ステップも評価する、コーディングエージェントのための統一ベンチマークであるSWE-RPGを導入し、暗黙的な要件の復元が、リポジトリレベルのタスクにおける現在のエージェントの性能を制限している主要なボトルネックであることを明らかにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
超スマートなロボットアシスタントがコンピュータコードを書ける世界を想像してみてください。あなたは「このゲームのバグを直して」や「新しいレベルを追加して」といった単純な指示を出すだけで、ロボットは作業に取り掛かります。これがAIコーディングエージェントの夢です。長い間、科学者たちはこれらのロボットにタスクを与え、最終的な結果が機能するかどうかを確認することで、これらをテストしてきました。もしゲームがクラッシュせずに動けば、ロボットには金メダルが与えられます。もしクラッシュすれば、赤い「×」が付けられます。
しかし、ここに問題があります。赤い「×」だけでは、ロボットがなぜ失敗したのかが分かりません。指示を誤解したのでしょうか? 悪い計画を立ててしまったのでしょうか? それとも、ただコードを打ち間違えただけなのでしょうか? これは、数学のテストで間違えた生徒が、どこで間違えたのかという教師のノートを見せてもらえず、「0/10点」というスコアだけを受け取るようなものです。これらのロボットを真に優れたものにするためには、最終的な答えだけでなく、その思考プロセスを見る必要があります。これこそが、この論文が取り組んでいる大きな問いです:どうすれば、単にパッチ(修正プログラム)の完成度を採点するだけでなく、ロボットの「脳」を診断できるようになるのか?
そこで登場するのが、ロボットの心の中を覗き見るための、非常に詳細な新しいテスト、SWE-RPGです。研究者たちは、31の異なるソフトウェアプロジェクトから集められた163の実際のコーディングタスクを用いて、ベンチマーク(標準化されたテスト)を構築しました。単に最後にコードが動くかどうかを確認するのではなく、彼らはロボットの旅のあらゆるステップに対して「ゴールド・トゥルース(黄金の正解)」のリファレンスを作成しました。これは、マスターシェフのレシピ本が、完成した料理だけでなく、シェフが推測しなければならなかった隠れた材料のすべて、調理計画のあらゆるステップ、そしてロボットが道から外れる可能性があった正確な瞬間までをリストアップしているようなものです。
研究者たちは、3つの人気のあるコーディングエージェント(Claude Code、Codex、OpenCodeと命名)を、6つの異なる「脳」モデル(LLM)と組み合わせてテストにかけました。結果は、少し厳しい現実を突きつけるものでした。最高のロボットでさえ、タスクの約**31.5%しか解決できなかったのです。つまり、彼らは3分の2近くの確率で失敗していたことになります! しかし、SWE-RPGの本当の魔法は、彼らが「どこで」失敗したのかを突き止めたことにありました。調査の結果、最大のボトルネックは実はコードを書くことではなく、隠れたルールを理解することであったことが判明しました。失敗の原因の約24.5%から46.0%**は、ロボットが「暗黙の要件」――つまり、仕事を正しく遂行するために必要だが、あなたが言葉にしなかったこと――を理解できなかったために発生していました。
例えば、ロボットに「TSVのインポートを修正して」と頼んだ場合、ロボットはコードを修正したかもしれませんが、そのせいでCSVのインポートを誤って壊してしまったかもしれません。なぜなら、その2つが関連していることに気づかなかったからです。この研究は、これらのエージェントを真に有用なものにするためには、単にコードを書くスピードを上げることに集中するのではなく、ユーザーのリクエストの「行間を読む」ことができる、より優れた探偵になるよう教える必要があることを示唆しています。論文は、これらのエージェントは印象的ではあるものの、依然としてソフトウェア開発の泥臭い人間的な側面で苦戦していること、そして、それらのトリッキーな隠れた要件をナビゲートするための新しい地図としてSWE-RPGが必要であると結論付けています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。