← 最新の論文
🤖 AI

Active-SWE: Benchmarking Coding Agents for Proactive Bug Fixing without Issue Reports

本論文は、問題報告がない状態でのプロアクティブなバグ修正におけるコーディングエージェントの評価のために設計された、複数のカテゴリと言語にわたる1,663のタスクを網羅する新しいベンチマークであるActive-SWEを紹介し、現在の最先端のエージェントが、詳細なガイダンスがない状況下でのバグの特定、解決、および発見において著しく苦戦することを明らかにしている。

原著者: Haobin Li, Ping Deng, Weizhong Qian, Liang Jiang, Zhenyu Huang, Mouxing Yang, Xi Peng

公開日 2026-08-06
📖 1 分で読めます☕ さくっと読める

原著者: Haobin Li, Ping Deng, Weizhong Qian, Liang Jiang, Zhenyu Huang, Mouxing Yang, Xi Peng

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ソフトウェアが、何百万人もの人々によって築かれた巨大で賑やかな都市のような世界を想像してみてください。時として、ある建物には隠れた亀裂があり、ある橋には緩んだボルトがあり、あるいは信号機が赤になるべき時に緑のまま固まってしまうことがあります。現実の世界では、私たちは通常、誰かが「おい、橋が壊れているぞ!」と叫ぶのを待ってから修理チームを派遣します。デジタルの世界では、この「叫び」は**イシューレポート(課題報告)**と呼ばれます。それは、どこにバグがあるのか、どのようなエラーメッセージが表示されたのか、そしてソフトウェアはどう振る舞うべきなのかを、人間が詳細に記述したメモです。

長い間、コンピュータ科学者たちは、修理チームとして機能するように、超スマートなAIアシスタント、すなわちコーディングエージェントを訓練してきました。これらのエージェントは、強力な脳のようなモデル(大規模言語モデルと呼ばれます)を使用して、コードを読み取り、問題を解決します。しかし、ここには落とし穴があります。これまでのコーディングエージェントの訓練やテストのほとんどは、完璧で詳細な「叫び」(イシューレポート)が常に用意されていることを前提としているのです。それは、まるでメカニックに対して、「エンジンから異音がしています」というメモが付いた状態でレッカー移動されてきた車だけを使って訓練を行っているようなものです。

しかし、現実の世界では、物事は必ずしもそこまでスムーズにはいきません。時には、バグがあまりにも巧妙に隠れているため、誰にも気づかれないまま最終製品に紛れ込み、大規模な混乱を引き起こすこともあります。また、人間が残したメモが曖昧だったり、混乱を招くものだったり、あるいは重要な詳細が欠けていたりすることもあります。ここで、大きな、そしてエキサイティングな問いが生まれます。AI修理チームは、誰かが壊れていると気づく前に、自らコードをスキャンし、亀裂を見つけ出し、指示書が一つもない状態で問題を解決できる「先読みの探偵」になれるのでしょうか?

これこそが、論文**「Benchmarking Coding Agents for Proactive Bug Fixing without Issue Reports(イシューレポートなしでのプロアクティブなバグ修正のためのコーディングエージェントのベンチマーク)」**が探求しようとしている内容です。著者の一団(大学や独立した研究所の研究者チーム)は、Active-SWEと呼ばれる新しいチャレンジを導入しました。これは、AIエージェントが単なる「従順なメカニック」ではなく、真の「探偵」になれるかどうかをテストするために設計された、巨大でハイリスクなビデオゲームのレベルのようなものです。

研究者たちは、AIに「直すべき壊れたもののリスト」を与える代わりに、膨大なコードライブラリ(6種類のバグと8つのプログラミング言語にわたる1,663の異なるタスク)を渡し、「問題を見つけて直してください。幸運を。ただし、ヒントは一切禁止です」と命じました。

研究者たちは、このチャレンジを2つの方法で構築しました。まず、AIが小説の中の特定の誤字を見つけるような感覚で、コードベースの中に隠された単一のバグを見つけ出す「シンプル設定」を作成しました。次に、難易度を跳ね上げた「ハード設定」を作りました。ここでは、AIは一晩に一連の犯罪を解決しようとする探偵のように、一度に複数のバグを追い詰めなければなりません。また、研究者たちは「潜在的なバグ(Potential Bugs)」についてもテストを行いました。これは、AIが元の既知の問題リストにはなかった問題を見つけた場合、「あなたは実際に壊れている新しい何かを見つけましたか?」と問いかけるシナリオです。

AIが単に推測しているのではないことを確認するために、研究者たちは巧妙な「デュアルトラック(二重経路)」のスコアリングシステムを使用しました。一つのトラックは、彼らが「そこに存在すると知っている」バグをAIが見つけられたかどうかをチェックします。もう一つのトラックはよりトリッキーで、もしAIが「新しいバグを見つけた」と主張した場合、システムはAIにそれを証明するためのテストを書くことを強制しました。もしAIがテストによってそのバグの存在を証明できなかった場合、その発見はカウントされません。それは、探偵が「隠された金庫を見つけた」と主張するようなものです。彼らは、それが本物であることを証明するために、鍵を見せて金庫を開けなければなりません。

結果はどうだったでしょうか? 現在の最もスマートで高度なAIエージェントであっても、このプロアクティブな探偵業務には依然として苦戦していることが判明しました。研究者がトップクラスのモデル(Claude Opus 4.8、GPT-5.5など)をテストしたところ、詳細なイシューレポートを与えられずに放置された場合、ほとんどのモデルは既知のバグの約**20%**しか修正できないことが分かりました。これは、詳細なイシューレポートが与えられている場合と比較すると、大幅な低下です。

この研究は、これらのAIエージェントが指示に従う能力は向上しているものの、散らかった部屋を眺めて、何が壊れているのかを自分自身で判断することについては、まだ非常に苦手であることを示唆しています。彼らはコードの中で迷子になったり、問題が正確にどこにあるのかを特定したり(これは「ローカライゼーション(局所化)」と呼ばれるスキルです)、複数の問題を一度に解決することに苦労したりすることがよくあります。興味深いことに、AIはロジックやデータフローに関連する特定の種類のバグは見つけることが比較的得意でしたが、「状態(ステート)」に関するバグ(例えば、信号機が止まったままになるようなケース)については、ほとんど無知でした。

おそらく最も重要なことは、この論文が「バグを見つけることは戦いの半分に過ぎない」ということを示している点です。データによれば、もしAIが壊れたコードの部分を正確に特定できなければ、正しく修正することはほぼ不可能です。それは、どこから水が漏れているのかを知らずに、漏れているパイプを直そうとするようなものです。間違ったパイプを締め直してしまうかもしれません。

要するに、この論文はAIがソフトウェア修復を解決したと主張しているわけではありません。むしろ、現在の世代のコーディングエージェントは、問題点を指摘してくれる人間にあまりにも依存しすぎているという警鐘を鳴らしています。「プロアクティブ(先読み)」という夢――AIがコードをスキャンし、クラッシュが発生する前に問題を解決するという夢――は、まだ進行中の課題です。研究者たちは、これらのエージェントが強力ではあるものの、安全網なしで私たちのデジタル都市を守れるように信頼されるためには、より独立した探偵になる必要があると結論付けています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →