← 最新の論文
💬 NLP

SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring

本論文は、既存の評価における欠陥や飽和を克服するために設計された、170件の大規模なコードリファクタリングタスクからなる厳格に精査された多言語ベンチマークであるSWE-Bench ProMaxを紹介し、現在の最先端AIエージェントが、依然として複雑で振る舞いを維持するソフトウェアエンジニアリングの課題に対して苦戦していることを示している。

原著者: Yuling Shi, Jinghan Xu, Kelin Fu, Wenhao Zeng, Shilin He, Lei Zhang, Yue Liu, Zelin Zhao, Terry Yue Zhuo, Jialun Cao, Siyu Ye, Tianyu Liu, Kai Cai, Shing-Chi Cheung, Xiaodong Gu

公開日 2026-08-11
📖 1 分で読めます☕ さくっと読める

原著者: Yuling Shi, Jinghan Xu, Kelin Fu, Wenhao Zeng, Shilin He, Lei Zhang, Yue Liu, Zelin Zhao, Terry Yue Zhuo, Jialun Cao, Siyu Ye, Tianyu Liu, Kai Cai, Shing-Chi Cheung, Xiaodong Gu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

コンピュータがソフトウェアエンジニアになろうとしている世界を想像してみてください。長年、科学者たちは、2つの数値を加算する単一の関数を書くといった、小さく孤立したパズルを解かせることで、これらの「AIコーディングエージェント」をテストしてきました。それは、パイロットに対して滑走路で飛行機を地上走行させるだけでテストを行うようなものです。しかし、実際のソフトウェアは一行ずつ作られるものではありません。それは、一つの道路標識を変えるだけで、街全体の地図、信号機、バスの時刻表を更新しなければならないような、コードによる巨大で相互に連結した都市なのです。研究者たちが投げかけている大きな疑問は、「これらのAIエージェントは、何かを壊すことなく、巨大なソフトウェアの塊を書き換えるという、乱雑で複雑な現実に対処できるのか?」ということです。これは「コードのリファクタリング」——建物の内部配線を、中の人の明かりのつき方を変えずに再編成する技術——という領域です。

そこで、AIエージェントがビッグリーグ(一流の舞台)に立つ準備ができているかどうかを判定するために設計された、極めて困難な新しいテスト、SWE-bench ProMaxが登場しました。これまでのテストは、AIが答えを暗記したり、単純すぎる問題を解いたりできる「イージーモード」のビデオゲームのようなものでした。この新しいベンチマークの作成者たちは、テストが簡単すぎたり設計が悪かったりすると、AIの高いスコアは知能の錯覚に過ぎないことに気づきました。そこで、彼らは「ハードモード」の試練を構築したのです。彼らは、7つの異なるプログラミング言語(Python、Java、C++、Rustを含む)から、170の現実世界のソフトウェア課題を集めました。これらは小さな修正ではありません。AIは平均11.4個の異なるファイルをまたいで変更を調整し、260行以上のコードを書き換えながら、ソフトウェアが以前と全く同じように動作することを保証しなければならない、大規模なオーバーホールなのです。

結果は、AI業界に対する現実を突きつけるものとなりました。最も賢く、最も高価なAIモデルがこのアリーナに投入されたとき、彼らはテストを攻略できませんでした。最高のモデルでさえ、タスクのわずか**41.2%**しか解決できなかったのです。このことは、AIが小さな雑務には長けてきているものの、現実世界のエンジニアリングに求められる複雑で多段階の調整には、依然として苦戦していることを示唆しています。興味深いことに、論文では、モデルにより多くの費用を投じることが必ずしも良い結果につながるとは限らないことが判明しました。一部の安価なオープンソースモデルは、高価な巨大モデルとほぼ同等の性能を発揮しました。AIが失敗した主な理由は、それが「部分的な」作業員であったことです。AIは主要な問題は修正するものの、関連するファイルを更新することを忘れてしまう傾向がありました。例えば、漏水しているパイプを修理しながら、水道メーターへの通知を忘れてしまい、結果としてシステム全体を失敗させてしまうようなものです。このベンチマークは、AIにとっての真のソフトウェアエンジニアリングの習得はまだ進行中のプロセスであり、現在のエージェントがまだ完全にはマスターできていない、高度な計画性とファイル間の連携が必要であることを証明しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →