SWE-MERA: A Dynamic Benchmark for Agenticly Evaluating Large Language Models on Software Engineering Tasks
既存のSWE-benchのようなベンチマークにおける重大なデータの汚染および不適切なテストケースに対処するため、本論文は、自動化されたパイプラインを活用して現実世界のGitHubイシューを精査する、動的かつ継続的に更新されるベンチマークであるSWE-MERAを導入し、ソフトウェアエンジニアリングのタスクにおける大規模言語モデルの厳格かつ信頼性の高い評価フレームワークを提供する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
ロボットに壊れたビデオゲームを修理する方法を教えようとしている場面を想像してみてください。長い間、ロボットをテストする最善の方法は、すでに誰もが知っている特定の壊れたレベルのリストを与えることでした。しかし、ここには問題がありました。ロボットは実際に修理の仕方を学んでいるのではなく、単に答えを暗記していたのです。それは、去年の数学のテストの解答集を暗記したものの、数字が変わった新しいテストでは失敗してしまう学生のようなものでした。
これは、有名な SWE-bench で起きていたことそのものです。これはAIのコーディングスキルを測るための人気のあるテストです。論文によれば、この古いテストは答えを漏洩させていました。「成功」した修正のうち約 32.67% は、AIがすでに見た解決策を単にコピーしたものであり、さらに 31.08% は、テストが弱すぎて本当の間違いを見逃していたために合格していました。それは、壊れた定規でした。
そこで、新たなダイナミックな挑戦者、SWE-MERA が登場します。SWE-MERAを、静的な教科書ではなく、毎月更新される**「ライブで呼吸しているビデオゲームサーバー」**だと考えてください。古い、暗記されたパズルを使う代わりに、インターネット(具体的には、何百万もの人々がコードを共有しているGitHub)から、常に最新の現実世界の課題を探し出します。
新しいテストの仕組み
著者たちは、これらの新鮮な問題を見つけ出すための、非常に組織化されたロボット・パイプラインを構築しました。これは、手がかりが本物であることを保証するための7つの厳格なルールを備えた、ハイテクなスカベンジャーハント(宝探し)のようなものです。
- 適切な遊び場を選ぶ: 人気があり、活発なPythonプロジェクト(スター数10以上、フォーク数10以上)のみを対象とします。
- 手がかりを一致させる: 特定の問題(「issue」)と、それを解決した正確な解決策(「pull request」)を見つけ出し、それらが完璧な一対一のペアであることを確認します。
- サイズを確認する: 小さすぎるメモや、巨大で乱雑なプロジェクトを無視し、ちょうど良いサイズのものだけを残します。
- 修正を検証する: その解決策が実際にコードを変更し、かつそれが機能することを証明するためのテストを追加しているかどうかをチェックします。
- ラボを構築する: プロジェクトを安全で隔離されたコンテナ(デジタル・サンドボックスのようなもの)内でビルドし、テストがパスするかどうかを確認します。
- フルミッションを実行する: 再現性を確保するために、タスクの最初から最後までを全行程実行します。
- AIジャッジ: 最後に、別のAI(Qwen3-32B モデル)が厳格な教師として振る舞い、正解性と完全性の観点から1から10のスケールでタスクを採点します。タスクが簡単すぎたり、難しすぎたり、説明が不十分な場合は、排除されます。
その結果、約10,000個の潜在的なタスクが集まり、今すぐ利用可能な728個の高品質なサンプルが用意されました。
結果:本当の勝者は誰か?
研究者たちは、これら新鮮な問題を用いて、最も賢いコーディングAIの十数種類をテストしました。彼らは単にAIに一度解かせるのではなく、バグを修正するための6回の試行を与え、考え直し、作業を再確認するチャンスを与えました。
結果は目を見張るものでした:
- トップパフォーマー: DeepSeek-R1-0528 モデルがチャンピオンとなり、最初の試行で約27.8%、6回以内の試行で**40.2%**の問題を解決しました。
- 準優勝: Devstral-Small-2505 が、最初の試行で17.2%、全体で**28.2%**を解決して2位に入りました。
- 苦戦したモデル: Llama-3.3-70B(チャットには優れていますが、コーディング専用ではありません)のような強力で巨大なモデルでさえ、最初の試行ではわずか**8.7%しか解決できませんでした。最も小さなモデルである Qwen2.5-Coder-7B は、最初の試行で2.7%**しか修正できませんでした。
論文は、これらの新しいダイナミックなテストが、賢いAIと暗記しているAIを区別するのに非常に優れていることを示唆しています。例えば、古いテストで素晴らしく見えたモデルの中には、新しい2025年のタスクでは成績が悪化したものもあり、これは彼らが古い答えを単に暗記していたことを示唆しています。
このテストが「しない」こと
この新しいベンチマークが何を対象外としているかを知っておくことは重要です。論文は、このテストはコードの可読性、保守性、またはセキュリティを測定するものではないと明示しています。また、チームワークや、人間とロボットがいかに協力するかについてもテストしません。これは純粋に、「ロボットはバグを修正し、テストをパスさせることができるか?」に焦に特しています。
また、著者らは、これらの問題は自動的に収集されているため、中には少し奇妙であったり、人間が書いたパズルのような創造的なニュアンスに欠けていたりするものがある可能性があると警告しています。また、システムはそれを防ぐようにしていますが、AIがトレーニングデータの中で似たような問題に遭遇している可能性もわずかにあります。
大きな展望
著者たちは、SWE-MERAが進歩を測定するためのるはるかに公平な方法であると確信しています。テストを新しい未見の課題で絶えず刷新することで、AIが答えを暗記して「カンニング」することを防いでいます。彼らは、誰でも自分のコーディングロボットが世界最高峰と比べてどのような立ち位置にあるかを確認できる公開リーダーボードを構築しており、そこにはパフォーマンスの変化を閲覧できるスライダーも備わっています。
要するに、SWE-MERAは、この分野が必要としていた「新鮮な空気」です。それは、埃をかぶった暗記された教科書から離れ、真に適応力のあるコーディングエージェントだけが生き残れる、ダイナミックで絶えず変化するアリーナへと移行するものです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。