← 最新の論文
🤖 AI

Beyond Pass Rate: A Multilingual, Execution-Grounded Evaluation of Open Code LLMs

本論文は、2,700件以上のLeetCode問題を用いた、9つのオープンなコード生成LLMに対する大規模かつ多言語的で実行に基づいた評価を提示しており、現在のモデルが人間のパフォーマンスに大きく遅れをとっていること、ならびにモデルのランキングと失敗モードが言語や問題の難易度によって大幅に異なることを明らかにし、それによって単一の指標によるリーダーボードの限界を浮き彫りにしている。

原著者: Sayed Erfan Arefin

公開日 2026-06-09
📖 1 分で読めます☕ さくっと読める

原著者: Sayed Erfan Arefin

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたはコーディングチームのヘッドコーチであり、新しいアシスタントプログラマーを雇おうとしていると想像してください。標準的な採用面接の方法は、候補者に短くて簡単なパズルを一つ与え、それを解けるかどうかを見るというものです。正解すれば「合格(パス)」、間違えれば「不合格(フェイル)」となります。

この論文は、この「合格か不合格か」という判定方法が、シェフを「卵を茹でられるかどうか」だけで判断するようなものであると主張しています。それでは、そのシェフが複雑な料理を作れるのか、スパイスの扱いを知っているのか、あるいはキッチンを清潔に保てるのかについては、ほとんど何も教えてくれないからです。

研究者たちが行ったことを、分かりやすく説明します。

大実験:大規模なコーディング・オリンピック

単一のパズルではなく、研究者たちは大規模な「コーディング・オリンピック」を企画しました。

  • 出場者: 9つの異なるオープンソースAIモデル(「アシスタント」)を招待しました。
  • 舞台: コーディング練習用の有名なサイトであるLeetCodeから、2,707個の無料のコーディング問題を収集しました。
  • 言語: 単一の言語(英語など)だけでなく、12種類の異なるプログラミング言語(Python、Java、C++など)でテストを行いました。
  • 規模: 合計で325,000回以上の試行が行われました。これは、すべての出場者が、あらゆる言語で、あらゆるパズルに挑戦したことに相当します。

判明したこと:事態は複雑である

研究者たちは、単一の「最強のAI」などは存在しないという事実を見出しました。誰が勝つかは、何を求めているかによって完全に決まります。

1. 「ジェネラリスト」対「スペシャリスト」

  • Yi-Coder-9B-Chatは、最も一貫した「平均的」なパフォーマンスを見せました。ランダムに混ざった問題を出題した場合、全体として最も多くの問題を正解しました。
  • Qwen2.5-Coder-14B-Instructは、「ハードモード」のスペシャリストでした。簡単な問題でトップになることはありませんでしたが、パズルが非常に難しくなったとき、打ち負かすべき相手となったのはこのAIでした。また、すべての問題を完璧に解けなくても、最も幅広い種類の問題を解決することができました。
  • Gemma-2-27B-ITは、「潔癖症」でした。最も多くの問題を解いたわけではありませんが、そのAIが書いたコードは最も綺麗で、最もルールに従っていました。

2. 人間との格差
この研究における最高のAIでさえ、平均して問題の約**23%しか正解できませんでした。対照的に、人間のプログラマーであれば、これらの問題の約57%**を解くことができます。これは、AIがまだ単独で作業できるほど信頼できるレベルには達しておらず、多くの監督を必要とする「ジュニア・インターン」のような存在であることを意味しています。

3. 「コンパイルエラー」の壁
研究者たちは、AIがなぜ失敗したのかを調査しました。そこで驚くべきパターンが見つかりました。失敗の63%は、コードが実行される前に発生していたのです。
これは、エンジンブロックに亀裂が入っているためにエンジンがかからない車のようなものです。車が速く走れるか遅いかをテストする前に、そもそも起動すらしていないのです。ほとんどのAIは、論理的なミス(ロジックエラー)ではなく、基本的な構文エラー(タイポや括弧の閉じ忘れなど)によって失敗していました。正当性をテストするための「コンパイル(実行可能なプログラムへの変換)」ができる前に、失敗していたのです。

4. 「クリーンコード」のパラドックス
ここにひねりがあります。最も「綺麗な」コードを書いたAI(Gemma)は、最も多くの問題を解いたAIではありませんでした。逆に、最も多くの問題を解いたAI(Qwen)は、コードが「乱雑」で、コードクリーニングツールからの警告も多かったのです。

  • 例え: 二人の学生がテストを受けている場面を想像してください。学生Aは、非常に整った完璧なフォーマットのエッセイを書きますが、答えは間違っています。学生Bは、書き損じや修正跡のある乱雑なエッセイを書きますが、答えは合っています。
  • 論文は、「機能的な成功(答えを出すこと)」と「静的な品質(綺麗なコードを書くこと)」は別物であることを示しています。綺麗なコードを書くモデルが問題を解決できるとは限らず、問題を解決できるモデルが乱雑なコードを書くこともあるのです。

5. 言語による違い
Pythonを書くのが得意なAIが、C++を書くときには不得意であることもあります。ランキングは、どの言語を要求されたかによって変化しました。これは、「モデルXが最高である」と単純に断言することはできないことを証明しています。「PythonにとってはモデルXが最高だが、JavaにとってはモデルYの方が優れている」と言う必要があるのです。

結論

論文は、コーディングAIを判断するために単一の「スコア」を見るのをやめるべきだと結論付けています。医師を、傷口を縫う能力(診断能力を無視して)だけで判断しないのと同様に、コーディングAIを単なる「合格率」だけで判断すべきではありません。

これらのツールを真に理解するためには、以下の点を見る必要があります。

  • 彼らがどの言語を流暢に話せるか。
  • 難しい問題にどう対処するか。
  • 失敗の原因がタイポなのか、それとも論理的なミスなのか。
  • 書かれたコードがメンテナンスできるほど綺麗か。

研究者たちは、これらのモデルがどのように、そしてなぜ成功または失敗するのかを、単なる一つの数字(リーダーボードの数値)としてではなく、詳細に把握できるように、膨大な詳細データベースを構築しました。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →