← 最新の論文
💬 NLP

Beyond pass@k: Redundancy-Aware RLVR for Multi-Sample Code Generation

本論文は、検証器を用いた標準的な正解重視の強化学習(RLVR)が冗長なコード生成を招くことを明らかにし、JPlag ベースの冗長性回避報酬を用いた冗長性認識型 RLVR 手法を提案するものであり、多様な候補解を維持することで有限予算下でのコード生成性能を大幅に向上させる。

原著者: Le Bronnec Florian, Alexandre Verine, Rio Yokota, Benjamin Negrevergne

公開日 2026-05-28
📖 1 分で読めます☕ さくっと読める

原著者: Le Bronnec Florian, Alexandre Verine, Rio Yokota, Benjamin Negrevergne

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

プログラマーのチームを雇って、1 つの厄介なコーディングパズルを解いてもらうと想像してください。予算は限られています。つまり、10 件の解決策しか依頼できません(これが「サンプリング予算」です)。目標はシンプルです。その 10 件の解決策のうち、1 つでも完璧に動作すればよいのです。

AI の世界では、これをPass@k(k 回中パス)と呼びます。AI にコードを 10 回書かせ、その 10 回の試みのうち少なくとも 1 つが動作すれば、あなたの勝ちです。

問題:「コピペ」チーム

この論文は、現在の AI モデルがこのゲームに勝つためにどのように訓練されているかにおいて、隠された欠陥を発見しました。

研究者が AI のコーディング能力を向上させるために訓練する際、通常は正解を導き出すことだけを報酬として与えます。AI はすぐに近道を見つけます。「10 回とも全く同じ正しいコードを書けば、毎回報酬がもらえる」というのです。

こうして、AI はコピペ屋になってしまいます。問題解決のために 10 通りの異なる方法(例えば、ハンマー、ドライバー、レンチを使うなど)を試す代わりに、1 つの成功した方法を選び、それを 10 回コピーするだけです。

  • 結果: もしその 1 つの方法にわずかなバグがあれば、10 個のコピーすべてが失敗します。予算を重複品に無駄遣いしたことになります。
  • 論文のツール: この現象を特定するために、著者たちはJPlagというツールを使用します。JPlag はコードの「盗作検出器」と考えてください。テキストの色を変えたり変数名を変更したりしても関係なく、コードの構造に注目します。2 つのプログラムが同じ構造で構築されていれば、JPlag は「これらはほぼ重複している」と判断します。

解決策:「冗長性回避」コーチ

著者たちは、単純な問いを投げかけました:AI を単に正解させるだけでなく、過去の試行と異なるように訓練したらどうなるでしょうか?

彼らはRedundancy-Aware RLVR(冗長性認識型 RLVR)と呼ばれる新しい訓練手法を導入しました。

  • 比喩: 10 人のランナーからなるチームにコーチが次のように指示すると想像してください。「全員がレースを完走する必要があります。ただし、ルールがあります。2 人が全く同じルートで走れば、両者ともペナルティを受けます。ゴールへの独自のルートを見つけなければなりません。」
  • 仕組み: AI は依然として正しいコードを書くことで報酬を得ます。しかし、今では、直前に書いたコードと非常に似ているコードを生成した場合、「ペナルティ」(負の報酬)も課されます。

結果:より良いチームワーク

この新しい「冗長性回避コーチ」を従来の「コピペコーチ」と比較してテストしたところ、結果は明確でした。

  1. 無駄の削減: 新しい AI は同じ解決策をスパムするのをやめました。より多様な正しいコードを生成するようになりました。
  2. 成功率の向上: チームが異なるアプローチを試すようになったため、10 回という限られた予算の中で動作する解決策を見つける可能性が大幅に高まりました。
  3. 専門家への勝利: 「自分自身をコピーしない」というこの単純なトリックは、研究者が以前にこの特定の問題に対処するために設計していた複雑で専門的な手法と同等か、それ以上の効果を発揮しました。

結論

この論文は、AI に問題を解決するために何度も試行させる際、どれくらいの頻度で正解を導き出すかだけでなく、どれだけの異なる方法でそれを目指しているかも重視すべきだと主張しています。

AI にコピペ屋にならないよう教えることで、その限られた試行の価値を大幅に高めることができます。これは、友人にパスワードを 10 回推測させる際、全員が「123456」と推測させる場合と、10 個の全く異なる数字を推測させる場合の違いと同じです。後者のアプローチの方が、はるかに成功する可能性が高いのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →