← 最新の論文
💻 computer science

Compete Then Collaborate: Frontier AI Teachers Build a Verifiable Curriculum to Improve a Coding Student Beyond Imitation

本論文は、最先端のAIモデルを実行ベースの検証を通じてランク付けし、検証可能な報酬を用いた強化学習に使用することで、従来の同一の解を用いた模倣学習が性能を低下させるのに対し、難問に対するコーディング学習者のパフォーマンスを大幅に向上させるカリキュラムを共同で構築する「競合後に協調(compete-then-collaborate)」フレームワークを導入するものである。

原著者: Miseong Shawn Kim

公開日 2026-07-10
📖 1 分で読めます☕ さくっと読める

原著者: Miseong Shawn Kim

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あるコーディング教室を想像してみてください。そこには、異なるテックジャイアントから集まった4人のスーパースター教師——Anthropic、OpenAI、xAI、そしてGoogleの精鋭たち——が、一人の非常に賢い生徒(Qwen2.5-Coderという名前のモデル)に教えるために雇われました。目的は?どの教師が最高であるかを見極め、彼らのレッスンをどのように組み合わせれば、生徒をコーディングの魔術師にできるかを探ることです。

研究者たちは、巨大でハイステークスなコーディング・トーナメントをセットアップしました。教師同士に互いを採点させるのではなく(そうすると、単なる友人関係ゆえに互いにA+を与え合ってしまうことがよくあります)、彼らは厳格でロボットのような審判、すなわちコンピュータ自体を使用しました。もし教師が書いたコードが実際に実行され、隠されたテストをパスすれば、それは勝利となります。もしクラッシュすれば、それは敗北です。

トーナメント:誰が最高の教師か?

まず、教師たちは2種類の課題に直面しました。

  1. 易しい問題: 標準的なコーディング問題です。ここでは、4人の教師全員が非常に優秀で、「自己修正」(ミスを修正するためのセカンドチャンスを得ること)を行った後、全員がほぼ完璧な**99〜100%**のスコアを記録しました。論文によれば、これは全員が等しく天才だからではなく、彼らが訓練データの中でこれらの特定の問題をすでに目にしていたためです。これは、すでに暗記している練習テストで満点を取る生徒のようなものです。
  2. 難しい問題: トリッキーな、競技レベルの問題です。ここで本当の違いが現れました。
    • Geminiがリードし、難しい問題の**77%**を解決しました。
    • ClaudeCodex(OpenAI)は接戦で、どちらも**69%**を解決しました。
    • Grokは**50%**と後塵を拝しました。

論文では、Geminiがリードしたとはいえ、その差は劇的なものではなく、ランキングは教師が「何を言ったか」ではなく、コードが「実際に何をしたか」に厳密に基づいていることに注意を払っています。

大きな驚き:教師を模倣することは、実は「害」になる

ここに、通常の学校のルールを打ち破るひねりがあります。通常、優れた教師がたくさんいる場合、最も良い学習方法は彼らの宿題をコピーすることだと考えます。研究者たちはこれを試みました。彼らは、検証済みの、動作するすべての教師のコードを取り出し、生徒モデルにそれを単に模倣(SFTと呼ばれる手法)させました。

結果は、生徒の成績が悪化しました。

  • 標準的なテストにおいて、生徒のスコアは**76.7%から72.7%**に低下しました。
  • 難しい競技レベルの問題では、**5.9%から2.9%**へと急落しました。

論文は、すでに能力がある生徒にとって、ただ答えをコピーすることは助けにならないどころか、むしろ混乱を招くと論じています。それは、才能のあるバスケットボール選手が、4人の異なるプロのハイライト映像を見て、その動きを一度にすべて真似ようとして、自分自身のリズムを乱してしまうようなものです。「知識の衝突」によって、他の誰かになろうとすることが、自分自身であることを妨げたのです。

勝利の戦略:模倣ではなく、実践を通じて学ぶ

では、コピーが失敗するなら、何が機能するのでしょうか?研究者たちは、RLVR(検証可能な報酬を用いた強化学習)と呼ばれる異なるアプローチを試みました。

教師の最終的な答えをコピーするために生徒に手渡す代わりに、彼らは教師の「検証済み問題」を練習場として利用しました。生徒は、自力で問題を解くことを許可されました。

  • もし生徒のコードが実行され、テストをパスすれば、生徒は「報酬」(コンピュータからのハイタッチ)を得ました。
  • もし失敗すれば、報酬は得られず、再挑戦しなければなりませんでした。

これはうまくいきました!

  • 難しい競技レベルの問題における生徒のスコアは、ピーク時に**5.9%から8.8%**へと跳ね上がりました。
  • これは49%の相対的な改善です。

論文は、複数の教師を持つことの価値は、生徒がコピーするための答えを集めることではなく、生徒が自ら作業を行い、それが実際に機能するかどうかのフィードバックを得るための、巨大で検証可能な「ジム(訓練場)」を構築することにあると示唆しています。

結論

この論文は、これらAI教師を、そのコードがどれほど上手く実行されるかに基づいてランク付けすることは可能であるものの、真の魔法は、生徒に教師を模倣させることをやめ、教師の仕事を、試行錯誤を通じて学習するための挑戦的な環境を作り出すために使うときに起こると結論付けています。

それは、部屋の中に誰が最も賢い教師がいるかということではありません。失敗し、何が間違っていたのかという明確なシグナルを得て、成功するまで何度でもやり直せるような、遊び場を構築することなのです。研究者たちは、誰でもこれらのテストを実行して数字が正しいことを確認できるよう、すべてのコードとデータを公開しており、時には「コピーすることをやめて、実践すること」が最良の学習方法であることを証明しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →