← 最新の論文
💻 computer science

BenchEvolver: Frontier Task Synthesis via Solution-Centric Evolution

BenchEvolverは、既存のコーディング問題を、参照解を進化させることで、より困難で検証可能なバリアントへと自動的に変換するソリューション指向の進化型フレームワークであり、モデルの識別能を回復させ、自己改善のための効果的な学習シグナルを提供するLiveCodeBench-Plusのような高品質なベンチマークを創出します。

原著者: Yangzhen Wu, Aaron J. Li, Wenjie Ma, Li Cao, Ziheng Zhou, Mert Cemri, Shu Liu, Yuran Xiu, Chenxiao Yan, Haikun Zhao, Bin Yu, Ion Stoica, Dawn Song

公開日 2026-06-02
📖 1 分で読めます☕ さくっと読める

原著者: Yangzhen Wu, Aaron J. Li, Wenjie Ma, Li Cao, Ziheng Zhou, Mert Cemri, Shu Liu, Yuran Xiu, Chenxiao Yan, Haikun Zhao, Bin Yu, Ion Stoica, Dawn Song

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

プレイヤー(AIモデル)があまりにも優秀になりすぎて、あらゆるレベルを100%の正確さでクリアしてしまうビデオゲームを想像してみてください。ゲームデザイナー(人間の研究者)は、これらの超一流プレイヤーに挑戦できる新しいレベルを十分に早く作ることができず、行き詰まっています。古いレベルは簡単すぎて、ゲームとしての興奮が失われてしまいました。

この論文は、こうしたAIゲームのための「レベルアップ・エンジン」として機能する新しいツール、BenchEvolverを紹介するものです。人間がゼロから新しい困難な問題を発明しようとする代わりに、BenchEvolverは既存の簡単な問題を取り込み、それが公平かつ解決可能な状態を保ったまま、より困難なものへと自動的に変異させます。

仕組みをシンプルな概念ごとに解説します:

1. 問題点:「イージーモード」の罠

現在、AIモデルは非常に高度化しており、既存のほとんどのコーディング・パズルを解くことができます。これは、教科書にあるすべての問題を暗記してしまった学生のようなものです。テストを受けると、彼らはすべてで100点を取ります。これには2つの悪い側面があります:

  • すべてのAIが満点を取ってしまうため、どのAIが本当に賢いのかを判断できません。
  • AIが解決できない課題に直面することがなくなるため、学習が止まってしまいます。

2. 解決策:先に「解答集」を進化させる

以前の新しい問題作成の試みの多くは、「新しい数学の問題に関するストーリーを書き、その後、AIがそれを解けることを祈る」というものでした。これは、壊れたパズルや、内容が曖昧すぎる問題を生む原因となります。

BenchEvolverはこの流れを逆転させます。 ストーリー(問題)から始めるのではなく、解答集(ソリューション・コード)から始めます。

  • 比喩: 完璧なチョコレートケーキを焼く方法を知っているマスターシェフ(AI)を想像してください。
  • 変異: BenchEverlerはシェフにこう命じます。「よし、ではケーキを焼いてくれ。ただし、化学反応を変えてしまうような秘密の材料を使い、同じオーブンの設定を使ってはいけない」
  • 結果: シェフは新しい、複雑なレシピを書きます(進化したソリューション)。
  • 逆方向のステップ: シェフがこの新しい、複雑なレシピを書き終えたら、BenchEvolverは逆方向に働き、顧客への指示書(問題文)を作成し、ケーキが正しく出来上がったかを確認するための味見(テスト)を作成します。

問題が、動作する複雑なソリューションの周囲に構築されているため、そのパズルが解決可能であり、明確な答えを持っていることが保証されます。

3. 「自己挑戦」のループ

最も素晴らしい点は、BenchEvolverが新しいレベルを難しくするために「超スマートな教師」を必要としないことです。このツールは、AI自身を使って新しいレベルをテストします。

  • AIが新しい、変異した問題に挑戦します。
  • もしAIが正解した場合、そのレベルは簡単すぎます。BenchEvolverはこう言います。「やり直し。もっと難しくして!」
  • もしAIが間違えたとしても、パズル自体が依然として有効であれば、成功です! AIの弱点を露呈させるレベルを見つけ出したことになります。

これにより、AIが課題を生成し、それを解こうとして失敗し、その失敗から学び、さらに困難な課題を生成するというサイクルが生まれます。それは、戦うたびに強くなるスパーリング・パートナーのようなものです。

4. 結果:新しい「ハードモード・リーグ」

研究者たちは、2つの大きなコーディング・パズルのセットでこれをテストしました:

  1. LiveCodeBench: 競技プログラミングのパズル(Codeforcesのようなもの)。
  2. SciCode: 科学研究のコーディング・パズル。

何が起きたのでしょうか?

  • 難易度が急上昇: AIモデルが90〜99%の正解率を出していた問題を取り上げました。進化させた後、同じモデルの正解率は27〜62%まで低下しました。「イージーモード」は、見事に「ハードモード」へと作り替えられました。
  • 新しいベンチマーク: 彼らは LIVECODEBENCH-PLUS という、91個の超難問コレクションを作成しました。この新しいテストスイートは、ようやくトップクラスのAIモデルの違いを判別できるようになりました。
  • トレーニング能力: これらの新しい、難しい問題を使用してAIを(強化学習と呼ばれる手法で)訓練したところ、AIは見たこともない他の難しい問題を解く能力が大幅に向上しました。

まとめ

BenchEvolverをAIのためのジムだと考えてください。人間が新しい重いウェイトを作るのを待つのではなく、AIは既存のウェイトを持ち上げ、そこにさらにプレートを追加し、そしてその新しい、より重くなったバージョンを持ち上げようと試みます。もし持ち上げられなければ、どうすれば強くなれるかを学ぶのです。

この論文は、まずソリューションを進化させ、そこから問題へと逆方向に構築することで、高品質で困難な課題を絶え間なく自動生成し、AIモデルを研ぎ澄ませ、真の進歩を測定し続けることができることを証明しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →