← 最新の論文
💻 computer science

VeriScale: Adversarial Test-Suite Scaling for Verifiable Code Generation

本論文は、既存のベンチマークでは検出できない最先端のLLMのコード生成および仕様能力における重大な弱点を明らかにするVerinaPlusやVerinaLiteのようなより厳格なベンチマークを創出するために、テストスイートを拡張し蒸留する敵対的フレームワークであるVeriScaleを導入する。

原著者: Yifan Bai, Xiaoyang Liu, Zihao Mou, Guihong Wang, Jian Yu, Shuhan Xie, Yantao Li, Yangyu Zhang, Jingwei Liang, Tao Luo

公開日 2026-05-22
📖 1 分で読めます☕ さくっと読める

原著者: Yifan Bai, Xiaoyang Liu, Zihao Mou, Guihong Wang, Jian Yu, Shuhan Xie, Yantao Li, Yangyu Zhang, Jingwei Liang, Tao Luo

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットシェフに複雑な料理を任せることを想像してください。あなたはロボットにレシピ(「仕様」)を与え、その料理を調理するよう依頼します(「コード」)。ロボットが優れているかどうかを確認するために、あなたは料理を味わいます。

問題:「簡単なクイズ」の罠
現在、これらのAIシェフをチェックするために使用されているテストは、非常に簡単なクイズのようなものです。私たちは「塩」や「水」のようなごく単純な材料を数種類だけ与え、「スープ」という単純な結果を求めます。ロボットがスープを作れば、私たちはそれにA+を与えます。

しかし、ここには落とし穴があります。ロボットは不正をしているかもしれません。「塩+水=スープ」という答えを暗記しているだけなのに、「歯磨き粉」といった奇妙な材料を与えられても、まだスープを作ろうとして、それが正しいと主張するかもしれません。あるいは、「塩を加える」というレシピを書くが、「毒を加えない」という記述を忘れるかもしれません。「歯磨き粉」や「毒」がテストに含まれていないため、ロボットは合格しますが、実際には危険だったり壊れていたりするのです。

この論文は、現在のテストが小さすぎたり簡単すぎたりするため、AIが実際よりも賢く見えていると主張しています。

解決策:VeriScale(「ストレステスト」フレームワーク)
著者らは、VeriScaleと呼ばれる新しいシステムを開発しました。これは、AIコードに対する「ストレステスト」や「レッドチーム演習」と考えてください。AIにスープを作らせるだけでなく、VeriScaleはAIを失敗に追い込むように仕向けます。

これは主に2つのステップで機能します:

ステップ1:「障害物競争」(拡張)

まず、VeriScaleは材料の巨大で混沌とした障害物競争を作成します。

  • シード(種): 通常の材料から始まります。
  • 変異: 「変異マシン」を使用して、これらの材料をねじ曲げたり回転させたりします。水1カップを氷のバケツに変えたり、塩ひとつまみを塩の山に変えたりします。AIがこれまで見たことのない奇妙なエッジケースのシナリオを作成します。
  • 「いたずらっ子」シェフ(敵対的合成): これが巧妙な部分です。VeriScaleは、別の非常に賢いAIに「いたずらっ子」として行動させるよう依頼します。このいたずらっ子は、ルールに従っているように見えるが、実際にはゴミを生み出す偽のレシピを書こうとします。
    • 例: ルールが「スープは熱くなければならない」場合、いたずらっ子は「アイスクリーム」を出力するレシピを書くかもしれませんが、「まあ、技術的にはアイスクリームも食品なので、ルールに従いました!」と主張するかもしれません。
    • VeriScaleは、これらのいたずらっ子のレシピをAIのルールに対して実行します。AIのルールがアイスクリームを「熱いスープ」として受け入れた場合、VeriScaleはその欠陥を捕捉します。これにより、「ひっかけ」の瞬間の膨大なリストが生成されます。

ステップ2:「必須チェックリスト」(削減)

さて、VeriScaleにはこれらの厄介なテストケースが数千件あります。これらすべてをすべてのAIで実行するには時間がかかりすぎ、費用も莫大になります。そのため、「削減」を実行します。

  • 「この1,000のひっかけのうち、どれが最も重要か?」と問います。
  • 最も多くのミスを捕捉する特定のひっかけを保持し、単なる繰り返しとなるものを捨てます。
  • その結果、迅速に実行できるほどコンパクトでありながら、巨大なリストが見つけたすべての欠陥を依然として捕捉するコンパクトで超難易度の高いテストが生まれます。

結果:「真実の血清」
著者らは、この新しいシステムを入手可能な最高のAIモデル(GPT-5.5 など)でテストしました。

  • 古いテスト: AIは96%や98%のようなスコアを獲得しました。彼らは天才のように見えました。
  • VeriScale テスト: ストレステストにかけられたとき、スコアは劇的に低下しました。あるトップモデルのスコアは、コーディングにおいて96%から86%に、仕様(ルール)の作成においては68%から44%に落ち込みました。

大きな教訓
この論文は、古いテストが私たちに嘘をついていたことを示しています。それらは、AIが安全で正確なコードを書く能力を過大評価していました。新しい「VeriScale」テストは、AIが「正しいように見える」コードを書くのは得意だが、あらゆる可能性のあるミスを捕捉するルールを書くのは依然として非常に下手であることを明らかにします。

彼らはまた、この新しいテストの2つのバージョンを公開しました:

  1. VERINAPLUS: 巨大なフルスケールのストレステスト(元の83倍の規模)。
  2. VERINALITE: 「ライト」バージョン。元の14倍の規模ですが、「削減」のトリックを使用して迅速かつ安価に実行可能でありながら、同じミスを捕捉します。

要約すると:VeriScaleは、簡単なテストを合格するだけのAIにだまされないようにするためのツールです。それはAIに、奇妙で、散らかっており、厄介な現実世界を処理できることを証明させるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →