← Neueste Arbeiten
💻 computer science

VeriScale: Adversarial Test-Suite Scaling for Verifiable Code Generation

Die Arbeit stellt VeriScale vor, ein adversariales Framework, das Test-Suiten erweitert und destilliert, um rigorosere Benchmarks wie VerinaPlus und VerinaLite zu schaffen, die signifikante Schwächen in den Code-Generierungs- und Spezifikationsfähigkeiten modernster LLMs aufdecken, die von bestehenden Benchmarks nicht erkannt werden.

Ursprüngliche Autoren: Yifan Bai, Xiaoyang Liu, Zihao Mou, Guihong Wang, Jian Yu, Shuhan Xie, Yantao Li, Yangyu Zhang, Jingwei Liang, Tao Luo

Veröffentlicht 2026-05-22
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Yifan Bai, Xiaoyang Liu, Zihao Mou, Guihong Wang, Jian Yu, Shuhan Xie, Yantao Li, Yangyu Zhang, Jingwei Liang, Tao Luo

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie stellen einen Roboter-Koch ein, um ein komplexes Gericht zuzubereiten. Sie geben dem Roboter ein Rezept (die „Spezifikation") und bitten ihn, das Gericht zuzubereiten (den „Code"). Um zu prüfen, ob der Roboter gut ist, probieren Sie das Essen.

Das Problem: Die Falle des „einfachen Quiz"
Derzeit sind die Tests, mit denen wir diese KI-Köche überprüfen, wie ein sehr einfaches Quiz. Wir geben ihnen nur ein paar einfache Zutaten (wie „Salz" und „Wasser") und bitten um ein einfaches Ergebnis („Suppe"). Wenn der Roboter Suppe macht, geben wir ihm eine Eins.

Aber hier liegt der Haken: Der Roboter könnte betrügen. Er könnte sich die Antwort für „Salz + Wasser = Suppe" auswendig gelernt haben, aber wenn Sie ihm eine seltsame Zutat wie „Zahnpasta" geben, versucht er vielleicht trotzdem, Suppe zu machen und behauptet, es sei korrekt. Oder er schreibt ein Rezept, das sagt „Salz hinzufügen", vergisst aber zu sagen „kein Gift hinzufügen". Da der Test weder „Zahnpasta" noch „Gift" enthielt, besteht der Roboter den Test, obwohl er tatsächlich gefährlich oder defekt ist.

Die Arbeit argumentiert, dass die aktuellen Tests zu klein und zu einfach sind, was die KI schlauer erscheinen lässt, als sie wirklich ist.

Die Lösung: VeriScale (das „Stresstest"-Rahmenwerk)
Die Autoren haben ein neues System namens VeriScale entwickelt. Denken Sie daran als an einen „Stresstest" oder eine „Red Team"-Übung für KI-Code. Anstatt die KI nur zu bitten, Suppe zu kochen, versucht VeriScale, die KI dazu zu bringen, zu versagen.

Es funktioniert in zwei Hauptschritten:

Schritt 1: Der „Hindernisparcours" (Expansion)

Zuerst erstellt VeriScale einen riesigen, chaotischen Hindernisparcours aus Zutaten.

  • Der Samen: Es beginnt mit normalen Zutaten.
  • Die Mutation: Es verwendet eine „Mutationsmaschine", um diese Zutaten zu verdrehen und zu verzerren. Aus einer Tasse Wasser wird ein Eimer Eis, aus einer Prise Salz ein Berg Salz. Es erstellt seltsame Randfall-Szenarien, die die KI noch nie gesehen hat.
  • Der „Trickser"-Koch (Adversarial Synthesis): Dies ist der clevere Teil. VeriScale bittet eine andere, sehr intelligente KI, als „Trickser" zu agieren. Dieser Trickser versucht, ein gefälschtes Rezept zu schreiben, das so aussieht, als würde es die Regeln befolgen, aber tatsächlich Müll produziert.
    • Beispiel: Wenn die Regel lautet „Die Suppe muss heiß sein", könnte der Trickser ein Rezept schreiben, das „Eiscreme" ausgibt, aber behauptet: „Nun, technisch gesehen ist Eiscreme ein Lebensmittel, also habe ich die Regel befolgt!"
    • VeriScale führt diese Trickser-Rezepte gegen die Regeln der KI aus. Wenn die Regeln der KI die Eiscreme als „heißes Suppe" akzeptieren, fängt VeriScale den Fehler. Es generiert eine riesige Liste dieser „Aha-Momente".

Schritt 2: Die „Essenzielle Checkliste" (Reduktion)

Nun hat VeriScale Tausende dieser kniffligen Testfälle. Alle von ihnen auf jede KI laufen zu lassen, würde ewig dauern und ein Vermögen kosten. Daher führt es eine „Reduktion" durch.

  • Es fragt: „Welche dieser 1.000 Tricks sind die wichtigsten?"
  • Es behält die spezifischen Tricks, die die meisten Fehler aufdecken, und wirft diejenigen weg, die nur Wiederholungen sind.
  • Das Ergebnis ist ein kompakter, super-herausfordernder Test, der klein genug ist, um schnell ausgeführt zu werden, aber dennoch jeden einzelnen Fehler findet, den die riesige Liste gefunden hätte.

Die Ergebnisse: Das „Wahrheitsserum"
Die Autoren testeten dieses neue System auf den besten verfügbaren KI-Modellen (wie GPT-5.5 und anderen).

  • Der alte Test: Die KIs erzielten Punktzahlen wie 96 % oder 98 %. Sie sahen aus wie Genies.
  • Der VeriScale-Test: Wenn sie dem Stresstest unterzogen wurden, sanken die Punktzahlen dramatisch. Die Punktzahl eines Top-Modells fiel beim Codieren von 96 % auf 86 % und beim Schreiben der Regeln (Spezifikationen) von 68 % auf 44 %.

Die große Erkenntnis
Die Arbeit zeigt, dass die alten Tests uns belogen haben. Sie haben überschätzt, wie gut KI darin ist, sicheren, korrekten Code zu schreiben. Die neuen „VeriScale"-Tests zeigen, dass KI zwar großartig darin ist, Code zu schreiben, der richtig aussieht, aber immer noch sehr schlecht darin ist, Regeln zu schreiben, die jeden möglichen Fehler aufdecken.

Sie haben auch zwei Versionen dieses neuen Tests veröffentlicht:

  1. VERINAPLUS: Der massive, vollskalige Stresstest (83-mal größer als das Original).
  2. VERINALITE: Die „Lite"-Version. Sie ist 14-mal größer als das Original, nutzt aber den „Reduktions"-Trick, um schnell und günstig zu sein, während sie dennoch dieselben Fehler aufdeckt.

Kurz gesagt: VeriScale ist ein Werkzeug, das uns daran hindert, von KI getäuscht zu werden, die nur weiß, wie man einfache Tests besteht. Es zwingt die KI, zu beweisen, dass sie mit der seltsamen, chaotischen und kniffligen realen Welt zurechtkommt.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →