← Neueste Arbeiten
💬 NLP

ScaleBox: Enabling High-Fidelity and Scalable Code Verification for Large Language Models

ScaleBox ist ein hochpräzises und skalierbares System zur Codeverifikation, das die Einschränkungen bestehender Sandboxes durch automatische Generierung von Spezialrichtern, fein granulare parallele Ausführung und Multi-Node-Koordination adressiert und damit sowohl die Genauigkeit als auch die Effizienz des großskaligen Code-Trainings und der -Evaluation für Large Language Models erheblich verbessert.

Ursprüngliche Autoren: Jiasheng Zheng, Xin Zheng, Boxi Cao, Pengbo Wang, Zhengzhao Ma, Qiming Zhu, Jiazhen Jiang, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun

Veröffentlicht 2026-05-01
📖 3 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Jiasheng Zheng, Xin Zheng, Boxi Cao, Pengbo Wang, Zhengzhao Ma, Qiming Zhu, Jiazhen Jiang, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie unterrichten einen Roboter (ein Large Language Model), wie man ein Meisterprogrammierer wird. Um ihn zu unterrichten, geben Sie ihm Tausende von Codier-Rätseln und bitten ihn, diese zu lösen. Aber wie wissen Sie, ob der Roboter das Rätsel tatsächlich korrekt gelöst hat?

Hier kommt ScaleBox ins Spiel. Betrachten Sie ScaleBox als ein übermächtiges, ultraschnelles und unglaublich faires Benotungssystem für diese Codier-Rätsel.

Hier ist die Geschichte davon, warum der alte Weg kaputt war und wie ScaleBox ihn repariert, erklärt durch einfache Analogien:

1. Das Problem: Der „Steife Prüfer" vs. der „Kreative Löser"

In der Vergangenheit verwendeten diese Codiersysteme eine Methode namens „Exakter Abgleich". Stellen Sie sich einen Lehrer vor, der nur prüft, ob Ihre Antwort exakt so geschrieben ist wie im Lösungsschlüssel.

  • Der Fehler: Wenn das Rätsel lautet: „Gib mir zwei beliebige Zahlen, die sich zu 10 addieren", und der Lösungsschlüssel sagt „5 + 5", Ihr Roboter aber „1 + 9" schreibt, würde das alte System dies als falsch markieren.
  • Die Realität: Beim Codieren gibt es oft viele korrekte Wege, ein Problem zu lösen. Das alte System war wie ein Prüfer, der einen Schüler durchfallen ließ, weil er „1+9" statt „5+5" schrieb, obwohl die Mathematik perfekt war. Dies verwirrte den Roboter und ließ ihn glauben, er würde scheitern, obwohl er tatsächlich erfolgreich war.

2. Die Lösung: Der „Smarte Schiedsrichter" (Spezialrichter)

ScaleBox führt eine neue Funktion namens Spezialrichter ein.

  • Die Analogie: Anstelle eines steifen Prüfers stellen Sie sich einen smarten Schiedsrichter in einem Fußballspiel vor. Der Schiedsrichter schaut nicht nur auf das Ergebnis; er beobachtet das Spiel. Wenn der Roboter einen kreativen, gültigen Weg findet, das Problem zu lösen (wie „1+9"), prüft der smarte Schiedsrichter die Logik, sieht, dass es funktioniert, und sagt: „Tor! Das zählt!"
  • Wie es funktioniert: ScaleBox erstellt diese smarten Schiedsrichter automatisch für knifflige Probleme. Es prüft, ob der Code tatsächlich funktioniert, anstatt nur Buchstaben zu vergleichen. Dies verhindert, dass der Roboter durch falsche „Scheitern"-Meldungen verwirrt wird.

3. Der Engpass: Der „Stau"

Das zweite Problem alter Systeme war die Geschwindigkeit. Stellen Sie sich eine Fabrik vor, in der ein langsamer Arbeiter jedes einzelne Spielzeug einzeln prüfen muss. Wenn Tausende von Robotern gleichzeitig lernen wollen, gerät die Fabrik ins Stocken.

  • Der Fehler: Alte Systeme versuchten, alles auf einer einzigen Linie auszuführen, was einen massiven Stau verursachte. Die leistungsstarken Computer (GPUs) warteten herum, während die langsameren Computer (CPUs) Mühe hatten, Schritt zu halten.
  • Die Lösung: ScaleBox ist wie der Bau einer riesigen, mehrspurigen Autobahn. Es teilt die Arbeit auf, sodass Tausende von Tests gleichzeitig auf vielen Computern stattfinden können. Es nutzt ungenutzte Ressourcen (leere Spuren), um sicherzustellen, dass keine Zeit verschwendet wird.

4. Das Ergebnis: Ein besserer Roboter

Die Autoren testeten ScaleBox, indem sie einen Roboter (Qwen3-8B) mit diesem neuen, fairen und schnellen System zum Codieren unterrichteten.

  • Was passierte: Da der Roboter keine „Scheitern"-Meldungen mehr vom steifen Prüfer erhielt, lernte er viel schneller. Er wurde stabiler und selbstbewusster.
  • Die Punktzahl: Bei Tests mit Standard-Codier-Herausforderungen (LiveCodeBench) erzielte der mit ScaleBox trainierte Roboter deutlich höhere Werte als Roboter, die mit den alten, steifen Systemen trainiert wurden.

Zusammenfassung

ScaleBox ist eine neue Infrastruktur, die das Unterrichten von KI im Codieren verbessert, indem sie zwei Dinge tut:

  1. Es ist fairer: Es nutzt „smarte Schiedsrichter", um jede korrekte Lösung zu akzeptieren, nicht nur die eine spezifische Antwort im Buch.
  2. Es ist schneller: Es baut eine Autobahn für Tests, sodass Tausende von Code-Prüfungen sofort ohne Staus stattfinden.

Das Ergebnis ist eine intelligentere, stabilere KI, die effektiver Codieren lernt, weil sie präzises Feedback erhält und nicht verwirrendes Rauschen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →