ClassEval-Pro: A Cross-Domain Benchmark for Class-Level Code Generation
Dieser Beitrag stellt ClassEval-Pro vor, ein rigoroses, domänenübergreifendes Benchmark mit 300 Aufgaben zur Generierung von Code auf Klassenebene, das durch ein Ensemble von LLMs und Test-Suiten mit hoher Abdeckung validiert wurde und zeigt, dass aktuelle führende LLMs aufgrund von Logik- und Abhängigkeitsfehlern Schwierigkeiten bei der kompositionellen Codeerstellung haben und dabei eine beste Pass@1-Rate von lediglich 45,6 % erreichen.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich vor, Sie unterrichten einen Roboter-Koch beim Kochen.
Der alte Weg (Funktionsniveau):
Bisher haben Forscher diese KI-Köche hauptsächlich getestet, indem sie sie aufforderten, eine einzelne, einfache Zutat herzustellen, wie etwa „eine Zwiebel hacken" oder „Wasser kochen". Die KI ist darin hervorragend. Sie kann 90 % der Zeit Zwiebeln perfekt hacken. Das ist so, als würde man testen, ob der Roboter ein einzelnes Werkzeug handhaben kann.
Das fehlende Puzzleteil (Klassenniveau):
Aber in der realen Welt geht es beim Kochen nicht nur darum, eine Sache zu hacken. Es geht darum, ein ganzes Gericht zu kreieren, bei dem die Zutaten zusammenarbeiten müssen. Sie benötigen eine Sauce, die weiß, wie viel Salz hinzugefügt wurde, eine Garnierung, die zum Hauptgang passt, und eine Anrichtestrategie, die alles zusammenhält. Das ist es, was die Arbeit als „kompositionelle Code-Erstellung" bezeichnet. Es ist die Fähigkeit, eine vollständige, organisierte „Klasse" (eine in sich geschlossene Softwareeinheit) zu erstellen, in der mehrere Teile korrekt miteinander kommunizieren.
Das Problem:
Die Autoren sagen, wir hatten keinen guten Test für diese Fähigkeit des „ganzen Gerichts". Die alten Tests waren zu einfach, und die wenigen existierenden Tests wurden von Menschen erstellt, was langsam und teuer ist, und die Rezepte könnten dem KI während ihres Trainings durchgesickert sein (wie wenn die KI durch Auswendiglernen der Testantworten schummelt).
Die Lösung: ClassEval-Pro
Das Team hat einen neuen, massiven Test namens ClassEval-Pro entwickelt. So haben sie ihn erstellt, unter Verwendung einer kreativen Analogie:
- Die Zutaten (Daten): Anstatt Rezepte von Hand zu schreiben, gingen sie in eine riesige digitale Bibliothek (GitHub) und griffen zu Rezepten, die nach Januar 2025 geschrieben wurden. Dies stellt sicher, dass die KI sie zuvor nicht gesehen hat, sodass es ein fairer Test ist.
- Die Rührschüssel (Querschnittsdomäne): Sie haben nicht nur ähnliche Zutaten gemischt. Sie zwangen die KI, völlig unterschiedliche Welten zu mischen. Stellen Sie sich vor, Sie bitten den Roboter, einen „Finanzrechner" zu bauen, der gleichzeitig ein „Videospiele-Inventar" verwalten muss. Er muss die Geld-Logik und die Spiel-Logik in einem einzigen, kohärenten Programm zusammenarbeiten lassen.
- Der Geschmackstest (Validierung): Bevor der Test überhaupt beginnt, verwenden sie ein Gremium aus KI-Richtern, um zu prüfen, ob das Rezept Sinn ergibt und ob die Test-Geschmackstests (Code-Tests) mindestens 90 % des Rezepts abdecken. Wenn das Rezept defekt ist, werfen sie es weg.
Die Ergebnisse: Die Roboter-Köche haben Schwierigkeiten
Sie baten fünf der klügsten KI-Köche (wie GPT-5.1, Gemini und Qwen), diese komplexen Gerichte zu zubereiten.
- Die Punktzahl: Selbst der beste Koch bekam nur etwa 45 % der Gerichte richtig. Das ist ein enormer Rückgang von den 90 %, die sie bei einfachen „Zwiebel hacken"-Aufgaben erreichen.
- Die Lücke: Es gab einen großen Unterschied zwischen dem besten Koch und dem schlechtesten. Der Beste bekam 45 % richtig, während der Schwächste nur 28 % erreichte. Dies beweist, dass der Test gut darin ist, starke Köche von schwachen zu unterscheiden.
- Die „Methoden"-Falle: Interessanterweise konnten die Köche oft die einzelnen Schritte korrekt schreiben (wie „die Zwiebel hacken" oder „Salz hinzufügen"). Aber wenn sie versuchten, alles zu einem funktionierenden Gericht zusammenzufügen, fiel alles auseinander. Die Zwiebel war gehackt, aber das Salz wurde in den falschen Topf gegeben.
Wie sie zu helfen versuchten (Strategien)
Die Forscher versuchten, den Köchen verschiedene Herangehensweisen beim Kochen zu geben:
- Der „Bottom-Up"-Ansatz: „Beginnen Sie mit den Grundzutaten, dann die Sauce, dann die Garnierung." Dies half den schwächeren Köchen, sich signifikant zu verbessern.
- Der „Top-Down"-Ansatz: „Planen Sie zuerst die gesamte Speisekarte, dann kochen Sie." Dies half den stärksten Köchen.
- Der „Kompositionelle"-Ansatz: „Schreiben Sie das Sauce-Rezept, dann das Garnierungs-Rezept, dann kleben Sie sie zusammen." Dies war eine Katastrophe. Die Köche gerieten in Verwirrung, als sie versuchten, die Teile zusammenzukleben, und ihre Erfolgsrate stürzte auf fast null ab (1,3 % für ein Modell).
Was lief schief? (Die Fehler)
Das Team untersuchte 500 fehlgeschlagene Gerichte, um zu sehen, was schiefging. Sie fanden zwei Hauptprobleme:
- Logikfehler (56 %): Der Roboter verstand die Worte, aber begriff die Bedeutung falsch. (z. B. „Wenn der Benutzer offline ist, senden Sie ihm eine Erfolgsmeldung" statt einer Fehlermeldung).
- Abhängigkeitsfehler (38 %): Die Teile passten nicht zusammen. (z. B. Das Sauce-Rezept forderte eine Zutat, die das Garnierungs-Rezept nicht hatte, oder sie verwendeten unterschiedliche Namen für dieselbe Schüssel).
Die große Erkenntnis
Die Arbeit kommt zu dem Schluss, dass KI zwar erstaunlich darin ist, kleine, isolierte Code-Schnipsel zu schreiben, aber immer noch sehr schlecht darin ist, ein ganzes System zu orchestrieren. Der schwierigste Teil ist nicht das Schreiben des Codes für eine einzelne Funktion; es ist sicherzustellen, dass diese Funktion korrekt mit den anderen Funktionen kommuniziert, die richtigen Daten teilt und das gesamte System nicht zerstört.
ClassEval-Pro ist der neue „Kochwettbewerb", der diese KI-Köche endlich zwingt, zu beweisen, dass sie eine ganze Küche führen können, nicht nur ein einziges Gemüse hacken.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.