← Nieuwste papers
💬 NLP

ClassEval-Pro: A Cross-Domain Benchmark for Class-Level Code Generation

Dit artikel introduceert ClassEval-Pro, een rigoureus, cross-domein benchmark van 300 code-generatietaken op klassenniveau die zijn gevalideerd door een LLM-ensemble en uitgebreide testsuites, en waaruit blijkt dat huidige state-of-the-art LLM's moeite hebben met compositiecodecreatie vanwege logische en afhankelijkheidsfouten, met een beste Pass@1-score van slechts 45,6%.

Oorspronkelijke auteurs: Yeheng Chen, Chaoxiang Xie, Yuling Shi, Wenhao Zeng, Yongpan Wang, Hongyu Zhang, Xiaodong Gu

Gepubliceerd 2026-04-30
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yeheng Chen, Chaoxiang Xie, Yuling Shi, Wenhao Zeng, Yongpan Wang, Hongyu Zhang, Xiaodong Gu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robotkok leert koken.

De Oude Methode (Op Functieniveau):
Tot nu toe hebben onderzoekers deze AI-koks voornamelijk getest door hen te vragen om één enkel, simpel ingrediënt te bereiden, zoals "een ui hakken" of "water koken". De AI is hier uitstekend in. Het kan 90% van de tijd uien perfect hakken. Dit is vergelijkbaar met het testen of de robot één enkel gereedschap kan hanteren.

Het Ontbrekende Deel (Op Class-niveau):
Maar in de echte wereld gaat koken niet alleen om het hakken van één ding. Het gaat om het samenstellen van een volledig gerecht waarbij de ingrediënten met elkaar moeten samenwerken. Je hebt een saus nodig die weet hoeveel zout er is toegevoegd, een garnering die past bij het hoofdgerecht, en een presentatiestrategie die alles bij elkaar houdt. Dit is wat het paper "compositional code creation" noemt. Het is het vermogen om een complete, georganiseerde "class" (een zelfstandige eenheid van software) te bouwen waarin meerdere onderdelen correct met elkaar communiceren.

Het Probleem:
De auteurs zeggen dat we geen goede test hadden voor deze vaardigheid van het "hele gerecht". De oude tests waren te simpel, en de weinige tests die bestonden, waren door mensen gemaakt, wat traag en duur is, en de recepten zijn mogelijk tijdens de training aan de AI gelekt (zoals de AI die bedriegt door de testantwoorden uit het hoofd te leren).

De Oplossing: ClassEval-Pro
Het team bouwde een nieuwe, enorme test genaamd ClassEval-Pro. Hier is hoe ze het maakten, gebruikmakend van een creatieve analogie:

  1. De Ingrediënten (Data): In plaats van recepten met de hand te schrijven, gingen ze naar een gigantische digitale bibliotheek (GitHub) en pikten ze recepten eruit die na januari 2025 waren geschreven. Dit zorgt ervoor dat de AI ze nog niet heeft gezien, dus het is een eerlijke test.
  2. De Mengkom (Cross-Domain): Ze mengden niet alleen vergelijkbare ingrediënten. Ze dwongen de AI om volledig verschillende werelden te mengen. Stel je voor dat je de robot vraagt om een "Financiële Calculator" te bouwen die ook een "Video Game Inventaris" moet beheren. Het moet de geldlogica en de spellogica laten samenwerken in één enkel, coherent programma.
  3. De Proeverij (Validatie): Voordat de test zelfs maar begint, gebruiken ze een panel van AI-rechters om te controleren of het recept logisch is en of de test "proeverijen" (codetests) ten minste 90% van het recept bestrijken. Als het recept kapot is, gooien ze het weg.

De Resultaten: De Robotkoks Struikelen
Ze vroegen vijf van de slimste AI-koks (zoals GPT-5.1, Gemini en Qwen) om deze complexe gerechten te bereiden.

  • De Score: Zelfs de beste kok kreeg slechts ongeveer 45% van de gerechten goed. Dat is een enorme daling ten opzichte van de 90% die ze halen bij simpele "ui hakken"-taken.
  • Het Kloof: Er was een groot verschil tussen de beste kok en de slechtste. De beste kreeg 45% goed, terwijl de zwakste slechts 28% haalde. Dit bewijst dat de test goed is in het onderscheiden van sterke koks van zwakke.
  • De "Methode"-Valstrik: Interessant genoeg konden de koks vaak de individuele stappen correct schrijven (zoals "hak de ui" of "voeg zout toe"). Maar toen ze probeerden het allemaal samen te voegen tot één werkend gerecht, viel alles uit elkaar. De ui was gehakt, maar het zout werd aan de verkeerde pan toegevoegd.

Hoe Ze Probeerden te Helpen (Strategieën)
De onderzoekers probeerden de koks verschillende manieren te geven om het koken aan te pakken:

  • De "Bottom-Up" aanpak: "Begin met de basis ingrediënten, bouw dan de saus, en daarna de garnering." Dit hielp de zwakkere koks aanzienlijk om te verbeteren.
  • De "Top-Down" aanpak: "Plan eerst het hele menu, en kook dan." Dit hielp de sterkste koks.
  • De "Compositional" aanpak: "Schrijf het sausrecept, dan het garneringsrecept, en plak ze dan aan elkaar." Dit was een ramp. De koks raakten in de war toen ze probeerden de stukken aan elkaar te plakken, en hun slagingspercentage stortte in naar bijna nul (1,3% voor één model).

Wat Ging Er Fout? (De Fouten)
Het team bekeek 500 mislukte gerechten om te zien wat er fout ging. Ze vonden twee hoofdproblemen:

  1. Logische Fouten (56%): De robot begreep de woorden maar haalde de betekenis verkeerd. (bijv. "Als de gebruiker offline is, geef ze dan een succesmelding" in plaats van een foutmelding).
  2. Afhankelijkheidsfouten (38%): De onderdelen pasten niet. (bijv. Het sausrecept vroeg om een ingrediënt dat het garneringsrecept niet had, of ze gebruikten verschillende namen voor dezelfde kom).

De Grote Conclusie
Het paper concludeert dat hoewel AI geweldig is in het schrijven van kleine, geïsoleerde stukjes code, het nog steeds erg slecht is in het orkestreren van een heel systeem. Het moeilijkste deel is niet het schrijven van de code voor één enkele functie; het is ervoor zorgen dat die functie correct met de andere functies communiceert, de juiste gegevens deelt en het hele systeem niet kapot maakt.

ClassEval-Pro is de nieuwe "kookwedstrijd" die deze AI-koks eindelijk dwingt te bewijzen dat ze een hele keuken kunnen runnen, en niet alleen één groente kunnen hakken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →