← Nieuwste papers
💻 computer science

Evaluating LLMs Code Reasoning Under Real-World Context

Dit artikel introduceert R2Eval, een nieuw benchmark met 135 code-redeneringsproblemen afkomstig van populaire Python-projecten die, in tegenstelling tot bestaande methoden, complexe datastructuren en realistische projectafhankelijkheden behouden om de praktische generaliseerbaarheid van grote taalmodellen beter te evalueren.

Oorspronkelijke auteurs: Changshu Liu

Gepubliceerd 2026-04-15
📖 3 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Changshu Liu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een chef-kok wilt testen. Je wilt weten of hij echt goed kan koken of dat hij alleen maar recepten uit een boekje kan herhalen.

Het oude probleem: De "Kookboeksessie"
Tot nu toe hebben onderzoekers grote taalmodellen (LLMs, de slimme AI's) getest met simpele, zelfgemaakte recepten. Het waren alsof je de chef vroeg: "Als ik 2 eieren en 100 gram bloem heb, wat krijg ik dan?"
De AI's waren hier heel goed in. Ze gaven het juiste antwoord. Maar dit is net als een kookwedstrijd in een lege keuken zonder echte ingrediënten. Het laat niet zien of de chef ook een maaltijd kan klaarmaken in een drukke, echte restaurantkeuken, waar de ingrediënten soms in vreemde dozen zitten, de oven een eigen wil heeft en je moet samenwerken met andere koks.

De huidige tests kijken alleen naar simpele dingen (zoals getallen of losse woorden) en negeren de complexe, echte wereld van software.

De nieuwe oplossing: R2Eval (De "Echte Keuken")
Changshu Liu heeft een nieuwe test bedacht, genaamd R2Eval. In plaats van simpele recepten, pakt deze test de echte, ingewikkelde code uit tien beroemde, grote softwareprojecten (zoals de tools die wetenschappers en ontwikkelaars dagelijks gebruiken).

Hier is het creatieve deel:
In de echte wereld zijn data vaak geen simpele getallen, maar complexe "pakketten" (zoals een ingewikkeld 3D-kaartje of een speciale meetinstrument). Als je zo'n pakket gewoon probeert af te drukken, krijg je vaak alleen maar een raadselachtige code of een adres, net als een doosje zonder label.

R2Eval doet iets slimme: het pakt die ingewikkelde, onleesbare pakketten uit en verpakt ze in een leesbaar JSON-formaat (een soort duidelijke, gestructureerde lijst).

  • Vergelijking: Het is alsof de chef een doos krijgt met een raadselachtig etiket, en R2Eval dat etiket vervangt door een duidelijke foto van wat erin zit, zodat de AI precies weet wat hij moet doen.

Wat ontdekten ze?
Toen ze de slimste AI's (zoals GPT-4 en DeepSeek) op deze "echte keuken" testten, gebeurde er iets verrassends:

  • Op de simpele tests (het oude kookboek) scoorden ze fantastisch (bijna 90% goed).
  • Op de R2Eval-tests (de echte keuken) zakte hun score dramatisch in. Ze maakten veel meer fouten, soms wel 60% minder goed dan voorheen.

De conclusie in het kort:
De AI's zijn eigenlijk heel goed in het oplossen van schoolse raadsels, maar ze struikelen over de echte, rommelige complexiteit van software die mensen dagelijks gebruiken. Ze lijken slim, maar ze zijn nog niet klaar voor de echte wereld.

Waarom is dit belangrijk?
Dit onderzoek is als een waarschuwing: "Stop met het testen van je auto's alleen op een lege racebaan. Als je wilt weten of ze veilig zijn, moet je ze testen in het drukke stadsverkeer, met regen, andere auto's en onverwachte obstakels."

R2Eval helpt ons dus om AI's te trainen en te testen op de manier waarop ze écht moeten werken: in de chaotische, complexe wereld van echte softwareprojecten.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →