← Nieuwste papers
💻 computer science

SpecBench: Evaluating Specification-Level Reasoning for Software Engineering LLM Agents

Dit artikel introduceert SpecBench, een nieuwe benchmark die de vaardigheid van software-engineeringagenten evalueert om gebreken te identificeren en onvolledige of ambiguïteit bevattende systeemspecificaties te verbeteren door middel van expertniveau-redenering, waarmee een kritieke lacune wordt aangevuld die door bestaande op code-generatie gerichte benchmarks is achtergelaten.

Oorspronkelijke auteurs: Grant Hamblin, Kevin Song, Zhanda Zhu, Anand Jayarajan, Sihang Liu, Nandita Vijaykumar, Gennady Pekhimenko

Gepubliceerd 2026-05-29
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Grant Hamblin, Kevin Song, Zhanda Zhu, Anand Jayarajan, Sihang Liu, Nandita Vijaykumar, Gennady Pekhimenko

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Plaatje: Van "Bouwen" naar "Plannen"

Stel je voor dat je een robot huurt om een huis te bouwen.

  • Oude benchmarks (zoals SWE-Bench): Deze tests geven de robot een perfect, gedetailleerd blauwdruk en vragen: "Kun je de muur precies bouwen zoals getekend?" De robot hoeft alleen maar de bakstenen te leggen. Als het blauwdruk zegt "rode baksteen", legt de robot een rode baksteen.
  • Het probleem in de echte wereld: In het echte leven is het blauwdruk waarmee je begint vaak rommelig. Het kan zeggen "zet hier een deur" zonder te specificeren of het een voor- of achterdeur is, of het kan vergeten te vermelden dat de fundering dieper moet vanwege het bodemtype. Als de robot gewoon begint te bouwen op basis van dat rommelige blauwdruk, kan het huis later instorten.
  • De nieuwe benchmark (SpecBench): Dit paper introduceert een test die de robot niet vraagt om het huis te bouwen. In plaats daarvan vraagt het de robot om het rommelige blauwdruk te lezen en de fouten aan te wijzen voordat de bouw begint. Het test het vermogen van de robot om te zeggen: "Hé, dit plan mist een deur," of "Deze muur raakt een boom," of "Je hebt niet gezegd welk soort hout je moet gebruiken."

Wat is SpecBench?

SpecBench is een nieuwe test die is ontworpen om te evalueren hoe goed AI-agenten (slimme computerprogramma's) kunnen redeneren over specificaties van software.

In software-engineering schrijven ze, voordat iemand code schrijft, een "specificatie" (een plan). Bij grote projecten zoals Linux, Kubernetes of React doorlopen deze plannen een proces dat een RFC (Request for Comments) wordt genoemd. Dit is als een gemeentehuisvergadering waar experts het plan bespreken, bekritiseren en verfijnen totdat het perfect is.

SpecBench simuleert deze gemeentehuisvergadering. Het geeft een AI:

  1. Het initiële, rommelige plan (de RFC).
  2. De geschiedenis van hoe het project in het verleden heeft gewerkt.
  3. De huidige code van het project.

De taak van de AI is om te fungeren als een senior engineer en de fouten in het plan te vinden. Het moet dingen vinden die:

  • Ontbreken: "Je bent vergeten te zeggen wat er gebeurt als het internet uitvalt."
  • Verwarrend zijn: "Je zei 'snel', maar bedoelde je 1 seconde of 1 minuut?"
  • In strijd zijn: "Je zei dat deze functie veilig is, maar het breekt die andere regel."
  • Verkeerd zijn: "Dit idee botst met hoe we het altijd hebben gedaan."

Hoe hebben ze de test gebouwd?

De onderzoekers keken naar vijf echte software-reuzen: Kubernetes, React, Rust, TVM en vLLM.

Ze namen echte historische documenten waar mensen nieuwe functies voorstelden. Vervolgens keken ze naar de echte discussies waar menselijke experts die voorstellen uit elkaar haalden en de gaten vonden. Deze "gaten" werden de Golden Set (de juiste antwoorden).

De uitdaging van "menselijke variatie":
Soms geeft één expert om snelheid, terwijl een ander om beveiliging geeft. Om dit op te lossen, gebruikten de onderzoekers een panel van AI-rechters om te stemmen welke kritiek het belangrijkst was. Ze verdeelden de fouten in twee groepen:

  • Kernfouten: De grote, duidelijke fouten waar bijna iedereen het over eens is (zoals een ontbrekende fundering).
  • Uitgebreide fouten: Kleinere, genuanceerdere problemen die sommige experts kunnen opmerken en andere misschien niet.

Het "Open World"-probleem:
In een codetest faalt de robot als het verkeerde code schrijft. Maar in een planningstest kan de robot een nieuwe fout vinden die de oorspronkelijke mensen hebben gemist. De onderzoekers besloten: "Als de robot een fout vindt die niet in ons antwoordensleutel staat, kunnen we niet zeggen dat het verkeerd is, maar we kunnen er ook geen punten voor geven." Dus gaven ze de robot een beperkt aantal gokken (een budget) en scoorden ze alleen op hoeveel van zijn gokken overeenkwamen met de bekende "Gouden" fouten.

Hoe presteerde de AI?

De onderzoekers testten de slimste beschikbare AI-agenten (zoals GPT-5.4, Claude en Codex).

  • De score: De beste AI behaalde ongeveer 44,4% nauwkeurigheid.
  • Wat dit betekent: Zelfs de slimste AI mist nog steeds meer dan de helft van de kritieke fouten in complexe softwareplannen. Ze worden beter in het schrijven van code, maar ze zijn nog steeds niet erg goed in het plannen van code.
  • Het gat: De AI was veel beter in het vinden van de "Kern"-fouten (de grote, duidelijke) dan de "Uitgebreide"-fouten (de subtiele, lastige).

Waarom is dit belangrijk?

Momenteel hebben we AI die geweldig is in het volgen van instructies (Implementatie). We hebben nog geen AI die geweldig is in het ontwerpen van de instructies (Specificatie).

Dit paper laat zien dat terwijl AI goed wordt in het zijn van een "bakker", het nog steeds worstelt met het zijn van de "architect". Als we willen dat AI volledige softwareprojecten runt, moet het leren hoe het de gaten in het plan kan opsporen voordat de eerste regel code is geschreven.

Kortom: SpecBench is een rapportkaart die laat zien dat onze AI-architecten nog steeds leren hoe ze de blauwdrukken moeten lezen voordat ze beginnen met bouwen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →