← Nieuwste papers
💻 computer science

ProcBench: Evaluating Process-Level Defects and Control Preservation in LLM Coding Agents

Dit artikel introduceert ProcBench, een raamwerk dat LLM-coderingsagenten evalueert door procesniveau-defecten en behoud van controle te analyseren via een gestandaardiseerde ontologie en risicogebaseerde scorekaarten, wat diepere diagnostische inzichten biedt dan traditionele benchmarks die uitsluitend op uitkomsten zijn gebaseerd, over meerdere datasets heen.

Oorspronkelijke auteurs: Jiawei He, Jie Jia, Chenbo Liu, Chaoyi Xue, Yapeng Song, Xikai Yang, Dong Sun

Gepubliceerd 2026-05-21
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Jiawei He, Jie Jia, Chenbo Liu, Chaoyi Xue, Yapeng Song, Xikai Yang, Dong Sun

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robotassistent inhuurt om een complexe lekkage in je huis te repareren.

De oude manier (huidige benchmarks):
Op dit moment, als je een robot vraagt de lekkage te repareren, kijk je alleen naar het resultaat: Stopte het water? Als het water stopt, geef je de robot een gouden ster. Als het water blijft druppen, geef je het een duim omlaag.

Maar dit mist veel van het verhaal. Wat als de robot:

  • Je volledige watervoorraad opdrinkt voordat hij de lekkage repareert?
  • 50 keer hetzelfde gat in de muur prikt voordat hij eindelijk de pijp vindt?
  • Halverwege vergeet waar hij zijn gereedschap heeft neergelegd?
  • In een lus blijft hangen, een uur lang in cirkels draait voordat hij eindelijk slaagt?

Als het water stopt, zegt het oude systeem: "Goed gedaan!" Maar in werkelijkheid was de robot chaotisch, verspillend en moeilijk te controleren.

De nieuwe manier (ProcBench):
De auteurs van dit paper, ProcBench, zeggen: "We moeten de robot beoordelen op hoe hij het werk heeft gedaan, niet alleen op of hij het heeft afgerond."

Ze hebben een nieuw scoresysteem ontwikkeld dat de volledige reis van de robot in de gaten houdt, zoals een scheidsrechter die een voetbalwedstrijd volgt, niet alleen de eindstand.

Hoe ProcBench werkt (de analogie)

Stel je een coderingsagent (de robot) voor als een chef die probeert een ingewikkeld gerecht te bereiden.

1. De "procesfouten" (het keukenrommel)
ProcBench zoekt naar specifieke manieren waarop de chef het proces kan verstoren, zelfs als het gerecht uiteindelijk goed smaakt. Ze categoriseren deze rommels in vier hoofdgebieden:

  • Contextbeheer (het rommelige aanrecht):

    • Geestelijke context: De chef blijft staren naar een oude receptpagina die al samengevat is, wat mentale ruimte verspillen.
    • Ongeregelde regels: De chef draagt een 50-pagina's tellende handleiding met regels in zijn schort die hij eigenlijk niet nodig heeft, wat hem vertraagt.
    • Thrashing: De chef blijft door de koelkast翻翻,pakt ingrediënten, legt ze terug, pakt ze weer, en komt nooit tot een plan.
  • Efficiëntie van toolgebruik (de verspillende bewegingen):

    • Dubbele stappen: De chef snijdt een ui, controleert of hij gesneden is, snijdt hem opnieuw, controleert opnieuw, en snijdt hem een derde keer.
    • Dode stappen: De chef opent de oven, kijkt naar binnen, sluit hem, en zet de taart er nooit echt in. De actie vond plaats, maar veranderde niets.
    • Lange ketens: De chef onderneemt 50 kleine stappen voor iets dat in 5 stappen had gekund.
  • Workflow-architectuur (het slechte keukenindeling):

    • Wrapper-workflow: De chef heeft een helper die alleen het zout van de ene hand van de chef naar de andere hand van de chef doorgeeft zonder iets nuttigs te doen.
    • Contextkoppeling: De chef en de sous-chef zijn zo verstrikt in elkaars taken dat als één niest, de hele keuken instort.
  • Consistentie van tool-ecosysteem (de verwarrende keukengerei):

    • Inconsistente interfaces: Eén lepel is gelabeld "Soep", een andere "Vloeistof", en een derde "Soep (Heet)". De chef raakt in de war en gebruikt de verkeerde.
    • Zwakke tools: Er ligt een geweldige elektrische garde in de lade, maar de chef vindt hem nooit en blijft een vork gebruiken omdat de garde verborgen was.

2. De "behoud van controle" (de veiligheidschakelaar)
Dit is het belangrijkste deel. Zelfs als de robot fouten maakt, kun jij (de mens) dan nog steeds overnemen?

  • Interpreteerbaarheid: Kun je begrijpen wat de robot doet?
  • Onderbreekbaarheid: Kun je op "Pauze" drukken zonder dat de robot crasht?
  • Corrigeerbaarheid: Als de robot een fout maakt, kun je het dan repareren zonder het hele gerecht opnieuw te beginnen?
  • Omkeerbaarheid: Kan de robot een slechte stap ongedaan maken?
  • Autoriteitsoverdracht: Kan de robot zeggen: "Ik zit vast, jij neemt over", en je dat echt laten doen?

De "gekalibreerde scorekaart" (het rapport)

In plaats van alleen "Geslaagd" of "Niet geslaagd" te zeggen, geeft ProcBench een gedetailleerd rapport.

  • Het telt niet alleen fouten; het berekent het risico.
  • Het gebruikt een "kalibratie"-systeem (zoals een weersvoorspelling). In plaats van te zeggen "Het kan regenen", zegt het: "Er is 70% kans op regen." Dit helpt je te begrijpen hoe ernstig een fout echt is.
  • Het geeft een score voor het Proces (hoe rommelig de keuken was) en een score voor Controle (hoe veilig de keuken voelde).

Wat ze ontdekten

De auteurs testten dit op 200 real-world coderingstaken (zoals bugs in software repareren of apps bouwen) met verschillende AI-robots.

  1. Het werkt: Ze ontdekten dat ze deze "rommelige keuken"-gedragingen betrouwbaar konden opsporen.
  2. Het onthult verborgen gebreken: Twee robots kunnen beide de taak afronden (Geslaagd), maar de één deed het efficiënt en veilig, terwijl de ander chaotisch en riskant was. Het oude systeem zou ze allebei een gouden ster geven. ProcBench geeft de chaotische een lagere score.
  3. Het gaat niet alleen over het model: Een krachtige AI-geest (het model) garandeert geen goed proces. Als het "lichaam" van de robot (het agent-framework) onhandig is, faalt het hele systeem, zelfs met een slim brein.

De kernboodschap

ProcBench is een nieuwe manier om AI-coders te beoordelen. Het stopt ons met alleen naar het eindresultaat te kijken en dwingt ons om naar de reis te kijken. Het vraagt: "Lost de robot het probleem op, of struikelde hij zijn weg naar een oplossing terwijl hij een rommeltje veroorzaakte en controle verloor?"

Dit helpt ontwikkelaars AI te bouwen die niet alleen slim is, maar ook betrouwbaar, veilig en makkelijk te beheren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →