AgentEval: DAG-Structured Step-Level Evaluation for Agentic Workflows with Error Propagation Tracking
AgentEval is een nieuw evaluatiekader dat agentische workflows analyseert als gerichte acyclische grafen (DAG's) om fouten op stappenniveau nauwkeurig te detecteren, de oorzaken ervan automatisch te herleiden en de efficiëntie van debugging in productieomgevingen aanzienlijk te verbeteren.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een supermoderne, zelfrijdende robotchef in een restaurant hebt. Deze chef doet alles zelf: hij leest het recept, kiest de juiste messen, snijdt de groenten, bakt het vlees en serveert het bord.
Tot nu toe testten we deze robot op één simpele manier: "Smaakt het eindgerecht goed?" Als de soep zout is, weten we dat er iets mis is, maar we hebben geen idee waar het misging. Was het recept verkeerd? Was de kok te enthousiast met de zoutpot? Of was de pan niet schoon?
Dit paper introduceert AgentEval. Dit is niet zomaar een smaaktest, maar een soort "super-inspecteur" die de chef bij elke handeling over de schouder meekijkt.
De kern van het probleem: Het domino-effect
In een complexe workflow (zoals een AI-agent die taken uitvoert) werken stappen op elkaar in. Als de chef in het begin de verkeerde pan kiest, zal de soep aan het eind altijd mislukken, hoe goed hij ook kan koken. Dit noemen we fout-propagatie: een kleine fout in stap 1 zorgt voor een enorme ramp in stap 10.
De huidige methoden zijn als een criticus die alleen het eindbord beoordeelt. AgentEval is als een team van experts die elke beweging in de keuken analyseren.
Hoe werkt AgentEval? (De drie geheime ingrediënten)
1. De "Recept-kaart" (De DAG-structuur)
In plaats van een simpele lijst met taken, ziet AgentEval de workflow als een stamboom (een DAG). Het begrijpt dat stap B alleen kan gebeuren als stap A is gelukt. Als stap B mislukt, kijkt AgentEval direct omhoog in de stamboom: "Hé, stap B is niet slecht omdat de kok een fout maakte, maar omdat hij de verkeerde ingrediënten kreeg van stap A!" Zo vinden ze de echte bron van de fout (de Root Cause).
2. De "Gespecialiseerde Jury" (De LLM-Judge)
AgentEval gebruikt een zeer slimme AI (GPT-4o) als scheidsrechter. Maar deze scheidsrechter is niet zomaar een algemene criticus. Hij heeft voor elke taak een eigen checklist:
- Bij het plannen kijkt hij: "Is dit een logisch stappenplan?"
- Bij het gereedschap kiezen kijkt hij: "Is dit het juiste mes voor deze tomaat?"
- Bij het serveren kijkt hij: "Ziet het bord er netjes uit?"
3. Het "Fouten-woordenboek" (De Taxonomie)
In plaats van alleen te zeggen "het is mislukt", heeft AgentEval een heel uitgebreid woordenboek met 21 soorten fouten. Het zegt niet: "De soep is vies", maar: "De chef heeft de verkeerde kruiden gebruikt (Type: Parameterfout) omdat hij het recept verkeerd las (Type: Interpretatiefout)."
Waarom is dit een doorbraak?
- Het vindt de echte dader: In tests vond AgentEval 2,17 keer sneller waar het echt misging dan de oude methoden.
- Het bespaart tijd: In een praktijktest met ingenieurs hoefden zij niet meer urenlang te zoeken naar een fout. De tijd die nodig was om de oorzaak te vinden, zakte van 4 uur naar slechts 22 minuten. Dat is het verschil tussen een hele middag puzzelen en even snel een kopje koffie drinken.
- Het is een waarschuwingssysteem: Het kan worden ingebouwd in de "fabriek" van de AI. Als een update van de software ervoor zorgt dat de AI ineens slechter wordt in het snijden van groenten, slaat AgentEval direct alarm voordat de klant een slecht gerecht krijgt.
Samenvatting in één zin
AgentEval is als een slimme videocamera in een keuken die niet alleen zegt dat het eten mislukt, maar precies aanwijst op welk moment de chef de verkeerde pan pakte, zodat je de fout direct kunt herstellen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.