Agent-Diff: Benchmarking LLM Agents on Enterprise API Tasks via Code Execution with State-Diff-Based Evaluation
Deze paper introduceert Agent-Diff, een nieuw benchmarkkader dat agentic Large Language Models evalueert op zakelijke API-taken door een gecontroleerde sandboxomgeving te combineren met realistische API-interacties en een innovatieve 'state-diff'-methode om succes te meten op basis van de daadwerkelijke verandering in systeemtoestand.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Agent-Diff: De "Rijbewijstest" voor AI-assistenten
Stel je voor dat je een nieuwe chauffeur wilt aannemen. Je kunt hem niet gewoon vragen: "Kun je rijden?" en hopen dat het goed gaat. Je moet hem op de weg zetten, in een veilige omgeving, en kijken of hij daadwerkelijk van A naar B komt zonder de bomen te raken.
Dit is precies wat de onderzoekers van Minerva University hebben gedaan met hun nieuwe test, genaamd Agent-Diff. Ze willen weten of slimme AI-assistenten (LLM-agents) echt kunnen werken met de software die bedrijven gebruiken, zoals Slack, Google Agenda of Box.
Hier is hoe het werkt, stap voor stap:
1. Het Probleem: Te veel theorie, te weinig praktijk
Vroeger testten we AI's in een "virtuele wereld" (een zandbak) waar alles perfect werkte. Dat is als een rijles op een leeg parkeerterrein. Maar in het echte leven zijn er gaten, verkeersborden die je niet kent, en andere auto's.
Anderen testten AI's in het echte leven, maar dat is gevaarlijk: wat als de AI per ongeluk alle e-mails van je baas verwijdert? Dat willen we niet.
De oplossing van Agent-Diff: Ze hebben een glazen kas gebouwd.
- Het is een veilige, afgesloten ruimte (een "sandbox").
- Maar binnenin die ruimte draait een exacte kopie van de echte software (Slack, Box, etc.).
- De AI denkt dat hij in het echte bedrijf werkt, maar hij kan niemand kwaad doen. Als hij een fout maakt, breekt hij alleen de kopie, niet het echte systeem.
2. De Nieuwe Manier van Beoordelen: "De Voor-en-Na-Foto"
Hoe weet je of de AI zijn werk goed heeft gedaan?
- De oude manier: Kijken naar de stappen die de AI nam. "Oh, hij klikte op 'Nieuw bestand', toen op 'Opslaan'. Hij deed het goed!"
- Probleem: De AI kon per ongeluk het verkeerde bestand opslaan, maar de stappen leken wel correct.
- De Agent-Diff manier (State-Diff): Ze kijken niet naar de stappen, maar naar het resultaat.
- Ze maken een foto van de digitale wereld voordat de AI begint.
- Ze maken een foto nadat de AI klaar is.
- Dan vergelijken ze de twee foto's.
- De vraag: Is het verschil tussen de foto's precies wat we wilden?
- Voorbeeld: Als de opdracht was "Maak een nieuwe map aan", dan moet de nieuwe map op de tweede foto staan. Als de AI per ongeluk ook een oude map heeft verwijderd (iets wat niet mocht), zien ze dat direct op de foto. De test slaagt dan niet, zelfs als de AI dacht dat hij het goed deed.
3. De Test: 224 Uitdagingen
Ze hebben de AI's 224 verschillende taken gegeven, variërend van:
- "Zoek alle bestanden over de economische crisis van 2001 en verplaats ze."
- "Maak een nieuwe kalender aan voor een meteorieten-wachtpartij en nodig mensen uit."
- "Verwijder een oude vergadering en maak een nieuwe aan."
Ze hebben 9 verschillende AI-modellen getest (zoals DeepSeek, Claude, Gemini, etc.) om te zien wie de beste "chauffeur" is.
4. De Belangrijkste Ontdekkingen
- De winnaars: De modellen DeepSeek-v3.2 en Devstral-2512 waren de beste. Ze konden complexe taken aan en maakten weinig fouten.
- De verliezers: Sommige modellen (zoals Llama-4-Scout) deden het erg slecht. Ze raakten vaak in de war, maakten hallucinaties (verzonnen feiten) of gaven op.
- De kracht van handleidingen:
- Als je de AI een handleiding geeft (de documentatie van de software), gaat het veel beter.
- Maar: Als je de AI te veel handleidingen geeft (bijvoorbeeld voor alle software tegelijk), raakt hij in de war. Het is alsof je iemand een boek geeft met 1000 pagina's, terwijl hij alleen pagina 5 nodig heeft.
- Interessant feit: De AI's hadden de handleiding het hardst nodig voor nieuwe functies die ze nog nooit eerder hadden gezien. Voor oude, bekende functies wisten ze het vaak al uit hun hoofd.
5. Hoe AI's omgaan met fouten
Wat gebeurt er als de AI een fout maakt?
- Slechte AI's: Ze proberen hetzelfde verkeerde ding steeds opnieuw (als een hamer die tegen een muur slaat en denkt: "Misschien werkt het de 100e keer wel").
- Goede AI's: Ze denken na. Ze kijken naar de foutmelding, zoeken de juiste informatie op, en proberen een nieuwe strategie. Ze breken een grote taak op in kleine stapjes.
Conclusie
Agent-Diff is een nieuwe, eerlijke manier om te testen of AI-assistenten echt bruikbaar zijn voor bedrijven. Het laat zien dat de beste AI's niet alleen slimme vragen kunnen stellen, maar ook plannen kunnen maken, fouten kunnen herkennen en niet panikeren als iets niet werkt.
Het is een grote stap voorwaarts om te voorkomen dat we in de toekomst AI-assistenten hebben die wel kunnen praten, maar niet kunnen werken.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.