← Nieuwste papers
🤖 AI

ExtractBench: A Benchmark for Schema-Guided Enterprise Document Extraction

Dit artikel introduceert ExtractBench, een uitgebreide benchmark voor het evalueren van schema-gestuurde extractie van bedrijfsdocumenten over 370 documenten en 67 typen, die onthult dat LlamaExtract Agentic Plus een state-of-the-art nauwkeurigheid en grounding bereikt tegen aanzienlijk lagere kosten vergeleken met coding agents.

Oorspronkelijke auteurs: Boyang Zhang, Adrian Lyjak, Eli Stewart, Zhaoqi Li, Simon Suo

Gepubliceerd 2026-08-03
📖 3 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Boyang Zhang, Adrian Lyjak, Eli Stewart, Zhaoqi Li, Simon Suo

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een detective bent die een mysterie probeert op te lossen, maar in plaats van een plaats delict, is je plaats delict een rommelige stapel papierwerk. Sommige papieren zijn strak en getypt, andere zijn gekreukelde bonnetjes met handgeschreven krabbels, en sommige zijn zo lang dat ze een hele boekenkast beslaan. In de wereld van kunstmatige intelligentie is er een speciaal soort robot, een "agent", die wordt geleerd om deze documenten te lezen. Zijn taak is om specifieke aanwijzingen te vinden—zoals een datum, een dollarbedrag of een naam—en deze in een nette, georganiseerde lijst te schrijven, een "schema" genoemd. Zie het schema als een strikt recept: de robot moet het precies volgens dit recept uitvoeren, ongeacht hoe rommelig de ingrediënten (de documenten) er ook uitzien.

Maar hier komt het lastige deel: alleen omdat de robot de juiste getallen opschrijft, betekent niet dat hij ze ook echt heeft gezien. Hij zou het geraden kunnen hebben, of hij zou een hele pagina aan aanwijzingen gemist kunnen hebben. Voor bedrijven is dit een groot ding. Als een robot duizenden verzekeringsclaims of bankafschriften moet lezen, moet hij niet alleen nauwkeurig zijn, maar moet hij ook in staat zijn om met zijn vinger naar de exacte plek op de pagina te wijzen waar hij het antwoord heeft gevonden. Als hij het fout doet, moet een mens het bewijs snel kunnen controleren. Dit is de uitdaging van "schema-guided extraction": een robot laten een recept perfect volgen, zelfs wanneer de ingrediënten rommelig, lang of geschreven in krijt zijn.

Maak kennis met ExtractBench, een nieuwe, superzware test ontworpen om te zien welke AI-robots echt klaar zijn voor de echte wereld. De onderzoekers achter deze studie wilden niet alleen weten of de robots konden lezen; ze wilden weten of ze alles correct konden lezen, hun werk konden laten zien en dit konden doen zonder een fortuin te kosten. Ze bouwden een enorme "examenzaal" met 370 verschillende soorten documenten—variërend van korte bonnetjes tot 50 pagina's tellende overheidsrapporten—verspreid over 8 verschillende sectoren zoals financiën, energie en gezondheidszorg. Ze voegden zelfs documenten toe die gescand waren, handgeschreven waren, of vreemde tabellen bevatten die zich over meerdere pagina's uitstrekten.

De grote verrassing? De "slimste" ogende robots wonnen niet altijd. De studie toonde aan dat hoewel sommige krachtige AI-modellen goed zijn in het lezen van korte, schone documenten, ze vaak moe worden en halverwege lange documenten stoppen met lezen, waardoor ze enorme hoeveelheden gegevens missen. Aan de andere kant zijn sommige robots die hun eigen code schrijven om het probleem op te lossen erg nauwkeurig, maar ze kosten veel geld om te draaien. De onderzoekers ontdekten een "sweet spot" met een systeem genaamd LlamaExtract Agentic Plus. Het slaagde erin bijna net zo vaak de juiste antwoorden te geven als de dure code-schrijvende robots, maar deed dit voor een fractie van de prijs.

De studie onthulde echter ook een grote blinde vlek. Zelfs de beste robots worstelen met "grounding"—het vermogen om naar het exacte woord op de pagina te wijzen dat hen het antwoord gaf. Hoewel sommige systemen konden vertellen op welke pagina het antwoord stond, kon minder dan de helft naar het exacte woord wijzen. Het artikel suggereert dat hoewel we beter worden in het verkrijgen van de juiste getallen, het leren van robots om betrouwbaar hun huiswerk te laten zien nog steeds een werk in uitvoering is. Kortom, ExtractBench bewijst dat je voor zakelijk werk niet alleen een slimme robot nodig hebt; je hebt een robot nodig die grondig is, eerlijk is over waar hij zijn aanwijzingen heeft gevonden, en die niet het hele budget overschrijdt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →