How Far Is Document Parsing from Solved? PureDocBench: A Source-TraceableBenchmark across Clean, Degraded, and Real-World Settings
Dit artikel introduceert PureDocBench, een brontraceerbare benchmark die schone, gedegradeerde en real-world documentafbeeldingen omvat en die aanzienlijke gebreken blootlegt in de verzadigde OmniDocBench-ranglijsten, en die aantoont dat documentparsing een onopgeloste uitdaging blijft met aanzienlijke prestatiekloven tussen modellen en aanhoudende knelpunten in formuleherkenning.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je probeert te beoordelen wie de beste kok ter wereld is. Het afgelopen jaar hebben allemaal in één, piepkleine keuken gegaard die OmniDocBench heet. Deze keuken heeft slechts 1.355 gerechten, en de jury (het scoresysteem) is zo gul geweest dat bijna elke topkok een 90% of hoger krijgt. Het is als een race waarbij iedereen op exact hetzelfde moment de finishlijn passeert; je kunt niet zeggen wie echt sneller of beter is.
Bovendien hebben de juryleden fouten gemaakt. Ze hebben ingrediënten verkeerd geteld, stappen overgeslagen en zelfs smaken verzonnen die er niet waren. Omdat het "recept" (de ground truth) gebrekkig was, zijn de ranglijten onbetrouwbaar. Bovendien, aangezien iedereen al een jaar in dezelfde keuken heeft gekookt, hebben de koks de gerechten misschien uit het hoofd geleerd in plaats van te leren koken.
Dan is er PureDocBench, de nieuwe, enorme en perfect georganiseerde keuken die in dit artikel wordt geïntroduceerd.
De nieuwe keuken: PureDocBench
In plaats van oude, rommelige recepten te gebruiken, hebben de makers van PureDocBench hun keuken vanaf de grond opgebouwd met digitale blauwdrukken (HTML/CSS).
- De Blauwdruk: Ze schreven eerst de code voor het document.
- Het Gereed: Ze gebruikten die code om de afbeelding van het document te genereren.
- Het Antwoordenboek: Omdat ze eerst de code schreven, weten ze exact hoe de tekst, tabellen en formules eruit moeten zien. Er is geen gissen bij.
Deze keuken is enorm. Het heeft 10 verschillende soorten restaurants (Academisch, Juridisch, Medisch, Financiën, enz.) en 66 specifieke menu-items (zoals facturen, diploma's of laboratoriumrapporten).
De drie versies van elk gerecht
Om te testen hoe tough de koks echt zijn, serveert de keuken elk gerecht in drie verschillende omstandigheden:
- Schoon: Een perfect, vers bord direct uit de oven.
- Digitaal gedegradeerd: Het bord is gescand door een slechte scanner, of de foto is gecomprimeerd, waardoor het wazig of vergeeld lijkt (zoals een oude fax).
- Realistisch gedegradeerd: Het bord is afgedrukt, waarna iemand er een foto van maakte met een trillende hand bij zwak licht, of misschien was het een kopie van een kopie.
Dit is cruciaal omdat een kok misschien geweldig is in het presenteren van een perfect gerecht, maar vreselijk in het serveren van een rommelig exemplaar.
De resultaten: Wie heeft er eigenlijk gewonnen?
De onderzoekers testten 40 verschillende koks (AI-modellen) in deze nieuwe keuken. Dit is wat ze vonden:
1. De race is verre van voorbij
In de oude keuken scoorden de beste koks meer dan 90%. In PureDocBench scoorde de absolute beste kok slechts 74 van de 100. Er is een enorm gat (44 punten) tussen de beste en de slechtste. Dit betekent dat documentparsing nog niet opgelost is; er is nog veel ruimte voor verbetering.
2. Kleine specialisten versus gigantische generalisten
Er zijn twee soorten koks:
- Specialisten: Koks die alleen weten hoe ze documenten moeten koken. Ze zijn klein en efficiënt.
- Generalisten: Gigantische, multi-talente koks die van alles kunnen koken, maar niet gespecialiseerd zijn in documenten.
Het artikel vond dat de kleine specialisten (sommige met minder dan 4 miljard "hersencellen") net zo goed zijn als, of zelfs beter dan, de gigantische generalisten (die wel 100 keer groter kunnen zijn). Het is alsof een kleine, gespecialiseerde sushi-kok een enorme, "eat-all-you-can" buffet-kok verslaat in het maken van sushi.
3. De formule-flesnek
Ongeacht hoe slim de kok is, wiskundige formules zijn het moeilijkste onderdeel. Zelfs de beste modellen krijgen ongeveer 67% van de formules goed. Het is een universeel zwak punt.
4. De verrassing van het "rommelige bord"
Dit is de meest interessante bevinding.
- De specialist-koks vielen uiteen toen de borden rommelig werden (Realistisch Gedegradeerd). Hun scores daalden aanzienlijk.
- De generalist-koks waren verrassend taai. Ze hanteerden de rommelige, wazige, realistische foto's veel beter.
Dit betekent dat als je koks alleen test op perfecte, schone borden, je een verkeerd idee krijgt van wie er in de echte wereld zal slagen. De ranglijten draaien om als je realistische ruis toevoegt!
De conclusie
Het artikel stelt dat we moeten stoppen met het gebruik van de oude, gebrekkige keuken (OmniDocBench) om AI te beoordelen. We moeten PureDocBench gebruiken, dat:
- Een perfect, traceerbaar antwoordenboek heeft (geen meer juryfouten).
- Koks test op rommelige, realistische omstandigheden, niet alleen op perfecte.
- Aantoont dat hoewel AI beter wordt, het nog een lange weg te gaan heeft, vooral met wiskundige formules en het hanteren van realistische rommeligheid.
De onderzoekers hebben de deuren geopend naar deze nieuwe keuken, waardoor iedereen de blauwdrukken, de gerechten en de antwoordenboeken krijgt zodat de gemeenschap samen betere koks kan bouwen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.