← Nieuwste papers
💻 computer science

GDP.pdf: Benchmarking Grounded Multimodal Reasoning over Professional PDF Documents

Het artikel introduceert GDP.pdf, een nieuwe benchmark bestaande uit 100 door professionals geschreven vraag-documentparen over tien vakgebieden die significante beperkingen in huidige grensverleggende multimodale modellen onthult, waarbij het best presterende model slechts een slagingspercentage van 15% bereikte als gevolg van terugkerende fouten in de interpretatie van tabellen/grafieken, kruisverwijzingen en het afhandelen van documentwijzigingen.

Oorspronkelijke auteurs: Suhaas Garre, Emily Ritchie, Sushant Mehta, Edwin Chen

Gepubliceerd 2026-07-14
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Suhaas Garre, Emily Ritchie, Sushant Mehta, Edwin Chen

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een spannend spel van "Zoek de Aanwijzing" speelt in een enorme, rommelige bibliotheek. Maar in plaats van boeken is de bibliotheek gevuld met PDF's: verzekeringspolissen, bouwtekeningen, medische richtlijnen en personeelshandboeken. Je hebt een team van superintelligente robotdetectives (de AI-modellen) klaar om de mysteries op te lossen. Je zou denken: "Met al hun kracht zullen ze dit wel even oplossen!"

Maar hier komt de twist: toen de onderzoekers van Surge AI de robots aan de test legden, waren de resultaten een totale schok.

De Grote Onthulling: De Robots raken de Draad Kwijt
Het paper introduceert een nieuwe uitdaging genaamd GDP.pdf. Zie dit als een "eindbaas"-niveau voor AI, speciaal ontworpen om te zien of robots daadwerkelijk het saaie, ingewikkelde papierwerk kunnen doen dat echte mensen dagelijks doen. De onderzoekers verzamelden 100 echte documenten uit 10 verschillende beroepen (zoals financiën, de gezondheidszorg en de bouw) en stelden de robots vragen die een echt mens zou stellen.

Het resultaat? Zelfs de slimste robotdetectives ter wereld faalden jammerlijk. Het allerbeste model behaalde slechts 15% van de vragen goed. De slechtste? Die slaagde slechts voor 1% van de vragen. Dat betekent dat als je de beste robot zou vragen om een verzekeringspolis van 10 pagina's te lezen en een specifieke regel te vinden, de robot het antwoord 85 van de 100 keer fout zou hebben.

Waarom faalden ze? (De "Valstrikken")
Het paper betoogt dat eerdere tests leken op het geven van een schoon, makkelijk leesbaar tekstboek aan de robots. Maar echte PDF's zijn rommelig. Ze zitten vol met vallen waar de robots niet mee om konden gaan. Dit zijn de specifieke manieren waarop ze de mist in gingen:

  • De "Voetnoot"-valstrik: Stel je voor dat een regel in de hoofdtekst staat, maar dat er drie pagina's later een piepkleine voetnoot staat waarin staat: "Negeer die regel voor dit specifieke geval." De robots lazen de hoofdtekst, gaven een zelfverzekerd antwoord en misten de voetnoot volledig. Het is alsof je een kaart leest, een weg ziet, en de kleine tekst negeert die zegt: "Weg afgesloten."
  • De "Amendement"-verwarring: Soms heeft een document een nieuwe pagina bijgevoegd die een oude regel verandert. De robots zouden de oude regel citeren alsof deze nog steeds waar was, terwijl de nieuwe pagina deze officieel had gewist.
  • De "Tabel"-tangle: Wanneer cijfers in een raster staan met samengevoegde cellen of lijnen die over pagina's heen lopen, raakten de robots in de war. Ze keken naar de juiste rij maar de verkeerde kolom, of haalden de koppen door elkaar. Het is alsof je een menukaart probeert te lezen waarbij de prijzen in de lucht zweven in plaats van naast het eten te staan.
  • Het "Ik weet het beter"-probleem: Dit is de grappigste (en gevaarlijkste) fout. Als de trainingsdata van een robot vertelde dat "boren op deze manier werken", maar de specifieheid PDF zei "Gebruik deze boren NIET voor dit metaal", dan negeerde de robot de PDF en gaf hij het antwoord dat hij "wist" uit zijn training. Hij vertrouwde zijn geheugen meer dan het eigenlijke document voor zijn neus.

Wat het Paper Zegt dat We Nog Niet Kunnen
De auteurs zijn zeer duidelijk over wat dit betekent. Ze sluiten expliciet de mogelijkheid uit dat deze modellen klaar zijn om zelfstandig aan professionele documenten te werken. Alleen omdat een robot hoog scoort op een standaard, academische test (zoals het identificeren van een kat op een foto of het beantwoorden van een simpele wiskundevraag), betekent niet dat hij een echt huurcontract kan afhandelen.

Het paper suggereert dat het simpelweg groter maken van het "geheugen" (context windows) van de robots de problemen niet zal oplossen. Het probleem is niet dat ze niet het hele document kunnen zien; het probleem is dat ze de rommelige structuur, de kleine voetnoten en de visuele aanwijzingen zoals grafieken en plattegronden niet kunnen begrijpen.

Hoe Zeker Zijn We?
De onderzoekers hebben niet alleen gegokt; ze hebben het gemeten. Ze hebben een strikt scoresysteem gebouwd waarbij een robot elk deel van het antwoord correct moet hebben om te slagen. Ze hebben zeven van de meest geavanceerde modellen getest die beschikbaar waren tot april 2026. De resultaten waren consistent: de robots zijn momenteel niet betrouwbaar genoeg om zonder toezicht aan deze documenten te werken.

De Kernboodschap
Beschouw GDP.pdf als een realiteitscheck. Het is een benchmark die zegt: "Hé, voordat we AI het werk laten doen met onze juridische contracten of medische dossiers, moeten we het leren hoe het is om de kleine lettertjes te lezen, en niet alleen de grote koppen." Totdat de robots kunnen stoppen met het negeren van die kleine voetnoten en stoppen met gokken wanneer het document iets anders zegt, zijn ze niet klaar voor het grote werk van professioneel papierwerk. De kloof tussen wat deze modellen kunnen in een klaslokaal en wat ze kunnen in de echte wereld, is nog steeds enorm.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →