← Nieuwste papers
🤖 AI

MDPBench: A Benchmark for Multilingual Document Parsing in Real-World Scenarios

Dit paper introduceert MDPBench, het eerste meerlinguale benchmark voor het parseren van digitale en gefotografeerde documenten, dat onthult dat open-source modellen aanzienlijk minder goed presteren dan gesloten modellen, vooral bij niet-Latijnse scripts en realistische foto's.

Oorspronkelijke auteurs: Zhang Li, Zhibo Lin, Qiang Liu, Ziyang Zhang, Shuo Zhang, Zidun Guo, Jiajun Song, Jiarui Zhang, Xiang Bai, Yuliang Liu

Gepubliceerd 2026-03-31
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Zhang Li, Zhibo Lin, Qiang Liu, Ziyang Zhang, Shuo Zhang, Zidun Guo, Jiajun Song, Jiarui Zhang, Xiang Bai, Yuliang Liu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een enorme bibliotheek hebt met boeken in 17 verschillende talen. Sommige boeken zijn netjes gedrukt op een computer (digitaal), maar de meeste zijn gefotografeerd met een telefoon: ze liggen misschien scheef, hebben een vouw, staan in de zon of op een rommelige tafel.

Het probleem? De slimste computers (AI) die we nu hebben, zijn als supersterke bibliothecarissen die alleen kunnen lezen als de boeken perfect plat liggen en in het Engels of Chinees staan. Als je ze een scheef gefotografeerd boek in het Hindi of Arabisch geeft, raken ze in paniek, lezen ze de verkeerde pagina's, of verzinnen ze zelfs tekst die er niet staat.

Dit paper introduceert MDPBench, een nieuwe "test" om te zien hoe goed deze computers echt zijn. Hier is de uitleg in simpele taal:

1. Wat is MDPBench? (De nieuwe examenopgave)

Vroeger testten we computers alleen met schone, digitale bestanden. Dat is alsof je een zwemmer alleen test in een zwembad met rustig water. Maar in het echte leven zwemmen mensen in de zee, met golven en stroming.

MDPBench is die zee. Het is een verzameling van 3.400 documenten in 17 talen.

  • De talen: Van alledaags Engels en Nederlands tot lastigere talen als Hindi, Arabisch en Thai.
  • De omstandigheden: Sommige documenten zijn digitaal, maar veel zijn "echt": gefotografeerd met een telefoon, soms met een vlekje, een vouw, of tegen een donkere achtergrond.
  • Het doel: Kijken of de computer nog steeds kan lezen als het niet perfect is.

2. Hoe hebben ze dit gemaakt? (De super-nauwkeurige controleurs)

Om te weten of een computer het goed doet, moet je het antwoord al weten. Maar hoe maak je het juiste antwoord voor een scheef gefotografeerd document in het Russisch?

Ze hebben een drie-stappen proces gebruikt, als een super-veiligheidscontrole:

  1. De Robots: Drie verschillende slimme AI-modellen proberen het document te lezen.
  2. De Mensen: Als de robots het niet eens zijn, komen menselijke experts kijken. Ze corrigeren fouten en controleren of de leesvolgorde klopt (bijvoorbeeld: in Arabisch lees je van rechts naar links, wat voor computers vaak verwarrend is).
  3. De Keurmeesters: Een onafhankelijke groep kijkt nog eens kritisch na of alles perfect is.

Pas als het antwoord door iedereen is goedgekeurd, wordt het een "juiste antwoord" voor de test.

3. Wat zijn de resultaten? (De harde waarheid)

De test heeft een paar verrassende dingen aan het licht gebracht:

  • De "Geheime" Superhelden vs. De Openbare Helden: De duurste, gesloten modellen (zoals Gemini-3-Pro van Google) doen het nog steeds het beste. Ze zijn als ervaren duikers die ook in stormachtig water kunnen zwemmen. De gratis, open-source modellen (die iedereen kan gebruiken) doen het veel slechter. Ze zakken vaak in als het document gefotografeerd is of als het een moeilijke taal is.
  • De "Foto-Val": Als je een document fotografeert in plaats van het digitaal te hebben, zakt de prestatie van de computers gemiddeld met 17,8%. Alsof je een student een examen geeft, maar dan met een wazige kopie in plaats van het origineel.
  • De Taal-Val: Computers zijn geweldig in talen met het Latijnse alfabet (A, B, C...). Maar zodra je naar talen gaat met andere tekens (zoals Arabisch, Hindi of Russisch), zakken de scores drastisch. Soms zelfs tot onder de 10%. Het is alsof ze de letters wel zien, maar niet weten hoe ze die moeten samenvoegen tot woorden.
  • De "Hallucinaties": Soms verzinnen de computers tekst. Ze lezen een zin in het Vietnamees en denken: "Oh, dit is Chinees!" en beginnen dan Chinees te typen. Of ze herhalen dezelfde zin eindeloos.

4. Waarom is dit belangrijk? (De boodschap)

Tot nu toe dachten we dat computers documenten goed konden lezen. Deze test laat zien dat we nog een lange weg te gaan hebben voordat we op AI kunnen vertrouwen voor alledaagse taken in de hele wereld.

Als we AI willen gebruiken om historische documenten te bewaren, rekeningen te verwerken of boeken uit het verleden te digitaliseren, moeten we eerst deze "zwemles in de zee" doorstaan. MDPBench is de kaart die ons laat zien waar de rotsen liggen, zodat we in de toekomst betere, robuustere computers kunnen bouwen die voor iedereen werken, ongeacht de taal of de kwaliteit van de foto.

Kortom: We hebben een nieuwe, echte test gemaakt om te zien of onze slimme computers echt slim zijn, of dat ze alleen maar goed zijn in de klaslokaal-situatie. En tot nu toe: ze zijn nog niet klaar voor de echte wereld.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →