← Nieuwste papers
💬 NLP

PulseBench-Tab: A Multilingual Benchmark for Table Extraction with Graph-Based Evaluation

Dit artikel introduceert PulseBench-Tab, een meertalige benchmark bestaande uit 1.820 door mensen geannoteerde tabellen over negen talen en vier schriften, samen met een nieuwe grafiekgebaseerde evaluatiemetriek genaamd T-LAG, om de prestaties van diverse tabelextractiesystemen op complexe, real-world documentafbeeldingen te beoordelen.

Oorspronkelijke auteurs: Ritvik Pandey, Sid Manchkanti, Mohammed Wazir Adain, Mohammed Hadi, Dushyanth Sekhar

Gepubliceerd 2026-06-09
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Ritvik Pandey, Sid Manchkanti, Mohammed Wazir Adain, Mohammed Hadi, Dushyanth Sekhar

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een enorme bibliotheek hebt met documenten—financiële rapporten, overheidsformulieren en bedrijfsverslagen—gedrukt in negen verschillende talen. In deze documenten zitten duizenden tabellen, zoals spreadsheets, gevuld met cijfers en tekst. Het doel van dit artikel is om te zien hoe goed computers tabellen kunnen "lezen", ze perfect kunnen kopiëren en begrijpen waar elk afzonderlijk stukje informatie thuishoort.

Hier is de uitsplitsing van PulseBench-Tab en T-LAG, eenvoudig uitgelegd.

1. Het Probleem: Waarom Tabellen Lastig Zijn

Het lezen van een tabel gaat niet alleen over het herkennen van letters (zoals het lezen van een boek). Het gaat over het begrijpen van geometrie.

  • De Analogie: Stel je een tabel voor als een puzzel. Als je een stukje pakt met het getal "100" en het op de verkeerde plek legt, is het plaatje verpest. In een computersysteem is als een getal in de verkeerde cel terechtkomt niet zoma van een typefout; het is een ramp die alle latere berekeningen verpest.
  • De Kloof: Eerdere tests keken vooral naar Engelse tabellen of behandelden tabellen als lange lijsten met woorden (het "platmaken" ervan), waardoor de 2D-structuur (rijen en kolommen) verloren ging. Ze testten ook onvoldoende talen die van rechts naar links worden geschreven (zoals Arabisch) of complexe karakters gebruiken (zoals Chinees of Japans).

2. De Oplossing: Een Nieuwe "Tabel-Gym" (De Dataset)

De auteurs hebben een enorme trainingsgrond gebouwd genaamd PulseBench-Tab.

  • De Omvang: Het bevat 1.820 echte tabellen.
  • De Variatie: Deze tabellen komen uit 380 verschillende documenten in 9 talen (Engels, Chinees, Arabisch, Russisch, etc.) en gebruiken 4 verschillende schriftsystemen.
  • De Moeilijkheidsgraad: Sommige tabellen zijn minuscuul (slechts 2 cellen), terwijl anderen monsters zijn met meer dan 1.000 cellen. Ongeveer de helft heeft "samengevoegde" cellen (waar één grote cel de ruimte van twee of drie kleinere cellen beslaat), wat lijkt op een puzzelstukje dat meerdere plekken op het bord bedekt.
  • De Gouden Standaard: Elke tabel werd gecontroleerd door menselijke experts die de specifieke taal spreken om ervoor te zorgen dat de "antwoordsleutel" 100% correct was.

3. De Nieuwe Liniaal: T-LAG (De Grafiekmetriek)

Om de computers te beoordelen, hebben de auteurs een nieuw scoresysteem uitgevonden genaamd T-LAG.

  • De Oude Manier: Eerdere methoden controleerden vaak of de computer de juiste woorden kreeg, maar ze gaven niet genoeg om naar de vraag te kijken of die woorden de juiste buren hadden. Het was alsoals een student beoordelen op een spellingtest, maar negeren of ze de woorden in de juiste zinnen zetten.
  • De Nieuwe Manier (T-LAG): Stel je de tabel voor als een kaart van steden die verbonden zijn door wegen.
    • Nodes (Steden): De individuele cellen.
    • Edges (Wegen): De verbindingen tussen cellen (bijv. "Cel A staat rechts van Cel B" of "Cel C staat onder Cel D").
  • Hoe het Scoort: T-LAG kijkt naar de "wegen". Het vraagt: "Heeft de computer dezelfde kaart van wegen gebouwd als de echte?"
    • Als de computer de tekst goed krijgt maar in de verkeerde kolom zet, is de "weg" gebroken en daalt de score.
    • Het gebruikt een speciale wiskundige truc (het Hongaarse Algoritme) om de best mogelijke match te vinden tussen de echte tabel en de door de computer gemaakte tabel, zodat er niet willekeurig wordt gegokt.
    • De "Strengeheid"-draaiknop: De auteurs stelden de scoring zeer streng in (een "k=7" instelling). In de echte wereld, als een financieel rapport "$1 miljoen" zegt in plaats van "$10 miljoen", is dat een fout, geen "bijna goed" poging. Deze metriek behandelt kleine fouten als grote fouten om de behoeften van de echte wereld te weerspiegelen.

4. De Race: Wie Won?

De auteurs testten 9 verschillende computersystemen (inclusclusief grote tech-API's, open-source tools en hun eigen systeem) op deze dataset.

  • De Winnaar: Pulse Ultra 2 (het eigen systeem van de auteurs) kwam op de eerste plaats met een score van 93,5%. Het was het enige systeem dat op meer dan de helft van de tabellen een "perfect" score haalde.
  • De Runner-up: Gemini 3.1 kwam op de tweede plaats met 81,6%.
  • De Kloof: Er was een enorme daling na de top twee. Het onderste derde deel van de systemen scoorde onder de 72%, wat betekent dat ze aanzienlijk moeite hadden.
  • De Grootste Uitdaging: Niet-Latijnse schriften (zoals Arabisch, Koreaans en Chinees) waren het moeilijkst voor iedereen.
    • Analogie: Denk aan een hardloper die geweldig is op een vlak, geasfalteerd pad (Engels) maar over elke steen struikelt op een bergpad (Arabisch/Koreaans). Zelfs de beste systemen zagen hun scores aanzienlijk dalen wanneer de taal veranderde.
  • De "Stille Fouten": Sommige systemen gaven niet alleen slechte antwoorden, maar gaven voor ongeveer 20% van de tabellen helemaal geen antwoord. In een echt bedrijf is dit als een robot die simpelweg stopt met werken wanneer hij een moeilijk document ziet.

5. De Conclusie

De paper concludeert dat hoewel computers beter worden in het lezen van tabellen, er nog steeds een enorme kloof is tussen de beste systemen en de rest van het veld, vooral bij het werken met complexe lay-outs of talen die niet Engels zijn.

Ze hebben de dataset, de scoring-code en de resultaten publiekelijk beschikbaar gesteld. Dit is alsof ze de deuren van de sportschool openzetten voor iedereen, zodat onderzoekers precies kunnen zien waar de machines falen en proberen dit te repareren, in plaats van te gissen.

Kortom: Ze hebben een uitdagend, meertalig hindernisparcours gebouwd voor AI die tabellen leest, een nieuwe liniaal uitgevonden om te meten hoe goed de AI het parcours navigeert, en ontdekt dat hoewel één systeem momenteel de leiding neemt, de meeste anderen nog steeds moeite hebben om hun evenwicht te bewaren op complex, niet-Engels terrein.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →