TABVERSE: Benchmarking Cross-Format Table Understanding in LLMs and VLMs
Het artikel introduceert TABVERSE, een gecontroleerde multimodale benchmark die de impact van tabelrepresentatieformaten (zoals HTML, Markdown, LaTeX en afbeeldingen) op modelprestaties isoleert, waarbij wordt onthuld dat gestructureerde tekst over het algemeen beter presteert dan afbeeldingen, maar dat de keuze van de representatie de resultaten aanzienlijk beïnvloedt over verschillende taken en modellen heen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een zeer belangrijke spreadsheet hebt met gegevens over het weer, verkopen of sportuitslagen. Stel je nu voor dat je deze zelfde spreadsheet op vier verschillende manieren aan een computer kunt laten zien:
- Als een afbeelding (zoals een screenshot die je met je telefoon maakt).
- Als HTML-code (de taal die websites gebruiken om tabellen te bouwen).
- Als LaTeX-code (een taal die wetenschappers gebruiken om complexe documenten te typen).
- Als Markdown (een eenvoudig tekstformaat dat wordt gebruikt in chat-apps en notities).
Het papier "TABVERSE" stelt een eenvoudige maar lastige vraag: Maakt het uit hoe we deze tabel aan de AI laten zien?
De meeste eerdere tests gaven de AI verschillende tabellen en verschillende formaten tegelijkertijd. Het was alsof je vroeg: "Kun je deze wiskundige som oplossen?" maar de som soms op een stuk papier gaf, soms op een whiteboard, en soms fluisterde. Je zou dan niet weten of de AI faalde omdat de wiskunde moeilijk was of omdat het whiteboard rommelig was.
TABVERSE lost dit op door één enkele tabel aan de AI te laten zien in alle vier de formaten tegelijkertijd. Hierdoor kunnen de onderzoekers precies zien welk formaat de AI helpt om beter na te denken en welk formaat de AI in verwarring brengt.
Dit is wat ze vonden, uitgelegd met enkele alledaagse analogieën:
1. De "Lezen versus Kijken"-test (Beantwoorden van vragen)
De onderzoekers stelden de AI vragen zoals: "Wie verkocht het meest?" of "Wat is de gemiddelde prijs?"
- De bevinding: Over het algemeen is de AI beter in het lezen van de tekstcode (zoals HTML of Markdown) dan in het kijken naar de afbeelding.
- De analogie: Stel je voor dat je een specifieke naam probeert te vinden in een telefoonboek.
- Tekstformaat: Het is alsof je het eigenlijke telefoonboek voor je hebt open liggen. Je kunt de letters scannen en de naam gemakkelijk vinden.
- Afbeeldingsformaat: Het is alsof je naar een wazige foto van die telefoonboekpagina kijkt. Je kunt de woorden nog wel zien, maar je ogen moeten harder werken om te focussen, en je mist misschien een letter.
- De winnaar: HTML was het meest betrouwbare "telefoonboek"-formaat. De AI raakte er zelden door in verwarring gebracht. LaTeX was wat lastiger, als een telefoonboek geschreven in een heel chic, strikt lettertype dat de lezer soms in de war brengt.
2. De "Kaartlezen"-test (Structureel begrip)
Vervolgens lieten ze de AI optreden als een cartograaf. Ze stelden vragen zoals: "Hoeveel rijen zijn er?" of "Wat staat er in de 3e rij en de 2e kolom?"
- De bevinding: De AI is verrassend slecht in het tellen van rijen en het vinden van specifieke locaties, zelfs als hij de tekst perfect kan lezen.
- De analogie: Denk aan de AI als een toerist met een kaart.
- Kolommen: De AI is goed in het tellen van de "straten" die van noord naar zuid lopen (kolommen). Het is makkelijk om de verticale lijnen te zien.
- Rijen: De AI raakt verdwaald bij het tellen van de "lanen" die van oost naar west lopen (rijen). Hij vergeet vaak dat de "Titel" bovenaan geen straat is, of raakt in de war over waar de eerste straat begint.
- De twist: Wanneer de onderzoekers de AI een tekstlijst van de rijen gaven in plaats van een afbeelding, werd hij er veel beter in. Maar zelfs dan had hij nog steeds meer moeite met het "rij"-concept dan met het "kolom"-concept.
3. De "Naboots"-test (Reconstructie)
Ten slotte lieten ze de AI een afbeelding van een tabel zien en vroegen de AI om de tabel te reconstrueren in code (HTML, LaTeX of Markdown).
- De bevinding: De AI is goed in het kopiëren van de vorm van de tabel (de vakken en lijnen), maar slecht in het perfect kopiëren van de inhoud, vooral in LaTeX.
- De analogie: Stel je voor dat je een kind vraagt om een tekening van een huis na te tekenen.
- Topologie (Vorm): Het kind tekent een vierkant voor het huis en een driehoek voor het dak. Ze kregen de vorm goed! (Dit is wat het papier "topologie" noemt).
- Inhoud (Details): Maar het kind schrijft "GARAGE" verkeerd of tekent de deur op de verkeerde plek.
- Het LaTeX-probleem: De AI vragen om de tabel in LaTeX te reconstrueren is als een kind vragen om het huis te tekenen met behulp van een zeer strikte, ingewikkelde set regels. Als het kind één kleine fout maakt in de regels, valt de hele tekening uit elkaar en werkt het niet meer. Het papier vond dat veel AI-modellen "kapotte" LaTeX-code produceerden die computers niet konden lezen, zelfs als de tekening er goed uitzag.
De Belangrijkste Conclusie
Het papier concludeert dat hoe je data aan een AI voert, net zo belangrijk is als de data zelf.
- Ga er niet vanuit: Je kunt er niet vanuit gaan dat een AI een tabel begrijpt, alleen omdat hij het juiste antwoord gaf op een afbeelding.
- Formaat doet ertoe: Als je wilt dat een AI complexe berekeningen uitvoert of specifieke rijen vindt, is het geven van een schoon tekstbestand (zoals HTML) meestal beter dan het tonen van een screenshot.
- De "Rij"-blinde vlek: Zelfs de slimste AI-modellen hebben nog steeds moeite om bij te houden welke rij welke is, en raken vaak in de war door koppen of tellen de lijnen verkeerd.
Kortom, TABVERSE is als een nieuwe rijexamen voor AI. In plaats van alleen te kijken of de auto kan rijden, test het of de auto beter rijdt op een gladde snelweg (HTML), een hobbelige onverharde weg (LaTeX), of terwijl hij naar een kaart kijkt in plaats van naar de weg (Afbeeldingen). De resultaten laten zien dat de "weg" waarop de AI rijdt, bepaalt hoe goed hij presteert.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.