← Nieuwste papers
💻 computer science

VAREX: A Benchmark for Multi-Modal Structured Extraction from Documents

Dit paper introduceert VAREX, een nieuw meermodaal benchmark voor gestructureerde extractie uit overheidsformulieren dat via een reverse-annotatiepijplijn is opgezet om systematisch de invloed van inputmodaliteiten en modelgrootte te evalueren, waarbij wordt geconstateerd dat schema-conformiteit en instructie-opvolging kritieke beperkingen zijn voor kleinere modellen die met fijnafstemming kunnen worden opgelost.

Oorspronkelijke auteurs: Udi Barzelay, Ophir Azulai, Inbar Shapira, Idan Friedman, Foad Abo Dahood, Madison Lee, Abraham Daniels

Gepubliceerd 2026-04-10
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Udi Barzelay, Ophir Azulai, Inbar Shapira, Idan Friedman, Foad Abo Dahood, Madison Lee, Abraham Daniels

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

📄 Wat is VAREX? De "Vergrootglas voor Documenten"

Stel je voor dat je een enorme stapel overheidsformulieren (zoals belastingaangiftes of aanvraagformulieren) hebt. Je wilt dat een computer deze leest en de belangrijke gegevens (zoals naam, adres, datum) eruit haalt en in een nette lijst zet.

Dit klinkt makkelijk, maar voor computers is het een nachtmerrie. Het papier is vol met lijntjes, vakjes en tekst op rare plekken.

VAREX is een nieuwe "test" (een benchmark) die is gemaakt door IBM Research om te kijken hoe goed verschillende AI-modellen dit klusje kunnen klaren. Het is als een groot examen voor computers, speciaal ontworpen voor het uitlezen van formulieren.

🎨 Hoe werkt de test? (De "Omgekeerde Annotatie")

Normaal gesproken maken mensen duizenden formulieren, vullen ze handmatig in en laten ze AI die lezen. Dat is traag en foutgevoelig.

De makers van VAREX hebben een slimme truc bedacht, die ze "Reverse Annotation" noemen. Denk hierbij aan een bakker die eerst het recept maakt en dan de taart bakt, in plaats van een taart te kopen en proberen het recept erachteraf uit te halen.

  1. Het Lege Formulier: Ze beginnen met een leeg, digitaal formulier.
  2. De Vuller: Een computer vult het formulier automatisch in met nep-data (bijv. "Naam: Jan Jansen", "Adres: Kerkstraat 1"). Omdat de computer dit zelf heeft ingevuld, weet hij exact wat er in elk vakje staat. Er is geen twijfel mogelijk.
  3. De Vertaler: Een slimme AI kijkt naar het formulier en zegt: "Ah, dit vakje is voor de naam, dit voor de datum."
  4. De Test: Nu krijgen ze de AI's die getest moeten worden het formulier te zien (als plaatje, als tekst, of beide) en vragen ze: "Haal de gegevens eruit." Omdat de makers precies weten wat er in de vakjes zat, kunnen ze perfect zien of de AI het goed heeft gedaan.

📸 Vier Manieren om te Kijken (De "Brillen")

Een van de coolste dingen aan VAREX is dat ze elk formulier op vier verschillende manieren aan de AI geven, alsof je verschillende brillen opzet:

  1. Gewone Tekst: Alsof je het formulier in een notitieblok hebt getypt, zonder lijntjes of witruimte. (Moeilijk voor de AI, want "Naam" en "Adres" staan dan misschien op één regel).
  2. Ruimtelijke Tekst: Alsof je de tekst in een raster hebt gezet met veel spaties, zodat de kolommen netjes onder elkaar staan. Dit helpt de AI om de structuur te zien zonder plaatjes.
  3. Het Plaatje: Een foto van het formulier. De AI moet hier de letters en lijntjes zelf zien.
  4. Beide: Het plaatje én de ruimtelijke tekst samen.

De verrassende ontdekking: De AI's doen het vaak het beste met ruimtelijke tekst (manier 2). Het blijkt dat het zien van de witruimte en kolommen belangrijker is dan het zien van de foto zelf! Alsof het lezen van een goed opgemaakt recept makkelijker is dan het raden van de ingrediënten op een vettig foto-afbeelding.

🤖 De AI's: Van "Baby" tot "Genie"

Ze hebben 20 verschillende AI-modellen getest, van kleine, goedkope modellen (die op een telefoon kunnen draaien) tot gigantische, dure super-AI's.

Hier zijn de belangrijkste lessen die ze leerden:

1. Het "Spiegel-Effect" (Schema Echo)

Bij de kleinste modellen (minder dan 4 miljard "hersencellen") is het grootste probleem niet dat ze de tekst niet kunnen lezen. Het probleem is dat ze niet luisteren.

  • De Analogie: Stel je vraagt aan een kind: "Schrijf de namen van de fruitsoorten op." Als het kind in plaats daarvan de vraag terugkaatst ("Schrijf de namen van de fruitsoorten op"), dan heeft het de opdracht niet begrepen.
  • Bij VAREX zien we dat kleine AI's vaak het format van de vraag teruggeven in plaats van de antwoorden. Ze zeggen: "Hier is het formulier" in plaats van "Hier is de naam". Dit kost ze enorm veel punten.

2. Oefening maakt Meester (Fine-tuning)

Een klein model van 2 miljard "hersencellen" dat speciaal was getraind om formulieren in te vullen, deed het veel beter dan een veel groter model dat dit niet kon.

  • De Les: Je hoeft geen gigantische, dure AI te hebben om formulieren in te vullen. Als je een klein model goed traint, kan het net zo goed werken als een groot model. Dit is geweldig nieuws voor bedrijven die geld willen besparen.

3. De "Kleine" vs. "Grote" Modellen

  • Grote AI's: Deze doen het geweldig, maar zijn duur en traag.
  • Kleine AI's: Deze zijn snel en goedkoop, maar ze vallen vaak in de valkuil van het "spiegel-effect" (zie punt 1). Zodra je ze echter leert om de juiste structuur te gebruiken, kunnen ze verrassend goed presteren.

📉 Waarom is dit belangrijk?

Vroeger dachten we dat we alleen maar grotere en duurdere AI's nodig hadden om taken als dit te doen. VAREX laat zien dat:

  1. Kleine modellen prima kunnen werken als we ze goed trainen.
  2. De manier waarop we informatie presenteren (tekst met spaties vs. plaatjes) een enorm verschil maakt.
  3. We nu een eerlijke manier hebben om te testen welke AI het beste is voor het werk, zonder dat we duizenden mensen nodig hebben om alles handmatig te controleren.

🏁 Conclusie in één zin

VAREX is een slimme test die laat zien dat je niet altijd de duurste, grootste AI nodig hebt om formulieren in te vullen; soms is een goed getraind, klein model, dat de juiste "bril" (ruimtelijke tekst) op heeft, precies wat je nodig hebt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →