← Nieuwste papers
💻 computer science

KoViDoRe: Korean Visual Document Retrieval

Dit artikel introduceert KoViDoRe, een uitgebreide benchmark en bijbehorende trainingsdataset die is ontworpen om het gebrek aan middelen voor Koreaanse visuele documentextractie aan te pakken door multimodale modellen te evalueren en te verbeteren op complexe, meerpagina's tellende documenten met diverse lay-outs.

Oorspronkelijke auteurs: Yongbin Choi, Yongwoo Song, Mujeen Sung

Gepubliceerd 2026-08-24
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yongbin Choi, Yongwoo Song, Mujeen Sung

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

In de moderne wereld leeft een enorme hoeveelheid belangrijke informatie binnen digitale documenten. Dit zijn geen eenvoudige tekstbestanden, maar complexe pagina's gevuld met grafieken, tabellen, diagrammen en lay-outs met meerdere kolommen, die vaak te vinden zijn in financiële rapporten, overheidsbeleid of technische handleidingen. Decennialang hadden computers moeite om deze pagina's te lezen, waarbij ze ze meestal behandelden als een enkel tekstblok of er niet in slaagden te begrijpen hoe een grafiek op de ene pagina zich verhoudt tot een paragraaf op een andere. Onlangs is er een nieuwe generatie kunstmatige intelligentie opgekomen die documenten kan bekijken zoals een mens dat doet, door zowel de woorden als de visuele vormen van de gegevens te zien. Deze capaciteit, bekend als visuele documentretrieval, stelt machines in staat om specifieke antwoorden te vinden die verborgen liggen in deze rijke, gestructureerde pagina's. De meeste tools en tests die worden gebruikt om deze systemen te bouwen, zijn echter ontworpen voor het Engels, waardoor er een aanzienlijke kloof is ontstaan in het begrip van hoe ze presteren met andere talen die andere schrijfstijlen en documentstructuren hebben.

Een team onderzoekers aan de Kyung Hee Universiteit in Zuid-Korea heeft deze kloof nu aangepakt door een nieuwe test te creëren die specifiek gericht is op Koreaanse documenten. Ze realiseerden zich dat hoewel bestaande tests een computer konden vragen om een enkele pagina te vinden die een antwoord bevat, vragen in de echte wereld vaak vereisen dat aanwijzingen worden verzameld die verspreid zijn over meerdere pagina's. Stel je voor dat je een vraag stelt over de financiële gezondheid van een bedrijf; het antwoord kan vereisen dat je kijkt naar een tabel op pagina vijf, een grafiek op pagina twaalf en een samenvatting op pagina twintig. De onderzoekers bouwden een benchmark genaamd KoViDoRe om te zien of huidige computermodellen dit soort meerpagina-detectiewerk aankonden. Ze verzamelden honderden echte Koreaanse documenten uit publieke bronnen, zoals overheidsrapporten en bedrijfsdocumenten, die complexe lay-outs met tabellen en figuren bevatten. Met behulp van geavanceerde taalmodellen genereerden ze duizenden vragen die de computer dwongen om informatie uit verschillende delen van een enkel document samen te voegen om een volledig antwoord te vormen.

Toen de onderzoekers een breed scala aan bestaande kunstmatige intelligentiemodellen testten op deze nieuwe benchmark, waren de resultaten onthullend. De computers hadden aanzienlijke problemen. Zelfs de grootste en meest geavanceerde modellen vonden het moeilijk om de juiste pagina's te lokaliseren wanneer het antwoord vereiste dat bewijs uit meerdere bronnen werd gecombineerd. De prestaties daalden scherp naarmate het aantal pagina's dat nodig was om een vraag te beantwoorden toenam. Dit suggereert dat de huidige generatie retrieval-tools nog niet klaar is voor de complexiteit van echte Koreaanse documenten, waarbij informatie vaak verspreid is over een reeks pagina's in plaats van op één plek te zijn geconcentreerd. De studie voert expliciet aan dat het simpelweg groter maken van modellen dit probleem niet zal oplossen; hoewel grotere modellen beter presteerden dan kleinere, slaagden ze er nog steeds niet in om de taak van het aggregeren van informatie over meerdere pagina's te beheersen.

Om dit probleem aan te pakken, stopten de onderzoekers niet bij het identificeren van het probleem. Ze creëerden een enorme trainingsdataset genaamd Ko-VDR Train Public, die meer dan 310.000 voorbeelden bevat van vragen en de bijbehorende documentpagina's. Vervolgens hebben ze twee van de bestaande modellen getraind met deze nieuwe gegevens. De resultaten waren onmiddellijk en positief. Na training op deze Koreaans-specifieke voorbeelden werden de modellen veel beter in het vinden van de juiste pagina's, waarbij hun nauwkeurigheid drastisch verbeterde over alle verschillende soorten documenten die ze testten. De kleinere modellen, die voorheen slecht presteerden, waren in staat om grote systemen in te halen, simpelweg door te leren van het juiste soort data. Deze bevinding benadrukt dat voor kunstmatige intelligentie om een document in een specifieke taal echt te begrijpen, het getraind moet worden op materiaal dat de unieke structuur en lay-out van de real-world documenten van die taal weerspiegelt.

De onderzoekers keken ook nauwgezet naar waarom de taak zo moeilijk was. Ze ontdekten dat de moeilijkheidsgraad direct gekoppeld was aan het aantal pagina's dat nodig was om een vraag te beantwoorden. Wanneer een zoekopdracht informatie vereiste van slechts één pagina, waren de modellen redelijk succesvol. Maar zodra de vraag bewijs vereiste van twee, drie of meer pagina's, begon het vermogen van de computer om het juiste antwoord te vinden af te nemen. Dit bevestigt dat de uitdaging niet alleen gaat over het lezen van de woorden, maar over het begrijpen van de relatie tussen verschillende delen van een document. De studie concludeert dat hoewel de huidige technologie grote stappen heeft gezet, er nog een lange weg te gaan is voordat machines betrouwbaar door de complexe, meerpagina-documenten kunnen navigeren die de moderne informatiesystemen definiëren, vooral in talen zoals het Koreaans. De nieuwe benchmark en trainingsdata die zij hebben vrijgegeven, zijn bedoeld om te dienen als een fundament voor toekomstig onderzoek, om ontwikkelaars te helpen systemen te bouwen die de kloof tussen menselijke nieuwsgierigheid en de enorme, gestructureerde informatie die verborgen ligt in onze digitale archieven werkelijk kunnen overbruggen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →