LongDocBench: Benchmarking TOC Hierarchy and Contextual Relationship Recovery in Long Documents
Dit artikel introduceert LongDocBench, een nieuwe benchmark bestaande uit 85 real-world lange documenten met door mensen geverifieerde annotaties voor de hiërarchie van de inhoudsopgave en het herstel van contextuele relaties, om de beperkingen van bestaande benchmarks bij het evalueren van documentniveau-structuur aan te pakken en om aan te tonen dat het herstellen van deze structuren de prestaties van vraagbeantwoording bij lange documenten aanzienlijk verbetert.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je probeert een enorme bibliotheek te begrijpen door slechts één boekenplank tegelijk te bekijken. Je zou elk woord op die ene plank kunnen lezen, de titels kunnen identificeren en zelfs de lay-out van de boeken direct voor je kunt begrijpen. Maar als je een specifief argument moet vinden dat zich over drie verschillende secties uitstrekt, of wilt traceren hoe een grafiek op pagina vijftig verband houdt met een voetnoot op pagina tweehonderd, dan ben je verdwaald als je alleen naar geïsoleerde planken kijkt. Dit is de huidige uitdaging in het vakgebied van documentintelligentie, waar computers worden geleerd om visuele documenten zoals rapporten, tekstboeken en academische papers te lezen en te begrijpen. Jarenlang hebben onderzoekers zich gericht op het aanleren aan machines om tekst, formules en tabellen op individuele pagina's met hoge nauwkeurigheid te herkennen. Ze zijn erg goed geworden in dit lokale werk. Echter, echte documenten zijn niet slechts collecties van geïsoleerde pagina's; het zijn complexe structuren waarin informatie over honderden pagina's heen is verweven via diepe hiërarchieën van koppen en verbindingen tussen figuren en hun uitleg.
Een nieuwe studie introduceert een manier om te testen of computers werkelijk deze lange, verbonden documenten kunnen begrijpen. De onderzoekers hebben een benchmark gebouwd genaamd LongDocBench, een collectie van vijfentachtig real-world documenten, waaronder financiële rapporten, tekstboeken en academische papers. Deze documenten beslaan in totaal meer dan tweeduizend vijfhonderd pagina's, waarbij sommige individuele rapporten meer dan honderd pagina's beslaan. Het team heeft deze bestanden niet alleen verzameld; ze hebben voor elk bestand zorgvuldig een "gouden standaard"-kaart gemaakt. Menselijke experts hebben de volledige structuur handmatig getraceerd, waarbij elke kop en de manier waarop deze in een ouder-kind-hiërarchie past, is geïdentificeerd, vergelijkbaar met een inhoudsopgave die het hele boek beslaat. Ze hebben ook duizenden specifieke relaties in kaart gebracht, waarbij ze hebben genoteerd wanneer een grafiek of afbeelding gekoppeld is aan een bijschrift, een noot of een bron die zich mogelijk ver weg op een andere pagina bevindt. Dit zorgvuldige menselijke werk creëerde een referentiepunt om te zien of huidige computersystemen hetzelfde werk konden doen.
Wanneer de onderzoekers de beste beschikbare document-parsers testten tegen deze door mensen gemaakte kaart, onthulde de uitslag een aanzienlijke kloof. De computers presteerden uitzonderlijk goed op paginaniveau, waarbij ze tekst en lokale lay-outs met hoge nauwkeurigheid correct identificeerden. Toch, wanneer ze werden gevraagd de volledige documentstructuur te reconstrueren, hadden ze moeite. De systemen slaagden er niet in om de diepe hiërarchieën van koppen correct te organiseren, waarbij ze de complexe boom van hoofdstukken en subhoofdstukken vaak reduceerden tot een platte lijst. Op dezelfde manier hadden ze moeite met het verbinden van figuren aan hun verre noten of bronnen, waarbij ze de getypte links misten die context geven aan de gegevens. Zelfs de meest geavanceerde modellen slaagden er slechts voor de helft in om de juiste structurele relaties te herstellen, een schril contrast met hun bijna perfecte prestaties op taken met één pagina. Dit suggereert dat het vermogen om een pagina te lezen niet automatisch betekent dat een machine een document als geheel kan begrijpen.
De studie onderzocht ook waarom dit structurele begrip ertoe doet. De onderzoekers gebruikten de door mensen geverifieerde kaarten om vragen over de documenten te beantwoorden, waarbij ze de resultaten vergeleken met een systeem dat geen structurele kaart had. Wanneer het systeem de correcte, door mensen geverifieerde hiërarchie en relaties gebruikte, verbeterde het vermogen om vragen te beantwoorden drastisch. Het was niet zomaar een kleine verbetering; de nauwkeurigheid sprong aanzienlijk omhoog, wat aantoont dat weten hoe een document is georganiseerd, de computer helpt bij het redeneren door complexe queries. Echter, wanneer het systeem vertrouwde op de structuren die het zelf had gereconstrueerd, was de verbetering veel kleiner. De eigen pogingen van de computer om de kaart op te bouwen waren niet nauwkeurig genoeg om het volledige potentieel van de informatie te ontsluiten.
Uiteindelijk benadrukt dit werk dat de volgende grens in documentintelligentie niet alleen het lezen van woorden is, maar het begrijpen van de architectuur van informatie. De onderzoekers hebben hun benchmark en de door mensen geverifieerde kaarten publiekelijk beschikbaar gesteld, wat een duidelijk doel biedt voor toekomstige ontwikkeling. Ze hebben aangetoond dat hoewel machines uitstekend zijn in het zien van de bomen, ze nog steeds moeten leren hoe ze het bos kunnen zien. Totdat computers in staat zijn om betrouwbaar de diepe hiërarchieën en cross-page verbindingen te reconstrueren die mensen als vanzelfsprekend beschouwen, zal hun vermogen om lange, complexe documenten echt te begrijpen beperkt blijven. De weg vooruit vereist het overstijgen van eenvoudige paginagenoeming naar het beheersen van de ingewikkelde, meerpagina-relaties die bepalen hoe wij kennis in de echte wereld organiseren en ontsluiten.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.