DOSA: A Tree-Guided, Self-Regressive Framework for Long Document Structure Analysis
Het artikel stelt DOSA voor, een boomgestuurd, zelfregressief framework dat document-niveau semantische bomen incrementeel reconstrueert door meerpagina-documenten chunk-voor-chunk te verwerken om lange-afstandsafhankelijkheden en heterogene lay-outs effectief te vangen, waarmee state-of-the-art prestaties wordt behaald op benchmarks voor documentstructuuranalyse.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je probeert een enorme, meerdelige encyclopedie te begrijpen die is geprint op losse vellen papier, verspreid over een gigantische vloer. Sommige pagina's hebben afbeeldingen, sommige lijsten en sommige grote, vette titels. Om zin te krijgen in deze chaos, lees je niet alleen de woorden; je moet ontdekken hoe de stukjes in elkaar passen. Hoort die afbeelding bij de paragraaf erboven? Is die lijst een kind van de titel, of is het een volledig aparte sectie? Dit is de wereld van "visueel rijke documenten", waar informatie niet alleen een stroom tekst is, maar een complexe puzzel van vormen, posities en stijlen. Om deze documenten echt te kunnen "lezen" — of het nu gaat om juridische contracten, wetenschappelijke artikelen of presentaties — moeten computers een specifieke puzzel oplossen die Document Structure Analysis wordt genoemd. Ze moeten een "semantische boom" bouwen, wat een soort stamboom is voor de onderdelen van het document, die laat zien wie de ouder is van wie en in welke volgorde iedereen gelezen moet worden. Zonder dit zou een computer een titel en een paragraaf als twee ongerelateerde vreemden kunnen zien, waarbij hij de essentie mist dat ze eigenlijk een ouder en een kind zijn.
Maak kennis met DOSA (Document Structure Analyzer), een nieuwe methode voorgesteld door onderzoekers van Glean Technologies om dit puzzelstukje op te lossen voor lange, meerpagina-documenten. Denk aan het proberen te bouwen van een LEGO-kasteel van 1.000 stukjes in één keer; het is overweldigend, en als je in het begin een fout maakt, kan het hele bouwwerk instorten. Eerdere methoden probeerden het hele document in één keer te bekijken, wat is alsof je probeert het hele kasteel in je handen te houden terwijl je het bouwt — het wordt te zwaar en de computer raakt in de war. DOSA hanteert een andere aanpak: het bouwt het kasteel stukje voor stukje op. Het verwerkt het document in "chunks", alsof je eerst één kamer van het kasteel assembleert voordat je naar de volgende gaat. Maar hier komt de slimme wending: terwijl het elke nieuwe kamer bouwt, kijkt het niet alleen naar de stenen in de hand, maar ook naar de "rechtertak" van het kasteel dat het al heeft gebouwd. Dit dient als een gids, die de computer precies vertelt welke delen van de vorige kamers relevant zijn voor de nieuwe kamers. Door deze "boom-gestuurde" kaart te gebruiken, voorkomt DOSA dat het verdwaalt in de enorme omvang van het document.
De onderzoekers ontdekten dat deze stapsgewijze, zelfsturende methode ongelooflijk goed werkt. Toen ze DOSA testten op vijf verschillende datasets, waaronder een zeer lastige genaamd DocHieNet vol complexe lay-outs met meerdere pagina's, presteerde het beter dan de huidige beste methoden. Op die uitdagende benchmark verbeterde DOSA de nauwkeurigheid met wel 4 punten op een schaal genaamd F1 en bijna 20 punten op een schaal genaamd TEDS (die meet hoe vergelijkbaar de boom van de computer is met de echte boom). Nog indrukwekkender nog: het versloeg krachtige, algemene AI-modellen zoals Gemini-2.5-Pro en GPT-5.2, wat suggereert dat voor deze specifieke taak van het bouwen van documentbomen, een gespecialiseerde, gestructureerde aanpak beter is dan simpelweg een gigantische AI te vragen de structuur te "raden". Het artikel suggereert dat door visuele aanwijzingen (zoals waar een kader zich op de pagina bevindt), tekstinhoud en de grootte van de objecten te combineren, DOSA de logica van het document met hoge precisie kan reconstrueren, zelfs zonder de hele document in één keer te hoeven onthouden. De auteurs merken echter op dat hoewel deze methode robuust is, het niet perfect is; het richt zich momenteel op boomstructuren en kan nog geen complexere, webachtige verbindingen aan, zoals citaties, en het kan nog steeds in de problemen komen als het in het begin een fout maakt die het later niet meer kan corrigeren.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.