← Nieuwste papers
💻 computer science

HierDoc: Hierarchical Page-to-Region Evidence Routing for Long-Document Visual Question Answering

HierDoc introduceert een hiërarchisch, tweestaps bewijs-routeringsframework dat sequentieel pagina-selectie en regio-extractie optimaliseert met behulp van stage-wise GRPO met gestructureerde-verzameling-beloningen, waarmee het de state-of-the-art prestaties bereikt in long-document visual question answering door effectief de kloof te overbruggen tussen grove pagina-verwerving en fijnmazige regio-lokalisatie.

Oorspronkelijke auteurs: Rongjian Gu, Wengang Zhou, Junyu Xiong, Yonghui Wang, Bing Yin, Bei Wang, Houqiang Li

Gepubliceerd 2026-08-03
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Rongjian Gu, Wengang Zhou, Junyu Xiong, Yonghui Wang, Bing Yin, Bei Wang, Houqiang Li

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een mysterie probeert op te lossen, maar in plaats van één aanwijzing, krijg je een stapel van honderd dikke, geïllustreerde boeken aangeleverd. Het antwoord op je vraag is ergens daarin verborgen—misschien een klein diagram op pagina 42, of een specifieke zin in een tabel op pagina 89. Dit is de wereld van Document Visual Question Answering. Het is een tak van kunstmatige intelligentie waarbij computers proberen documenten te lezen en te begrijpen die vol staan met afbeeldingen, grafieken en tekst die allemaal door elkaar staan. Lange tijd waren deze computer-"lezers" als studenten die slechts één pagina tegelijk konden bekijken, of ze probeerden de gehele stapel boeken in één keer te lezen, waardoor ze overweldigd raakten en de kleine details misten. De grote uitdaging is het uitzoeken hoe je de exacte juiste pagina vindt en vervolgens inzoomt op de exacte juiste plek zonder verdwaald te raken in de ruis.

Maak kennis met HierDoc, een nieuwe methode die fungeert als een super-slimme, tweestaps detective voor deze enorme stapels documenten. Voorheen waren de meeste computersystemen als een persoon die óf een heel boek greep in de hoop dat het antwoord erin zat, óf iemand die een specifieke pagina kreeg toegewezen en vervolgens moest zoeken naar een speld in een hooiberg. Ze deden zelden beide stappen goed samen. HierDoc verandert het spel door de taak te splitsen in twee duidelijke, gespecialiseerde taken. Eerst fungeert een "Page Policy" als een verkenner die de hele documentenstap snel scant om alleen de pagina's uit te pikken die waarschijnlijk het antwoord bevatten. Het is als een bibliothecaris die precies weet welke drie boeken hij uit de kast moet pakken, terwijl de andere negentig-zeven genegeerd worden.

Zodra de juiste pagina's zijn geselecteerd, neemt een tweede "Region Policy" het over. Dit deel is als een detective met een vergrootglas die naar die specifieke pagina's kijkt en de exacte paragraaf, grafiek of tabelcel vindt die de aanwijzing bevat. Het negeert de rest van de pagina en focust zich alleen op de relevante "regio". Het artikel laat zien dat door deze twee aparte, geoptimaliseerde stappen te gebruiken, het systeem veel beter wordt in het vinden van antwoorden. In tests op moeilijke, langere documentpuzzels verbeterde deze tweestapsbenadering de nauwkeurigheid met een aanzienlijke marge—specifiek verhoogde het de prestaties met 16,87% op één belangrijke test vergeleken met de beste eerdere open systemen. Nog interessanter is dat de onderzoekers ontdekten dat het toevoegen van deze fijnmazige "regio"-zoekopdracht bovenop enkel het selecteren van pagina's het systeem 5,51% nauwkeuriger maakte en 4,82% beter in het vinden van de juiste aanwijzingen (gemeten via de F1-score).

Het geheime ingrediënt is niet alleen dat het naar meer zaken kijkt; het is hoe het leert om de verkeerde zaken te negeren. Het systeem gebruikt een trainingsmethode genaamd GRPO (Group Relative Policy Optimization), wat lijkt op een coach die feedback geeft aan een team. In plaats van alleen "goed gedaan" of "fout gedaan" te zeggen, vergelijkt de coach verschillende pogingen zij aan zij. Als het systeem te veel pagina's kiest, krijgt het een straf. Als het de juiste aanwijzing mist, krijgt het een straf. Het leert om een balans te vinden tussen grondig zijn en precies zijn. Het artikel betoogt expliciet tegen het idee dat je de computer het hele document moet voeren of dat je kunt vertrouwen op één groot model dat alles tegelijk doet. In plaats daarvan bewijzen ze dat het opdelen van het probleem in "de pagina vinden" en vervolgens "de plek vinden" veel beter werkt.

De auteurs wijzen echter voorzichtig op het feit dat dit geen wondermiddel is dat alles perfect oplost. Omdat het systeem in stappen werkt, als de eerste stap (de Page Policy) de juiste pagina volledig mist, kan de tweede stap dit niet meer herstellen; de bewijslast is dan voorgoed verloren. Ook is het systeem afhankelijk van een parser (een tool genaamd MinerU) om de pagina's in regio's op te delen, dus als die parser een fout maakt of de tekst slordig is, zijn de keuzes van het systeem beperkt. Maar voor nu laat HierDoc zien dat het organiseren van een zoekproces van een computer in een duidelijk, hiërarchisch pad—van het grote plaatje naar het minuscule detail—een krachtige manier is om machines te helpen lange, complexe documenten te lezen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →