← Nieuwste papers
💬 NLP

SlideAgent: Hierarchical Agentic Framework for Multi-Page Visual Document Understanding

Dit paper introduceert SARA, een hybride RAG-framework dat natuurlijke taalfragmenten combineert met semantische compressievectoren om de antwoordkwaliteit en feitelijke nauwkeurigheid te verbeteren binnen een vast tokenbudget.

Oorspronkelijke auteurs: Yiqiao Jin, Rachneet Kaur, Zhen Zeng, Sumitra Ganesh, Srijan Kumar

Gepubliceerd 2026-04-24
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Yiqiao Jin, Rachneet Kaur, Zhen Zeng, Sumitra Ganesh, Srijan Kumar

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een enorme, ingewikkeld ontworpen receptenboek hebt. Dit boek bevat niet alleen tekst, maar ook foto's van gerechten, kleurrijke grafieken over calorieën, en verwijzingen naar andere pagina's. Je wilt weten: "Hoeveel suiker zit er in het dessert op pagina 42, en hoe verhoudt dat zich tot het hoofdgerecht op pagina 15?"

Als je dit boek aan een gewone robot (een standaard AI) geeft, kan die vaak in de war raken. De robot kijkt misschien naar de hele pagina, ziet de foto van de taart, maar mist de kleine tekst in de hoek die de suikermeting aangeeft. Of hij telt de ingrediënten verkeerd omdat hij de hele pagina als één grote vlek ziet.

SlideAgent is als een slimme, gespecialiseerd team van detectives dat samenwerkt om dit boek te begrijpen. In plaats van één robot die alles probeert te doen, heeft SlideAgent drie verschillende soorten detectives, elk met een specifieke taak:

1. De Hoofdcommissaris (Global Agent)

Deze detective kijkt niet naar de kleine details, maar naar het grote plaatje. Hij bladert snel door de eerste paar pagina's en zegt: "Oké, dit boek gaat over gezonde voeding. Het doel is om mensen te leren koken. De sfeer is positief en educatief."

  • Waarom is dit slim? Hij zorgt dat de andere detectives weten waar ze over praten, zodat ze niet denken dat het boek over auto's gaat.

2. De Bladonderzoeker (Page Agent)

Deze detective kijkt per pagina naar wat er gebeurt. Hij zegt: "Op pagina 15 praten we over het ontbijt. Op pagina 42 staat een recept voor taart. En op pagina 42 verwijst de tekst naar pagina 15."

  • Waarom is dit slim? Hij houdt de context van elke pagina bij en weet welke pagina's met elkaar te maken hebben, zodat de informatie niet versplintert.

3. De Detailagent (Element Agent)

Dit is de microscoop. Deze detective kijkt niet naar de hele pagina, maar zoomt in op elk klein stukje: de foto van de taart, de tabel met calorieën, de pijltjes in de grafiek en de kleine tekst in de voetnoot.

  • Waarom is dit slim? Stel je voor dat je op een drukke pagina een klein getal zoekt. Een gewone robot mist het misschien. Deze agent zoekt het exacte vakje op, leest de tekst erin en zegt: "Aha! Hier staat dat er 5 gram suiker in zit."

Hoe werkt het samen?

Wanneer jij een vraag stelt, doet SlideAgent het volgende:

  1. De Hoofdcommissaris zegt: "We zoeken iets over suiker in dit receptenboek."
  2. De Bladonderzoeker zegt: "Oké, dan moeten we naar pagina 42 kijken, want daar staat het taartrecept."
  3. De Detailagent zoomt in op de tabel op pagina 42, leest de regel over suiker en vindt het exacte getal.

Vervolgens komen ze allemaal samen in een vergaderzaal (de 'Answer Synthesizer'). Ze vergelijken hun bevindingen en geven jou één duidelijk, foutloos antwoord: "Er zit 5 gram suiker in de taart op pagina 42."

Waarom is dit een doorbraak?

Tot nu toe waren AI-systemen vaak als een olifant in een porseleinkast: ze konden grote dingen zien, maar ze waren te grof voor de kleine, delicate details in documenten. Ze misten vaak de fijne lijntjes in grafieken of de kleine tekst in een tabel.

SlideAgent is als een team van chirurgische specialisten. Door het werk op te splitsen in "groot plaatje", "pagina" en "detail", kunnen ze:

  • Fouten voorkomen: Ze tellen niet verkeerd omdat ze de hele pagina door elkaar halen.
  • Verbanden leggen: Ze zien dat een pijl op pagina 10 verwijst naar een tabel op pagina 20.
  • Beter presteren: De tests in het artikel laten zien dat dit team veel nauwkeuriger is dan de beste AI's die we nu hebben, zelfs als de documenten erg rommelig zijn of als je alleen een foto van een PDF hebt (zonder de onderliggende digitale tekst).

Kortom: SlideAgent is de slimme manier om complexe documenten (zoals presentaties, rapporten of handleidingen) te lezen. Het combineert de wijsheid van een ervaren manager met de precisie van een microscopisch onderzoek, zodat je nooit meer een klein detail mist in een zee van informatie.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →