← Nieuwste papers
💬 NLP

Chain of Evidence: Pixel-Level Visual Attribution for Iterative Retrieval-Augmented Generation

Het artikel introduceert Chain of Evidence (CoE), een retriever-agnostisch raamwerk dat Vision-Language-modellen benut om pixel-level visuele attributie mogelijk te maken in Iteratieve Retrieval-Augmented Generation, en zo de beperkingen van alleen tekstgebaseerde parsing overwint door direct te redeneren op document-screenshots om nauwkeurige bounding box-citaties te leveren en essentiële visuele lay-outinformatie te behouden.

Oorspronkelijke auteurs: Peiyang Liu, Ziqiang Cui, Xi Wang, Di Liang, Wei Ye

Gepubliceerd 2026-05-06
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Peiyang Liu, Ziqiang Cui, Xi Wang, Di Liang, Wei Ye

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een detective bent die probeert een complex mysterie op te lossen. In het verleden moest je honderden pagina's vol getypte rapporten doorbladeren om de aanwijzingen te vinden. Als het rapport zei: "De verdachte was in Parijs", dan moest je dat geloven. Maar wat als het rapport eigenlijk een rommelige flyer was met een kaart, een foto van een treinkaartje en een handgeschreven notitie? Als je gewoon de woorden van die flyer overtypde, zou je de kaart en de foto verliezen, en zou je geen idee hebben waar op de pagina de aanwijzing zich verstopte.

Dit is het probleem dat de auteurs van dit artikel oplossen met een nieuw systeem genaamd Chain of Evidence (CoE).

Het Probleem: De "Vage Fotokopie"

Huidige AI-systemen die vragen beantwoorden (zogenaamde Retrieval-Augmented Generation, of RAG) werken meestal als volgt:

  1. Je stelt een vraag.
  2. De AI vindt enkele documenten.
  3. Het verwijdert alle afbeeldingen, grafieken en opvallende lay-outs en verandert alles in platte tekst (zoals een vage fotokopie).
  4. Het geeft je een antwoord en zegt: "Ik heb dit gevonden in Document A."

De Vangst: Als Document A een presentatie is met een grafiek of een PDF met een complexe tabel, vernietigt het omzetten naar platte tekst de logica. Het is alsof je probeert een recept te begrijpen door alleen de lijst met ingrediënten te lezen, maar de afbeeldingen van hoe je ze moet mengen negeert. Bovendien, wanneer de AI zegt "Document A", vertelt het je niet welk deel van dat document het antwoord bevat. Je moet handmatig door 50 pagina's scrollen om de specifieke zin te vinden. Dit is de "Verificatieknelpunt".

De Oplossing: De "Pixel-gebaseerde Detective"

De auteurs stellen Chain of Evidence (CoE) voor, wat het spel verandert door documenten te behandelen als afbeeldingen (screenshots) in plaats van alleen tekst.

Stel je CoE voor als een detective die niet alleen het rapport leest, maar kijkt naar de originele, onbewerkte foto van het document.

  • Geen Verwijdering Meer: Het converteert het document niet eerst naar tekst. Het kijkt naar de screenshot, waarbij alle grafieken, pijlen en lay-outs intact blijven.
  • De "Magische Markeerstift": In plaats van alleen te zeggen "Het zit in Document 3", tekent CoE een precies kader (een bounding box) om de exacte plek op de afbeelding waar het antwoord zich bevindt. Het wijst direct naar het specifieke getal in een grafiek of de specifieke regel in een alinea.
  • De Keten: Voor complexe vragen die meerdere stappen vereisen (bijvoorbeeld: "Wie regisseerde de film, en waar ging hij naar school?"), bouwt CoE een visuele keten op. Het laat je zien: "Stap 1: Kijk naar dit kader in Document A om de regisseur te vinden. Stap 2: Kijk naar dit kader in Document B om de school te vinden."

Hoe Ze Het Testten

Om te bewijzen dat dit werkt, bouwde het team twee nieuwe "trainingsvelden" (datasets):

  1. Wiki-CoE: Een enorme verzameling Wikipedia-pagina's omgezet in screenshots. Ze namen vragen die het overspringen tussen meerdere pagina's vereisen en leerden de AI de exacte visuele plek voor het antwoord te vinden.
  2. SlideVQA: Een verzameling presentatiedia's met rommelige lay-outs, pijlen en complexe diagrammen. Dit is de "harde modus"-test, omdat tekstgebaseerde systemen hier meestal falen.

De Resultaten: Waarom Het Belangrijke Is

Het artikel toont aan dat CoE een game-changer is, vooral voor documenten die niet alleen platte tekst zijn:

  • Het Is Slimmer in "Waar": Op complexe dia's raken standaard AI-systemen die vertrouwen op tekst vaak de weg kwijt. CoE, door naar de visuele lay-out te kijken, identificeerde het bewijs veel vaker correct.
  • Het Is Betrouwbaar: Omdat CoE een kader om het bewijs trekt, kun je het antwoord direct verifiëren. Je hoeft niet te raden; je kunt het bewijs direct op het scherm zien.
  • Het Heeft Geen Specifieke Zoekmachine Nodig: CoE werkt met elke zoektool die documenten vindt. Het neemt gewoon de top 5 resultaten (als afbeeldingen) en werkt de logica uit.

De Conclusie

De auteurs betogen dat AI pas echt betrouwbaar is, vooral bij complexe documenten zoals rapporten, dia's en grafieken, als het het document kan "zien" en niet alleen een tekstversie ervan kan "lezen". Chain of Evidence verandert de AI in een visuele detective die direct met de vinger naar de waarheid kan wijzen, waardoor het redeneerproces transparant wordt en gemakkelijk te controleren is voor mensen.

Kortom: In plaats van je een vaag verwijzing naar een boek te geven, geeft CoE je het boek, opent het op de exacte pagina en tekent een cirkel om de zin die je nodig hebt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →