← Nieuwste papers
💬 NLP

MCite-RL: Towards Reliable Multimodal RAG via Citation-enhanced Agentic Reinforcement Learning

Het artikel stelt MCite-RL voor, een met citaties versterkt agentisch reinforcement learning-framework dat de betrouwbaarheid van multimodale RAG verbetert door een iteratieve Agentic Refinement-module te introduceren voor dynamische visuele citatie en een tweeledig beloningsmechanisme om gezamenlijk de nauwkeurigheid van antwoorden en de traceerbaarheid van bronnen te optimaliseren.

Oorspronkelijke auteurs: Suifeng Zhao, Zida Liu, Xinyu Lei, Lei Sun, Jun Gao, Sujian Li

Gepubliceerd 2026-08-25
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Suifeng Zhao, Zida Liu, Xinyu Lei, Lei Sun, Jun Gao, Sujian Li

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

In het moderne digitale tijdperk heeft kunstmatige intelligentie geleerd om tekst te lezen en naar afbeeldingen te kijken met opmerkelijke vaardigheid. Wanneer deze systemen complexe vragen krijgen, wenden ze zich vaak tot een bibliotheek van documenten om het juiste antwoord te vinden, een proces dat bekendstaat als retrieval-augmented generation. Stel je voor dat je een bibliothecaris vraat naar een specifiek feit; de bibliothecaris zoekt het boek, leest de pagina en vertelt je het antwoord. Jarenlang werkte dit systeem goed met alleen tekst. Echter, naarmate deze AI-modellen geavanceerder zijn geworden, zijn ze begonnen met het verwerken van documenten gevuld met grafieken, diagrammen en foto's. De uitdaging nu is niet alleen het vinden van de juiste pagina, maar het aanwijzen van exact de specifieke plek op die pagina — het piepkleine gedeelte van een grafiek of een klein vakje in een foto — dat bewijst dat het antwoord waar is. Zonder dit vermogen om naar het bewijs te wijzen, is het systeem als een student die het juiste antwoord op een toets geeft, maar niet kan laten zien hoe hij tot dat antwoord kwam, waardoor de docent niet kan verifiëren of de student de stof echt begreep of gewoon gokte.

Een team onderzoekers van de Universiteit van Peking en Panasonic Connect heeft een nieuwe methode ontwikkeld om dit probleem van "het laten zien van het werk" in de visuele wereld op te lossen. Ze noemen hun systeem MCite-RL. Het kernidee is om de AI niet alleen te leren een antwoord te vinden, maar om het proces van het vinden van het bewijs te behandelen als een zorgvuldig, stapsgewijs onderzoek. In plaats van de locatie van het bewijs in één snelle blik te raden, wordt het systeem getraind om te handelen als een detective die inzoomt op een document, de irrelevante delen wegknipt en het zoekgebied verkleint totdat alleen het cruciale stukje informatie overblijft. Dit proces wordt gestuurd door een nieuw type leren waarbij de AI feedback krijgt, niet alleen over de vraag of het uiteindelijke antwoord correct is, maar ook over hoe goed het de visuele bewijslast onderweg heeft gelokaliseerd.

De onderzoekers ontdekten dat eerdere methoden vaak op twee specifieke manieren faalden. Soms wees de AI naar een afbeelding die te groot was, waarbij een hele grafiek werd beslagen in plaats van het enkelvoudige getal dat nodig was, waardoor de citatie nutteloos was voor verificatie. Op andere momenten gaf de AI een correct antwoord, maar wees naar een totaal ander deel van de afbeelding, alsof het antwoord en het bewijs niet met elkaar verbonden waren. Om dit op te lossen, creëerde het team een trainingsproces dat een "cold start"-fase combineert, waarin de AI de basisstappen van het zoeken en bijsnijden van afbeeldingen leert, met een reinforcement learning-fase. In deze tweede fase speelt de AI veel verschillende scenario's uit, waarbij het probeert het antwoord en het bewijs te vinden. Als het erin slaagt de afbeelding succesvol te verkleinen tot de juiste plek en het antwoord goed heeft, ontvangt het een beloning. Als het de weg kwijtraakt of naar het verkeerde gebied wijst, leert het van die fout.

De resultaten van deze aanpak werden getest op drie verschillende sets uitdagende documenten, waaronder financiële rapporten en lange Wikipedia-pagina's. Het nieuwe systeem presteerde aanzienlijk beter dan bestaande methoden. In een belangrijke test verbeterde het de precisie van het aanwijzen van het juiste visuele bewijs met meer dan 26 procent vergeleken met standaardmethoden. Misschien wel verrassender is dat door de AI te dwingen precies te zijn over waar het de informatie vond, het systeem ook beter werd in het geven van het feitelijke antwoord, waarbij de nauwkeurigheid gemiddeld met bijna 6 procent steeg. De studie suggereert dat wanneer een AI wordt getraind om rigoureus te zijn over zijn bronnen, het er als geheel betrouwbaarder van wordt. De onderzoekers merken op dat hoewel het systeem een belangrijke stap voorwaarts is, het nog steeds zorgvuldig menselijk toezicht vereist, vooral in situaties met hoge inzet, en dat het momenteel het beste werkt met enkelvoudige afbeeldingen in plaats van complexe, meer pagina's tellende documenten. Uiteindelijk demonstreert dit werk dat het trainen van een AI om naar zijn bewijs te wijzen niet alleen een manier is om het werk te verifiëren, maar ook een krachtig hulpmiddel om het systeem te helpen helderder na te denken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →