MARQUIS: A Three-Stage Pipeline for Video Retrieval-Augmented Generation
MARQUIS is een drie-trapspijplijn die video-retrieval-gebaseerde generatie aanzienlijk verbetert door beperkingen in de verwerking van complexe queries en de synthese van meerdere video's aan te pakken via query-uitbreiding, gestructureerde extractie van bewijsmateriaal en gecontroleerde artikelgeneratie, waarmee het state-of-the-art prestaties bereikt op de MAGMaR2026-deeltaak.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een journalist bent die de opdracht heeft een gedetailleerd nieuwsartikel te schrijven over een complex evenement, zoals een enorme storm of een politieke verkiezing. Je hebt echter geen enkele reporter ter plaatse; in plaats daarvan beschik je over een bibliotheek met 100.000 verschillende videoclips van het evenement, opgenomen door honderden verschillende camera's. Je taak is om de juiste clips te vinden, uit te zoeken wat er daadwerkelijk in gebeurt, en een samenhangend verhaal te schrijven dat exact aangeeft welke video elk feit bewijst.
Dit is de uitdaging die het MARQUIS-systeem aangaat. Het artikel stelt dat huidige AI-tools slecht zijn in deze specifieke taak. Ze kunnen ofwel de juiste video's niet vinden wanneer de vraag complex is, of ze raken overweldigd door te proberen te veel video's tegelijk te lezen en eindigen met hallucinaties (dingen verzinnen).
MARQUIS lost dit op door te fungeren als een driefasen assemblagelijn in een redactie, waarbij de enorme taak wordt opgesplitst in kleinere, hanteerbare stappen.
Fase 1: Het zoektocht van de detective (Retrieval)
Het probleem: Als je een AI vraagt: "Vertel me alles over de verkiezingsuitslagen van 2025", kan een standaardzoekmachine in de war raken. Het probeert die hele lange vraag om te zetten in één enkele "zoekcode" (embedding), wat vaak de nuance mist. Het is alsof je probeert een specifieke naald in een hooiberg te vinden door de hele hooiberg tegelijk te beschrijven.
De MARQUIS-oplossing:
In plaats van één grote zoekopdracht, fungeert MARQUIS als een detective die een grote zaak opsplitst in kleine aanwijzingen.
- Decompositie: Het neemt je grote vraag en splitst deze op in 20+ kleine, specifieke vragen (bijv. "Hoeveel zetels hebben de Liberalen gewonnen?", "Wat was de opkomst?", "Welke districten zijn omgeslagen?").
- Parallelle zoekopdracht: Het doorzoekt de videobibliotheek voor elk van die kleine vragen afzonderlijk.
- De fusie: Het neemt alle lijsten met gevonden video's voor de kleine vragen en voegt ze samen tot één hoofdlIJst.
- De her-rangschikking: Tot slot bekijkt een gespecialiseerde "video-rechter" de topkandidaten en rangschikt ze opnieuw om ervoor te zorgen dat de meest relevante helemaal bovenaan staan.
Het resultaat: Deze methode is alsof je een vergrootglas gebruikt om specifieke naalden te vinden in plaats van te raden waar de hele hooiberg zit. Het verbeterde het vermogen van het systeem om de juiste video's te vinden van een score van 0,195 naar 0,759 (een enorme sprong).
Fase 2: De factcheckers (Informatie-extractie)
Het probleem: Zodra je de video's hebt, kun je het volledige videobestand niet zomaar aan een schrijver geven. De schrijver heeft specifieke feiten nodig. Bovendien kunnen video's tricky zijn; soms zegt iemand iets dat niet waar is, of is het camerabeweging misleidend.
De MARQUIS-oplossing:
MARQUIS "leest" de video niet zomaar; het extrahert specifieke "claims" en kalibreert ze vervolgens.
- Drie soorten notities:
- Algemene notities: "Een vrouw in een rode jas spreekt." (Feiten die later nuttig kunnen zijn).
- Gerichte claims: "De video toont 50 geredde mensen." (Feiten die specifiek je vraag beantwoorden).
- Vraag & Antwoord: Het systeem stelt de video specifieke vragen en krijgt antwoorden.
- De kalibratie (De leugendetector): Dit is een cruciale stap. Voordat een schrijver een claim ziet, bekijkt een "kalibrator"-model de claim en de originele video naast elkaar. Het vraagt zich af: "Bewijst deze video deze zin daadwerkelijk?" Het kiest een waarschijnlijkheidsscore (0 tot 1). Als de video de claim niet ondersteunt, wordt deze gefilterd.
De analogie: Stel je een team factcheckers voor die elke zin die een reporter schrijft lezen en vervolgens teruggaan naar het ruwe beeldmateriaal om het te verifiëren. Als het beeldmateriaal niet overeenkomt, wordt de zin in de prullenbak gegooid.
Fase 3: De schrijvers (Artikelgeneratie)
Het probleem: Zelfs met goede feiten is het schrijven van een vloeiend artikel moeilijk. Als je een schrijver 500 losgekoppelde opsommingstekens geeft, kunnen ze een rommelige lijst schrijven. Als je ze een transcriptie van een 2-uursvideo geeft, kunnen ze verdwalen in de details en het hoofdpunt vergeten.
De MARQUIS-oplossing:
Het systeem biedt drie manieren om het artikel te schrijven, maar de beste gebruikt een gestructureerde aanpak:
- Clustering: Het groepeert de geverifieerde feiten in thema's (bijv. "Slachtoffers", "Reddingsinspanningen", "Overheidsreactie").
- Samenvatten: Het schrijft een korte, geciteerde zin voor elk thema.
- Polijsten: Het plakt die zinnen samen tot een vloeiend, leesbaar nieuwsverhaal, waarbij ervoor wordt gezorgd dat elk feit een bronvermelding heeft (zoals
[Video #45, 0:12-0:15]).
De "Recursieve" optie (MARQUIS-RLM):
Het artikel introduceert ook een speciale "Manager"-AI (gebaseerd op Recursieve Taalmodellen). In plaats van slechts één keer te schrijven, fungeert deze Manager als een projectmanager met een persistent notitieboek.
- Het bekijkt de feiten die het heeft.
- Het beseft: "Ik mis het aantal slachtoffers voor het noordelijke district."
- Het gaat terug naar Fase 1 en 2, vraagt specifiek om die ontbrekende informatie, voegt het toe aan zijn notitieboek en controleert op conflicten.
- Pas wanneer het notitieboek vol en consistent is, schrijft het het definitieve artikel.
De bottom line
Het artikel stelt dat door het probleem op te splitsen – slimmer zoeken, feiten strikt verifiëren en het schrijfproces organiseren – MARQUIS veel betere resultaten oplevert dan huidige methoden.
- Retrieval: Vond veel vaker de juiste video's.
- Generatie: Produceerde artikelen die door mensen hoger werden beoordeeld (3,83 van de 5 versus 3,09 voor de basislijn) omdat ze samenhangender waren en beter waren onderbouwd.
- Betrouwbaarheid: Het systeem is ontworpen om "gegrond" te zijn, wat betekent dat het weigert feiten te schrijven die niet worden ondersteund door het videobewijs, waardoor de "hallucinaties" die gebruikelijk zijn bij andere AI-systemen worden vermeden.
Kortom, MARQUIS zet een chaotische stapel van 100.000 video's om in een betrouwbaar, goed onderbouwd nieuwsartikel door te fungeren als een hoogst georganiseerde, meerstapsredactie in plaats van als een enkele, overweldigde schrijver.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.