← Nieuwste papers
🤖 AI

MPR-CiteG: Enhancing RAG with Multi-Portfolio Retrieval and Citation-Grounded Generation

Het artikel introduceert MPR-CiteG, een raamwerk met twee componenten dat Multi-Portfolio Retrieval en Citation-Grounded Generation combineert om RAG-systemen te verbeteren door de efficiëntie van retrieval te verhogen en feitelijke consistentie te waarborgen via expliciete bronvermelding, waardoor hallucinaties worden verminderd en de tweede plaats werd behaald in de ScienceON AI Challenge.

Oorspronkelijke auteurs: Hyewon Lee, Minkyung Song, Junghyun Oh, Seunghoon Han, Sungsu Lim

Gepubliceerd 2026-07-28
📖 3 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Hyewon Lee, Minkyung Song, Junghyun Oh, Seunghoon Han, Sungsu Lim

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een schoolverslag probeert te schrijven over een super ingewikkeld onderwerp, zoals hoe je een robot bouwt die kan dansen. Je hebt een enorme bibliotheek met boeken, maar ze liggen allemaal door elkaar en sommige zijn geschreven in verschillende talen. Als je gewoon een super-slimme AI vraagt om het verslag vanuit zijn eigen geheugen te schrijven, kan hij cool klinkende feiten verzinnen die waar lijken te zijn, maar eigenlijk niet kloppen. Dit wordt "hallucinatie" genoemd, en het is een groot probleem wanneer je echte, betrouwbare antwoorden nodig hebt. Om dit op te lossen, gebruiken wetenschappers een truc genaamd Retrieval-Augmented Generation (RAG). Denk aan RAG als het geven van een "spiekbriefje" met echte documenten aan de AI om te lezen voordat hij schrijft. Maar hier is de adder onder het gras: als de AI de verkeerde spiekbriefjes kiest, of als hij het verslag schrijft zonder je precies te vertellen van welke pagina de informatie komt, is het antwoord nog steeds nutteloos. Het doel is om een AI te bouwen die niet alleen slim is, maar ook een zorgvuldige onderzoeker die altijd zijn bronnen vermeldt.

Dit is precies wat het MPR-CiteG-framework doet. De onderzoekers achter dit project, die de tweede plaats behaalden in een grote AI-wedstrijd, hebben een tweeledig systeem gebouwd om ervoor te zorgen dat AI-antwoorden zowel accuraat als eerlijk zijn. Eerst creëerden ze een Multi-Portfolio Retriever (MPR). In plaats van de bibliotheek om hulp te vragen bij slechts één simpele vraag, werkt de MPR als een team van vier verschillende detectives, elk met een unieke strategie. De ene detective breidt de vraag uit om gerelateerde ideeën te vinden, een andere zoekt naar synoniemen om verschillende manieren te vangen om hetzelfde te zeggen, een derde balanceert de zoektocht tussen breed en specifiek, en de vierde vertaalt de vraag naar andere talen om internationaal onderzoek te vinden. Ze graven allemaal naar aanwijzingen, combineren hun bevindingen, en vervolgens kiest een strikte redacteur (een re-ranker) de allerbeste 50 documenten om te gebruiken.

Zodra de beste documenten zijn verzameld, neemt het tweede deel van het systeem, genaamd Citation-Grounded Generation (CiteG), het over. Dit is de schrijver die weigert te gokken. Het leest de top 10 documenten en schrijft een helder, vloeiend antwoord. Maar hier is de magie: voor elke zin die een specifiek feit bevat, voegt het direct een klein label toe dat wijst naar het exacte brondocument. Als een zin slechts een algemene overgang is, krijgt deze geen label. Op deze manier kun je het antwoord lezen en direct weten: "Oké, dit feit komt uit Bron A, en dat ene uit Bron B." Het team testte dit op een dataset van wetenschappelijke vragen en ontdekte dat hun systeem zeer effectief was in het vermijden van verzonnen feiten. Ze ontdekten dat het gebruik van een specifiek type AI-model (Qwen-2.5-14B) het beste werkte, en dat het hebben van alle vier de "detective"-strategieën in het retrieval-team cruciaal was voor het verkrijgen van de juiste informatie. Hoewel het systeem erg goed is, geven de auteurs toe dat het soms moeite kan hebben met zeer complexe vragen die een heen-en-weer denkproces vereisen, wat suggereert dat toekomstige versies nog dynamischer moeten worden. Uiteindelijk laat MPR-CiteG ons zien hoe we AI kunnen bouwen die niet alleen praat, maar ook echt weet waar het over praat en dat kan bewijzen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →