Vector RAG vs LLM-Compiled Wiki: A Preregistered Comparison on a Small Multi-Domain Research
Deze vooraf geregistreerde studie die Vector RAG en door LLM samengestelde wiki's vergelijkt voor multidisciplinair onderzoekssynthese, concludeert dat wiki's uitblinken in verbanden tussen papers en citatieondersteuning op claimniveau, terwijl RAG kosteneffectiever is voor het opzoeken van enkele feiten, wat aantoont dat geen enkele architectuur optimaal een evenwicht vindt tussen bewijsorganisatie, citatieaccuraatheid en operationele kosten.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een enorme bibliotheek hebt van 24 onderzoeksartikelen over onderwerpen zoals AI-ethiek, klimaatverandering en geneeskunde. Je wilt een superintelligente AI-assistent vragen stellen die het lezen van alle deze artikelen vereisen en het leggen van verbanden tussen hen.
Het artikel vergelijkt twee verschillende manieren om deze AI-assistent te bouwen:
Het "Vector RAG"-systeem (De bibliothecaris met een zaklamp): Dit systeem werkt als een bibliothecaris die, wanneer je een vraag stelt, direct naar de rekken rent, een paar specifieke pagina's (chunks) pakt die relevant lijken, en deze aan de AI geeft om een antwoord te schrijven. Het is snel en goedkoop, maar het ziet alleen de specifieke pagina's die het pakte. Als het antwoord ideeën uit drie verschillende boeken moet verbinden, kan de bibliothecaris het verband missen.
De "LLM-gecompileerde Wiki" (De encyclopedie-schrijver): Voordat je zelfs maar een vraag stelt, neemt dit systeem alle 24 artikelen en laat een mensachtige AI ze herschrijven tot één grote, onderling gekoppelde encyclopedie in Wikipedia-stijl. Wanneer je een vraag stelt, kijkt de AI niet naar de ruwe artikelen; het bladeren door deze vooraf geschreven encyclopedie. Het idee is dat omdat de encyclopedie al georganiseerd en verbonden is, de AI een veel beter, meer gesynthetiseerd antwoord kan geven.
De Grote Wedstrijd: Wat gebeurde er?
De onderzoekers stelden een eerlijke, blinde test op waarbij beide systemen dezelfde 13 moeilijke vragen beantwoordden. Hier is wat ze vonden, met gebruikmaking van eenvoudige analogieën:
1. De "Grootte van het Geheel"-test (Verbanden leggen)
De Verwachting: De Wiki zou naar verwachting makkelijk winnen in het verbinden van ideeën uit verschillende artikelen.
Het Resultaat: De Wiki won wel, maar niet zo veel als gehoopt. Het was geweldig in het weven van een verenigd verhaal. De onderzoekers vonden echter een "cheat code" voor de Bibliothecaris (RAG): als je de Bibliothecaris vertelt om de grote vraag op te splitsen in kleinere deelvragen en voor elk afzonderlijk te zoeken, haalt de Bibliothecaris de Wiki bijna volledig in.
De Les: Het voordeel van de Wiki in "verbanden leggen" komt vooral voort uit hoe het de zoekopdracht opsplitst, niet alleen uit het feit dat het een vooraf geschreven boek is.
2. De "Fact-check"-test (Hebben ze gelogen?)
De Verwachting: De Wiki zou punten kunnen verliezen omdat het herschrijven van artikelen tot een wiki de feiten per ongeluk kan veranderen (zoals het spel "Telefoon").
Het Resultaat: Verrassend genoeg was de Wiki eigenlijk beter in het onderbouwen van specifieke claims met bewijs. Wanneer de Wiki zei "Feit X is waar", wees het op een pagina die duidelijk die zin bevatte. De Bibliothecaris (RAG) pakte echter vaak een pagina die dichtbij het feit zat, waarna de AI een klein detail "hallucineerde" of een getal verkeerd las.
De Twist: Het standaard scoresysteem (dat het hele antwoord bekeek) dacht dat de Bibliothecaris beter was omdat zijn antwoorden korter waren en exacte tekst citeerden. Maar toen de onderzoekers elke afzonderlijke zin individueel bekeken, was de Wiki nauwkeuriger in zijn specifieke citaten.
3. De "Kosten"-test (Wie is goedkoper?)
De Verwachting: De Wiki zou duur moeten zijn om te bouwen (het schrijven van de encyclopedie kost tijd) maar goedkoop om later te gebruiken (bladeren door een boek is snel).
Het Resultaat: Hier faalde de Wiki hard. Hoewel het vooraf was gebouwd, vereiste het vragen aan de AI om door de Wiki te bladeren dat het veel meer tekst las dan de Bibliothecaris.
De Analogie: Stel je voor dat de Bibliothecaris je 5 pagina's notities brengt. Het Wiki-systeem brengt je een boek van 200 pagina's, vraagt je om 150 pagina's ervan te lezen, en schrijft vervolgens een samenvatting.
De Wiskunde: De Wiki kostte ongeveer 21 keer meer per vraag dan de Bibliothecaris. Het idee dat "vooruitbetalen later geld bespaart" werkte hier niet; de gebruiker betaalde elke keer dat hij een vraag stelde een enorme premie.
Het Uitspraak
Het artikel concludeert dat er geen "perfect" systeem is. Het is een drieweg-compromis:
De Bibliothecaris (Single-Round RAG): Het beste als het je gaat om geld besparen en je gewoon snel een enkel feit wilt vinden.
De "Slimme" Bibliothecaris (Decomposed RAG): Als je de vraag opsplitst in delen, wordt deze versie bijna even goed in "verbanden leggen" als de Wiki, maar tegen veel lagere kosten (ongeveer 3,4 keer goedkoper dan de Wiki).
De Wiki: Het beste als je wilt dat de AI zeer nauwkeurig specifieke claims citeert en je niet om de hoge kosten geeft. Het is echter erg duur om te draaien.
De Conclusie: Je kunt niet alles hebben. Je kunt een systeem hebben dat goedkoop is, één dat ideeën goed verbindt, of één dat bewijs perfect citeert, maar in dit experiment was geen enkel systeem het beste in alle drie. Het "Wiki"-idee is geen wondermiddel; het verschuift het probleem alleen van "de juiste pagina's vinden" naar "een enorme rekening betalen voor het lezen van te veel tekst."
Technische Samenvatting: Vector RAG versus LLM-gecompileerde Wiki
Probleemstelling
Het artikel adresseert een lacune in kwantitatieve vergelijkingen tussen twee verschillende architecturen voor het beantwoorden van vragen over een onderzoekscorpus: Vector RAG (Retrieval-Augmented Generation) en LLM-gecompileerde Wiki's. Hoewel informele commentaren (bijvoorbeeld Andrej Karpathy's "agentic markdown wiki") suggereren dat het compileren van onderzoek tot een onderling gekoppelde wiki tijdens het innameproces superieure synthese over meerdere papers en kostenamortisatie kan bieden, was er nog geen vooraf geregistreerde, directe kwantitatieve vergelijking met standaard chunk-vector RAG gepubliceerd.
De studie onderzoekt drie specifieke trade-offs:
Synthese: Verbindt de wiki-architectuur bevindingen over meerdere papers beter?
Fideliteit: Verslechtert het proces van het herschrijven van papers tot wiki-pagina's de bronfideliteit of de gronding bij de oorspronkelijke bron?
Kosten: Leidt de voorafgaande kosten van het bouwen van een wiki tot goedkopere query-tijdskosten, waardoor een break-even punt ontstaat na een bepaald aantal vragen?
Methodologie
De studie is een vooraf geregistreerde, geblindeerde vergelijking door twee rechters, uitgevoerd op een vast corpus van 24 peer-reviewed papers over drie domeinen (AI-ethiek & recht, klimaatwetenschap, precisiegeneeskunde).
Vergelijkde Systemen:
Vector RAG: Een single-round retrieve-then-generate-pijplijn. Het maakt gebruik van documentbewust markdown-chunking, multi-query-uitbreiding, hybride retrieval (dicht + spaarzaam), Cohere-reranking en CRAG-geïnspireerde correctieve validatie. Het voert geen retrieval uit tijdens de generatie.
LLM Wiki: Een offline compilatieproces waarbij een LLM papers omzet in een persistente, onderling gekoppelde markdown-wiki (entiteiten, concepten, bronnen). Tijdens de query-tijd browst een tool-gebruikende agent door deze wiki (pagina's opsommen, inhoud lezen) om antwoorden te genereren.
Modellen: Beide systemen gebruikten Claude Opus 4.7 (xhigh) voor antwoordgeneratie.
Beoordeling: Antwoorden werden gescoord door GPT-5.4 (primair) en Gemini 2.5 Pro (inter-rater betrouwbaarheid) met een geblindeerde, gerandomiseerde volgorde.
Rubriek: Vier criteria van 1–10: groundedness (claims leiden terug naar de bron), structural_integrity (geünificeerd verhaal), conflict_awareness en inter_paper_mapping (multi-hop synthese).
Hypothese:
H1 (Synthese): Wiki > RAG met ≥2,0 punten op synthescriteria voor multi-hop/emergentie-vragen.
H2 (Point-Source): RAG ≥ Wiki op groundedness voor bias-check-vragen.
H3 (Kosten): Wiki innamekosten > RAG innamekosten EN Wiki querykosten < RAG querykosten.
Belangrijkste Bijdragen
Vooraf Geregistreerde Vergelijking: De eerste kwantitatieve, geblindeerde vergelijking van een LLM-gecompileerde wiki met vector RAG.
Vindingen Evaluatiemethodologie: Toonde aan dat LLM-rechters zich verschillend gedragen op basis van de concretiteit van de rubriek. Rechters kwamen nauwkeurig overeen op inter_paper_mapping (concrete definitie), maar vertoonden significante "ceiling-judge"-drift op holistische criteria zoals structural_integrity, waarbij één rechter (Gemini) frequent scores nabij 10/10 voor de wiki verzadigde.
Exploratieve Decompositie-Ablatie: Een post-hoc analyse van een Decomposition-RAG-variant (het opdelen van vragen in deelvragen) om te isoleren of het voordeel van de wiki voortkomt uit retrieval-coverage of representatie-uitlijning.
Resultaten
1. Synthese en Organisatie (H1)
Wiki-voordeel: De wiki presteerde significant beter dan single-round RAG op inter_paper_mapping (synthese over papers), en haalde de vooraf geregistreerde drempel (+6,625 versus +2,0).
Organisatie: Het voordeel in structural_integrity was zwakker na aanpassing voor Inter-Rater Betrouwbaarheid (IRR) (+1,625), net onder de +2,0-drempel.
Decompositie-effect: Een op decompositie gebaseerde RAG-variant herstelde ongeveer 88% van het synthese-voordeel van de wiki, waardoor de kloof onder de geregistreerde drempel daalde. Dit suggereert dat het synthese-voordeel van de wiki grotendeels te wijten is aan betere retrieval-coverage over documenten heen, wat kan worden verzacht door queries in RAG te decomponeren.
2. Groundedness en Fideliteit (H2)
Rubriekscore: RAG voldeed aan de vooraf geregistreerde test voor single-fact grounding op de bias-check-tier (RAG > Wiki), waardoor H2 werd vervuld.
Claim-niveau Analyse (Post-hoc): Een granulaire analyse van atomaire claims onthulde een omkering in mechanisme. Hoewel RAG hoger scoorde op de holistische rubriek, waren de door de wiki geciteerde claims ongeveer 2x zo waarschijnlijk strikt ondersteund door de aangehaalde tekst en ongeveer 4–5x minder waarschijnlijk niet-ondersteund in vergelijking met RAG.
Interpretatie: RAG neigt een chunk op te halen en vervolgens daarbuiten te synthetiseren/extrapoleren (wat leidt tot holistische coherentie maar lagere strikte uitlijning). De wiki positioneert bewijs vooraf in "claim-vormige" artefacten, wat leidt tot een hogere citatieprecisie, hoewel dit geen garantie biedt voor de fideliteit van het originele PDF (aangezien de wiki zelf een compilatie is).
3. Kostenasymmetrie (H3)
Querykosten: Het verwachte kostenvoordeel voor de wiki faalde volledig. De wiki verbruikte 21x meer tokens per query dan RAG (1,65 miljoen versus 78.000 tokens).
Amortisatie: Omdat de kosten per query hoger zijn, is het "break-even"-punt voor het amortiseren van de innamekosten wiskundig onmogelijk (negatieve N). De kostenintuïtie dat "voorafgaande compilatie een vergoeding betaalt voor goedkopere queries" werd weerlegd onder de geteste opstelling.
Innamekosten: De ratio van innamekosten kon niet worden beoordeeld vanwege een probleem met prompt-caching-accounting in de telemetrie (aggregatie van gecachte en niet-gecacheerde tokens), maar het resultaat aan de query-zijde alleen weerlegt de conjunctieve H3-hypothese.
4. Decomposition-RAG Ablatie
Synthese: Decomp-RAG dichte de synthese-kloof met de wiki, maar tegen een 3,4x hogere LLM-tokenkost dan single-round RAG (hoewel nog steeds 3,4x goedkoper dan de wiki).
Citatie-uitlijning: Decomp-RAG herstelde niet het voordeel van de wiki in claim-voor-claim citatie-ondersteuning (19,2% ondersteund versus 40,2% voor de wiki). Dit geeft aan dat retrieval-coverage en representatie-uitlijning gescheiden mechanismen zijn.
Betekenis en Conclusies
Het artikel concludeert dat gegronde onderzoekssynthese geen enkele capaciteit is. Geen enkele architectuur excelleerde in alle drie de dimensies: organisatie, citatie-uitlijning en kosten.
Single-Round RAG: Het beste voor op kosten gevoelige, point-source retrieval.
Decomposition-RAG: Een haalbaar middenpad voor synthese over meerdere papers waar structuur belangrijk is, en biedt ongeveer 88% van het synthese-voordeel van de wiki voor een fractie van de querykosten, hoewel het nog steeds achterblijft in strikte citatie-uitlijning.
LLM Wiki: Superieur voor evidence-artifact claim-citatie-uitlijning (de aangehaalde pagina ondersteunt de claim direct), maar tegen een prohibitieve per-query tokenkost (~21x RAG) en met afwachtende validatie van bronfideliteit.
De studie benadrukt dat evaluaties synthese-structuur, claim-citatie-uitlijning en kosten apart moeten rapporteren in plaats van ze te laten samenvallen in één "groundedness"-oordeel. De bevindingen benadrukken ook de kwetsbaarheid van LLM-as-judge-evaluaties op holistische criteria, wat suggereert dat concrete operationele definities noodzakelijk zijn voor betrouwbare inter-rechterovereenstemming. Toekomstig werk is nodig om de wiki-bronfideliteit te valideren tegen originele PDF's en om hybride architecturen te verkennen die iteratieve retrieval combineren met claim-gegronde citatie-reparatie.