QuCo-RAG: Quantifying Uncertainty from the Pre-training Corpus for Dynamic Retrieval-Augmented Generation
QuCo-RAG introduceert een model-agnostisch dynamisch framework voor retrieval-augmented generation dat hallucinaties mitigeert door onzekerheid te kwantificeren aan de hand van objectieve statistieken uit het pre-training-corpus (entiteitsfrequentie en co-occurrence) via Infini-gram, waarmee aanzienlijke prestatiewinsten worden behaald over diverse modellen en benchmarks zonder te vertrouwen op onbetrouwbare interne modelsignalen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een zeer slimme, goed gelezen vriend (een AI) hebt die graag verhalen vertelt en vragen beantwoordt. Maar soms wordt deze vriend een beetje te zeker van zichzelf en begint hij dingen te verzinnen – bijvoorbeeld door te beweren dat een film geregisseerd werd door iemand die nooit een film heeft gemaakt. Dit noemen we "hallucineren".
Lange tijd probeerden onderzoekers dit op te lossen door de AI te vragen: "Weet je het zeker?" De AI keek dan in zijn eigen brein (zijn interne signalen) en zei: "Ja, ik ben 99% zeker!" Maar het probleem is dat de AI slecht is in het beoordelen van zijn eigen zekerheid. Hij kan 99% zeker zijn van een complete leugen.
Enter QuCo-RAG: De "Fact-Checker" uit de Bibliotheek
De auteurs van dit artikel, QuCo-RAG, besloten te stoppen met vragen of de AI het zeker weet. In plaats daarvan bouwden ze een systeem dat de feiten van de AI controleert tegen een enorme, objectieve bibliotheek van gegevens (het pre-training corpus) voordat de AI zelfs maar zijn zin heeft voltooid.
Denk er zo over:
- Oude manier (Interne signalen): Je vraagt de AI: "Weet je dit?" De AI zegt: "Ik voel me heel zeker!" (Zelfs als het fout is).
- QuCo-RAG manier (Corpus-statistieken): Je vraagt de AI: "Bestaat dit feit in de bibliotheek?" Als de bibliotheek geen record hiervan heeft, zegt het systeem: "Stop! We hebben geen bewijs hiervoor. Laten we het opzoeken in de echte wereld (gegevens ophalen) voordat we het zeggen."
Hoe het werkt: Het tweestapsveiligheidsnet
Het systeem gebruikt een tweestapsproces om leugens op te sporen, met behulp van een supersnel bibliotheekindex genaamd Infini-gram (dat in milliseconden door 4 biljoen woorden kan zoeken).
Stap 1: De "Zeldzaam woord"-controle (Voordat het spreekt)
Voordat de AI begint met antwoorden, scant het systeem de vraag.
- De analogie: Stel je vraagt: "Wie is de president van het kleine eilandnatie Zogblorp?"
- De controle: Het systeem kijkt in de bibliotheek. Als het woord "Zogblorp" maar 5 keer voorkomt in de hele geschiedenis van het menselijk schrijven (lage frequentie), weet het systeem: "Dit is obscuur. De AI weet dit waarschijnlijk niet goed en zal het misschien verzinnen."
- De actie: Het pakt direct een boek (haalt gegevens op) om de AI te helpen het correct te beantwoorden, voordat het zelfs maar begint te praten.
Stap 2: De "Zijn ze ooit samen geweest?"-controle (Tijdens het spreken)
Terwijl de AI zin voor zin een antwoord genereert, let het systeem op wat het zegt.
- De analogie: De AI zegt: "De beroemde chef-kok Gordon Ramsay en de beroemde schilder Van Gogh waren beste vrienden."
- De controle: Het systeem kijkt in de bibliotheek of "Gordon Ramsay" en "Van Gogh" ooit in dezelfde zin of paragraaf samen voorkomen.
- De logica: Als ze nooit samen voorkomen in de hele bibliotheek (nul co-occurrence), is dit een enorm rood vlaggetje. Het is als zeggen "De maan en een broodrooster zijn beste vrienden" – het is mogelijk, maar als niemand er ooit over heeft geschreven, hallucineert de AI waarschijnlijk.
- De actie: Het systeem stopt de AI, zegt: "Wacht, deze twee hangen nooit samen rond in onze boeken", en haalt de juiste informatie op om de zin te corrigeren.
Waarom dit een groot verschil maakt
Het artikel toont aan dat deze methode veel beter werkt dan het vragen aan de AI om zijn eigen gevoelens te controleren.
- Het werkt op "Black Box"-modellen: Zelfs als je niet weet welke boeken de AI heeft gelezen (zoals bij GPT-4 of Llama-3), werkt dit systeem. Het maakt gebruik van het feit dat de meeste AI-modellen vergelijkbare boeken lezen (het internet, Wikipedia, enz.). Dus het controleren van een openbare bibliotheek werkt voor bijna elke slimme AI.
- Het vangt de "Zekere leugenaars": Andere methoden missen vaak wanneer de AI zelfverzekerd fout is. QuCo-RAG vangt ze omdat het niet uitmaakt hoe de AI zich voelt; het geeft alleen om of het feit bestaat in de bibliotheek.
- Het is snel en efficiënt: Het controleert niet elk enkel woord. Het controleert alleen wanneer het een "zeldzaam" woord of een "verdachte" combinatie van feiten ziet. Dit bespaart tijd en geld ten opzichte van methoden die constant alles controleren.
De resultaten
Toen ze dit testten op moeilijke trivia-vragen (zoals "Wie regisseerde deze film en wat is de naam van hun moeder?"), kreeg QuCo-RAG aanzienlijk meer antwoorden goed dan de vorige beste methoden. Het verbeterde de nauwkeurigheid met tot 14 punten, wat een enorme sprong is in de wereld van AI.
Kortom: In plaats van te vertrouwen op het ego van de AI ("Ik weet het zeker!"), vertrouwt QuCo-RAG op de bibliotheek ("Laat me het bewijs zien"). Als het bewijs er niet is, stopt het de AI met dingen verzinnen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.