← Nieuwste papers
💬 NLP

Automating Multi-Hop RAG Evaluation via TRIAD: From Context Extraction to Validated Dataset Generation

Dit artikel introduceert TRIAD, een driefasig geautomatiseerd framework dat domeinspecifieke multi-hop vraag-antwoorddatasets genereert en valideert met relevantie-gelabelde contexten om Retrieval-Augmented Generation (RAG)-systemen op propriëtaire data effectief te evalueren.

Oorspronkelijke auteurs: Lorenz Brehme, Adam Jatowt

Gepubliceerd 2026-08-25
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Lorenz Brehme, Adam Jatowt

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

In de snel evoluerende wereld van kunstmatige intelligentie is een veelvoorkomende uitdaging het aanleren van computers om vragen te beantwoorden met behulp van een enorme bibliotheek aan documenten die ze nog nooit eerder hebben gezien. Stel je een bibliothecaris voor die direct het juiste boek kan vinden voor elke zoekopdracht, maar soms vereist het antwoord het lezen van drie verschillende boeken en het leggen van de verbanden tussen hen. Dit is de kerntaak van een systeem dat bekend staat als retrieval-augmented generation (verrijkte generatie door middel van informatie-extractie). Deze systemen werken door eerst een collectie teksten te doorzoeken om relevante informatie te vinden, en vervolgens een krachtig taalmodel te gebruiken om die informatie te synthetiseren tot een duidelijk antwoord. Hoewel deze hulpmiddelen essentieel worden voor bedrijven die met hun eigen privédata werken, blijft er een grote hindernis: hoe test je of ze daadwerkelijk goed werken? Hiervoor hebben experts een reeks vragen nodig met bekende juiste antwoorden, maar het handmatig maken van deze vragen is traag, duur en moeilijk aan te passen aan specifieke sectoren.

Onderzoekers Lorenz Brehme en Adam Jatowt van de Universiteit van Innsbruck hebben een nieuwe methode ontwikkeld genaamd TRIAD om dit probleem op te lossen. Hun aanpak automatiseert de creatie van complexe, meerstapsvragen die zijn afgestemd op elke specifieke collectie documenten die een bedrijf zou kunnen gebruiken. In plaats van te vertrouwen op menselijke experts om duizenden vragen te schrijven, gebruikt TRIAD kunstmatige intelligentie om ze te genereren, de kwaliteit te controleren en ze voor te bereiden voor testen. Het systeem is ontworpen om vragen te creëren die niet beantwoord kunnen worden door slechts naar één document te kijken; ze vereisen dat de computer tussen verschillende stukken informatie springt, net zoals een detective die aanwijzingen uit afzonderlijke dossiers verbindt om een zaak op te lossen. De onderzoekers ontdekten dat deze geautomatiseerde methode vragen van hoge kwaliteit produceert die effectief zijn in het blootleggen van de sterke en zwakke punten van verschillende AI-systemen, waarbij ze vergelijkbare prestatietrends laten zien als de beste door mensen gemaakte tests die momenteel beschikbaar zijn, zelfs als de absolute scores iets lager liggen.

Het proces begint bij de generatiefase, waarbij het systeem een startdocument selecteert uit de bibliotheek van een gebruiker en vervolgens andere documenten vindt die nauw aan dit document verwant zijn. De AI zoekt vervolgens naar een gemeenschappelijk thema dat deze documenten met elkaar verbindt, wat als een brug fungeert. Zododig deze verbinding is vastgesteld, formuleert het systeem een vraag die informatie uit alle gekoppelde documenten vereist om te kunnen worden beantwoord. Het kan bijvoorbeeld vragen om een vergelijking tussen twee entiteiten die in verschillende teksten worden gevonden, of het kan een reeks stappen vereisen waarbij het antwoord op het eerste deel van de vraag de sleutel vormt tot het tweede deel. Om de vragen robuust te maken, creëert het systeem ook "onbeantwoordbare" vragen, waarbij de benodigde informatie geheel ontbreekt in de bibliotheek. Dit test of de AI met vertrouwen een antwoord verzint of correct toegeeft dat het het antwoord niet weet.

Zodra een vraag is gecreëerd, gaat deze een strikte validatiefase binnen. Hier treedt een tweede AI op als rechter, die de vraag kritisch onderzoekt om te garanderen dat het antwoord daadwerkelijk aanwezig is in de verstrekte documenten en dat de vraag echt meerdere stappen vereist om op te lossen. Als de vraag beantwoord kan worden door naar slechts één document te kijken, wordt deze afgewezen als te eenvoudig. Als het antwoord fout is of de logica gebrekkig is, stuurt het systeem de vraag terug voor revisie. Deze feedbackloop gaat door totdat de vraag aan hoge kwaliteitsnormen voldoet. De onderzoekers vonden dat dit proces zeer effectief was; na het genereren van honderden vragen werden ongeveer 66 tot 68 procent geaccepteerd als geldig, en van de vragen die werden afgewezen, werd de overgrote meerderheid correct als gebrekkig geïdentificeerd. Menselijke beoordelaars die een steekproef van de definitieve vragen controleerden, bevestigden dat meer dan 90 procent beantwoordbaar, correct en vereiste de beoogde meerstapsredenering.

De laatste stap omvat het voorbereiden van de dataset voor testen. Het systeem voegt extra documenten toe die irrelevant zijn voor de vraag, die fungeren als afleidingen om te zien of de AI ze kan negeren en de juiste informatie kan vinden. Het wijst ook een moeilijkheidsgraad toe op basis van hoeveel relevante documenten nodig zijn om het puzzelstukje op te lossen. Om te bewijzen dat hun methode werkt, testten de onderzoekers zeven verschillende configuraties van AI-systemen met de vragen die zij hadden gegenereerd. Ze vergeleken de resultaten met gevestigde, door mensen gemaakte benchmarks zoals HotpotQA en MuSiQue. De bevindingen lieten zien dat de AI-systemen iets beter presteerden op de nieuwe vragen dan op de oude, maar dat de relatieve trends identiek waren. Systemen die goed presteerden op de traditionele tests, presteerden ook goed op de nieuwe, en systemen die worstelden met het ene type vraag, worstelden ook met het andere type. Dit suggereert dat de geautomatiseerde methode succesvol de uitdagingen van door mensen gemaakte tests vastlegt.

Een van de meest significante aspecten van dit werk is de capaciteit om onbeantwoordbare vragen te behandelen. In de experimenten testten de onderzoekers hoe vaak de AI-systemen hallucineerden, of een antwoord verzonnen wanneer de informatie niet in de bibliotheek aanwezig was. De resultaten toonden aan dat de meeste systemen correct identificeerden dat de vraag niet beantwoord kon worden, met detectiepercentages die boven de 99 procent uitkwamen voor sommige modellen. Dit is een cruciale capaciteit voor praktische toepassingen, waarbij een systeem moet weten wanneer het moet stoppen en moet zeggen dat het het niet weet, in plaats van valse zekerheid te bieden. De onderzoekers merkten ook op dat de gegenereerde vragen niet beperkt waren tot een specifiek onderwerp of bron; ze konden worden aangepast aan elke collectie documenten, van medische dossiers tot juridische contracten.

De studie concludeert dat TRIAD een praktische en betrouwbare manier biedt om evaluatiedatasets te bouwen voor gespecialiseerde AI-systemen zonder de zware kosten van handmatige creatie. Hoewel de onderzoekers erkennen dat hun methode steunt op dezelfde onderliggende technologie die de systemen die getest worden aandrijft, en dat de vragen iets gemakkelijker te vinden kunnen zijn dan die in door mensen gemaakte sets, is de consistentie van de resultaten over verschillende opstellingen heen geruststellend. De aanpak claimt niet volledig de menselijke oordeelsvorming te vervangen, maar biedt een solide fundament voor het testen en verbeteren van AI-systemen in de specifieke domeinen waar ze het hardst nodig zijn. Door de creatie van deze complexe testen te automatiseren, opent de methode de deur naar een meer rigoureuze en frequente evaluatie van kunstmatige intelligentie in sectoren waar nauwkeurigheid van groot belang is.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →