← Nieuwste papers
💻 computer science

Hyperparameter Analysis in Retrieval-Augmented Generation Systems Applied to the Public Prosecutor’s Office of the State of Espírito Santo Corpus

Deze studie maakt gebruik van een Design of Experiments-methodologie om kritieke hyperparameters — specifiek chunking-strategie, contextvolume en LLM-selectie — te analyseren en te optimaliseren binnen een Retrieval-Augmented Generation-systeem dat is afgestemd op het Openbaar Ministerie van Espírito Santo, waarbij wordt aangetoond dat deze factoren de kwaliteit van de respons significant beïnvloeden door middel van statistische analyse met behulp van de Aligned Rank Transform.

Oorspronkelijke auteurs: Heitor Quartezani, Pedro Berger, Alessandro Sarnaglia, Marcelo Guimarães, Giovanni Comarela, Leonardo Rocha, Diego Dias

Gepubliceerd 2026-07-28
📖 7 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Heitor Quartezani, Pedro Berger, Alessandro Sarnaglia, Marcelo Guimarães, Giovanni Comarela, Leonardo Rocha, Diego Dias

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een super-slimme robotvriend hebt die essays kan schrijven, grappen kan vertellen en bijna elke vraag kan beantwoorden die je stelt. Deze robot is als een briljante student die het hele internet heeft gelezen. Maar hier is de crux: deze student heeft een verschrikkelijk geheugen voor feiten. Als je het naar een specifieke wet vraagt, kan hij vol vertrouwen een regel verzinnen die perfect klinkt, maar volkomen nep is. Dit wordt "hallucinatie" genoemd, en dat is een groot probleem wanneer je accurate informatie nodig hebt, zoals in een rechtszaal of een ziekenhuis.

Om dit op te lossen, hebben wetenschappers een slimme truc uitgevonden genaamd Retrieval-Augmented Generation (RAG). Denk aan het geven van een stapel tekstboeken aan je robotvriend vlak voor het examen. In plaats van te gokken vanuit zijn eigen geheugen, zoekt de robot eerst het antwoord op in de boeken, en schrijft dan zijn reactie op basis van alleen wat hij daar heeft gevonden. Het is als een detective die het bewijsmateriaal dossier controleert voordat hij het rapport schrijft. Maar er is een draai aan het verhaal: hoe je die boeken organiseert, maakt uit. Verscheur je de pagina's in kleine snippers? Houd je hele hoofdstukken bij elkaar? En hoeveel pagina's laat je de robot lezen voordat hij begint met schrijven? Als je deze instellingen fout krijgt, mist de robot misschien de cruciale aanwijzing of raakt hij in de war door te veel ruis. Dit is precies de puzzel die een team onderzoekers in Brazilië besloot op te lossen.


Het Dilemma van de Detective: De Machine Afstellen

In de staat Espírito Santo, Brazilië, heeft het Openbaar Ministerie (MPES) een enorme bibliotheek met juridische documenten—duizenden wetten, regels en verordeningen. Jarenlang was het vinden van een specifieke regel een nachtmerrie. Ambtenaren moesten precies weten waar ze moesten kijken, anders kwamen ze vast te zitten. Om te helpen, bouwden ze een virtuele assistent genaamd Fabi (genoemd naar een echte, super deskundige medewerker). Fabi gebruikt de RAG-truc: zij leest de juridische bibliotheek en beantwoordt vragen voor het personeel.

Maar Fabi was niet perfect. Soms miste ze belangrijke details; soms gaf ze vage antwoorden. De onderzoekers, onder leiding van Heitor Quartezani en zijn team, stelden een eenvoudige vraag: Welke instellingen maken Fabi de best mogelijke detective? Ze gokten niet zoma van een idee; ze behandelden het probleem als een gigantisch wetenschappelijk experiment. Ze testten elke combinatie van vier verschillende "knoppen" op het systeem om te zien welke de meest accurate, eerlijke en behulpzame antwoorden produceerde.

Hier zijn de knoppen waar ze aan draaiden en wat ze ontdekten:

1. De "Snij"-strategie (Chunking)

Stel je voor dat je een lang, complex juridisch verhaal hebt. Hoe snijd je het in stukjes om het aan de robot te geven?

  • De Oude Manier (Recursief): Snijd het verhaal in stukken van een vaste grootte, zoals het snijden van een brood in stukjes van 500 tekens. Dit is makkelijk, maar je kunt een zin halverwege doorsnijden, waardoor de betekenis verloren gaat.
  • De Slimme Manier (Semantisch): Snijd het verhaal alleen wanneer het onderwerp verandert. Als de wet overgaat van "vakantieregels" naar "overwerkvergoeding", dan is dat het punt waar je snijdt. Dit houdt de ideeën heel.

De Bevinding: De onderzoekers ontdekten dat de "Slimme Manier" (Semantisch snijden) de duidelijke winnaar was. Specifiek het snijden op basis van het 95ste percentiel van onderwerpveranderingen (wat betekent dat je alleen snijdt wanneer het onderwerp significant verschuift) hield de meeste informatie intact. De "Oude Manier" van het snijden in kleine stukjes van 500 tekens was verschrikkelijk; het brak de juridische logica uit elkaar, waardoor het voor de robot onmogelijk werd om het juiste antwoord te vinden. In juridisch werk kan het missen van één enkel detail rampzalig zijn, dus het heel houden van het verhaal was de belangrijkste factor.

2. De Zoekmethode (Retrieval)

Hoe vindt Fabi de juiste pagina's in de bibliotheek?

  • Vector Search: Dit is alsof je de robot vraagt: "Vind me dingen die voelen als deze vraag." Het is geweldig voor het begrijpen van betekenis, maar kan exacte woorden missen.
  • Lexical Search: Dit is als een klassieke bibliotheekcatalogus. Het zoekt naar exacte woordovereenkomsten. Het is goed voor specifieke termen, maar slecht in het begrijpen van context.
  • Hybrid Search: Dit is het beste van twee werelden. Het gebruikt een speciale wiskundige truc (genaamd Reciprocal Rank Fusion) om de "gevoels"-zoekopdracht en de "exacte woord"-zoekopdracht te combineren.

De Bevinding: De Hybrid Search was de kampioen. Door beide methoden te combineren, kon Fabi de juiste documenten vinden, zelfs als de gebruiker de vraag op een vreemde manier stelde of een zeer specifieke juridische term gebruikte. Alleen de "gevoels"-zoekopdracht was niet genoeg, en de "exacte woord"-zoekopdracht alleen was te rigide. Samen maakten ze het systeem veel betrouwbaarder.

3. Hoeveel Lezen (Top-K)

Wanneer Fabi de beste documenten vindt, hoeveel moet ze dan lezen voordat ze antwoord geeft? Moet ze 5 pagina's lezen? 20?

  • De Bevinding: Hoe meer ze las, hoe beter ze werd—tot op een bepaald punt. Het lezen van 20 documenten gaf de beste resultaten. Het bleek dat het geven van de robot een groter "net" om informatie te vangen hielp om de juiste aanwijzingen te vinden, zelfs als sommige van de extra pagina's een beetje ruis bevatten. De onderzoekers merkten echter op dat na 15 documenten de verbetering in de kwaliteit van het uiteindelijke antwoord niet langer statistisch significant werd. Dus hoewel het lezen van 20 documenten iets beter was, kostte het meer computerkracht. Ze suggereerden dat het systeem in de toekomst een slimmer filter zou kunnen gebruiken om minder pagina's te lezen, maar toch dezelfde geweldige resultaten te behalen.

4. De Breinkracht (Keuze van LLM)

Ten slotte testten ze twee verschillende "hersenen" voor Fabi: de enorme, superintelligente gpt-4o en de kleinere, snellere gpt-4o-mini.

  • De Verrassing: Je zou denken dat het grotere, duurdere brein zou winnen. Maar het kleinere gpt-4o-mini presteerde eigenlijk net zo goed, en soms zelfs beter!
  • Waarom? Het gigantische brein was zo slim dat het soms probeerde te creatief te zijn. Wanneer de robot 20 documenten las, begon het grote brein ideeën te mengen of de tekst te overinterpreteren, wat leidde tot kleine fouten. Het kleinere brein was echter gehoorzamer. Het hield zich strikt aan de verstrekte tekst en extraheerde de feiten zonder er een eigen "smaakje" aan toe te voegen. Voor een juridische assistent die precisie nodig heeft, was een beetje letterlijker zijn eigenlijk een superkracht.

Het Eindoordeel

De onderzoekers hebben niet zomaar wat geraden; ze hebben 3.840 verschillende experimenten uitgevoerd (dat zijn 96 verschillende instellingen getest tegen 40 verschillende vragen) en geavanceerde wiskunde gebruikt om hun resultaten te bewijzen.

Ze concludeerden dat om de beste juridische assistent te bouwen:

  1. Snijd de documenten op onderwerp, niet op vaste grootte.
  2. Gebruik een Hybrid Search die betekenis en exacte woorden combineert.
  3. Lees ongeveer 20 documenten om te garanderen dat er niets gemist wordt.
  4. Gebruik het kleinere, goedkopere AI-model (gpt-4o-mini) omdat het instructies strikter opvolgt en minder fouten maakt.

Deze studie is belangrijk omdat het verder gaat dan "laten we dit proberen en kijken wat er gebeurt." Het gebruikt strikte wetenschap om ons precies te vertellen hoe we deze krachtige tools moeten afstemmen, zodat ze niet alleen slim klinken, maar ook daadwerkelijk slim en betrouwbaar zijn. Voor het Openbaar Ministerie betekent dit dat Fabi hen nu helpt om de juiste wetten sneller en met minder fouten te vinden, waardoor het juridische systeem beter werkt voor iedereen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →