← Nieuwste papers
💻 computer science

Deepchecks: Evaluating Retrieval-Augmented Generation (RAG)

Dit artikel introduceert Deepchecks, een uitgebreid raamwerk dat is ontworpen om de complexe uitdagingen bij het evalueren van Retrieval-Augmented Generation (RAG)-systemen aan te pakken door middel van veelzijdige beoordeling, analyse van de onderliggende oorzaken en productiebewaking om betrouwbaarheid, relevantie en afstemming op applicatiespecifieke vereisten te waarborgen.

Oorspronkelijke auteurs: Assaf Gerner, Netta Madvil, Nadav Barak, Alex Zaikman, Jonatan Liberman, Liron Hamra, Rotem Brazilay, Shay Tsadok, Yaron Friedman, Neal Harow, Noam Bresler, Shir Chorev, Philip Tannor, Lior Rokach

Gepubliceerd 2026-05-15
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Assaf Gerner, Netta Madvil, Nadav Barak, Alex Zaikman, Jonatan Liberman, Liron Hamra, Rotem Brazilay, Shay Tsadok, Yaron Friedman, Neal Harow, Noam Bresler, Shir Chorev, Philip Tannor, Lior Rokach

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme, pratende assistent hebt (een Large Language Model, of LLM). Deze assistent is uitstekend in het schrijven van verhalen en het beantwoorden van vragen, maar heeft een slechte gewoonte: soms verzonnt hij dingen volledig, of geeft hij generieke antwoorden die niet helemaal passen bij de specifieke situatie. Dit is vergelijkbaar met een student die een schoolboek heeft uit het hoofd geleerd, maar vergeten is de specifieke details van de huisvraag te controleren, wat leidt tot zelfverzekerde maar verkeerde antwoorden.

Om dit op te lossen, ontwikkelden ontwikkelaars een systeem genaamd RAG (Retrieval-Augmented Generation). Denk aan RAG als het geven van een bibliotheekpas en een bibliothecaris aan die slimme assistent.

  1. De Bibliothecaris (Retrieval): Voordat de assistent antwoordt, zoekt de bibliothecaris snel in de bibliotheek (een database met documenten) naar de exacte pagina's die relevant zijn voor de vraag.
  2. De Assistent (Generatie): De assistent leest die pagina's en schrijft vervolgens het antwoord, waarbij hij de boeken uit de bibliotheek gebruikt als bron van waarheid.

Het Probleem:
Zelfs met een bibliothecaris kan het systeem nog steeds falen. De bibliothecaris kan de verkeerde boeken halen, of de assistent kan de boeken negeren en toch dingen verzinnen. Het artikel legt uit dat het controleren of dit hele systeem goed werkt, ongelooflijk moeilijk is omdat er zoveel bewegende onderdelen zijn.

De Oplossing: Deepchecks
De auteurs introduceren Deepchecks, dat fungeert als een super-strenge kwaliteitscontrole-inspecteur voor deze RAG-systemen. In plaats van slechts één "slagen/zakken"-cijfer te geven, splitst Deepchecks het systeem op in specifieke "eigenschappen" om te controleren, net zoals een automonteur verschillende onderdelen van een motor controleert.

Hier is hoe Deepchecks het systeem inspecteert, met behulp van eenvoudige analogieën:

1. De Drie Hoofdcontroles (De "Eigenschappen")

Deepchecks kijkt naar drie specifieke dingen om ervoor te zorgen dat het antwoord goed is:

  • Retrieval Relevantie (Heeft de bibliothecaris de juiste boeken gevonden?):
    • Analogie: Als je vraagt: "Hoe bak ik een cake?", mag de bibliothecaris je geen boek geven over "Hoe repareer ik een auto". Deepchecks controleert of de opgehaalde documenten daadwerkelijk nuttig zijn voor de vraag.
  • Gebaseerd op Context (Hield de assistent zich aan de boeken?):
    • Analogie: Dit is de "hallucinatie"-detector. Als het boek zegt dat de cake 2 eieren nodig heeft, maar de assistent zegt 10 eieren, dan vangt Deepchecks die leugen op. Het verifieert dat elk feit in het antwoord daadwerkelijk wordt ondersteund door de documenten die de bibliothecaris vond.
  • Volledigheid (Heeft de assistent de hele vraag beantwoord?):
    • Analogie: Als je vroeg: "Hoe bak ik een cake en op welke temperatuur moet de oven staan?", mag het antwoord niet alleen zeggen "Zet het in de oven". Deepchecks controleert of de assistent alle delen van je verzoek heeft behandeld.

(Er is ook een Veiligheidscontrole om ervoor te zorgen dat de assistent niet onbeleefd is, privé-informatie lekt of iets gevaarlijks zegt.)

2. De "Holistische" Score (Het Eindcijfer)

De meeste tools geven je alleen een lijst met scores voor de bovenstaande onderdelen. Deepchecks gaat een stap verder. Het gebruikt een slim "aggregatiemechanisme" (een geleerde formule) om al die scores te combineren tot één eindcijfer: Positief, Negatief of Onbekend.

  • Positief: De bibliothecaris vond de juiste boeken, en de assistent antwoordde perfect op basis daarvan.
  • Negatief: Er ging iets mis (verkeerde boeken, verzonnen feiten of een onvolledig antwoord).
  • Onbekend: Het was niet vreselijk, maar het haalde de hoge lat voor "perfect" net niet.

3. De Detectivemiddelen (Root Cause Analyse)

Als het systeem een "Negatief" cijfer krijgt, vertelt Deepchecks je niet alleen dat het gefaald heeft; het treedt op als een detective om je te vertellen waarom.

  • Analogie: Stel je voor dat een auto kapot gaat. Een basis monteur zegt: "Het is kapot." Deepchecks zegt: "De motor is prima, maar de banden zijn lek."
  • Dit helpt ontwikkelaars om precies te weten waar het probleem moet worden opgelost: Hebben ze een betere bibliothecaris nodig (betere retrieval)? Of moeten ze de assistent trainen om beter te luisteren (betere generatie)?

4. De "Tijdmachine" (Versievergelijking en Monitoring)

Deepchecks stelt je ook in staat om verschillende versies van je systeem naast elkaar te vergelijken.

  • Analogie: Het is vergelijkbaar met het vergelijken van de prestaties van een auto voor en nadat je de banden hebt vervangen. Hebben de nieuwe banden hem sneller gemaakt?
  • Het houdt het systeem ook in de gaten terwijl het in de echte wereld draait. Als het systeem in de loop van de tijd slechter wordt (misschien omdat de boeken in de bibliotheek zijn veranderd of de vragen van gebruikers), geeft Deepchecks direct een alarm.

Wat het Artikel Vond

De auteurs testten Deepchecks tegen andere populaire tools (zoals RAGAS en LangSmith) met behulp van:

  1. Publieke Datasets: Standaard testvragen die iedereen kent.
  2. Klantdatasets: Wereldwijde voorbeelden van echte bedrijven (zoals technische ondersteuningschats en sollicitantbeoordelingen).

Het Resultaat: Deepchecks was beter in het opsporen van fouten, vooral in de wereldwijde klantdata. Terwijl andere tools soms fouten misten of inconsistente cijfers gaven, was Deepchecks nauwkeuriger in het identificeren van wanneer het systeem loog (hallucineerde) of irrelevante antwoorden gaf.

Samenvattend:
Deepchecks is een uitgebreide toolkit die ervoor zorgt dat je AI-assistent niet alleen zelfverzekerd praat, maar daadwerkelijk de waarheid spreekt op basis van de documenten die je hem hebt gegeven. Het controleert de bibliothecaris, controleert de schrijver, controleert op veiligheid en geeft je een duidelijk rapportblad zodat je precies kunt repareren wat kapot is.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →