← Nieuwste papers
🤖 machine learning

Coverage, Not Averages: Semantic Stratification for Trustworthy Retrieval Evaluation

Dit artikel introduceert semantische stratificatie als een betrouwbaarder alternatief voor traditionele evaluatiemethoden, waarbij documenten in interpreteerbare clusters worden gegroepeerd om systematische dekkingstekorten in retrieval-augmented generation (RAG) op te sporen en te corrigeren.

Oorspronkelijke auteurs: Andrew Klearman, Radu Revutchi, Rohin Garg, Rishav Chakravarti, Samuel Marc Denton, Yuan Xue

Gepubliceerd 2026-04-23
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Andrew Klearman, Radu Revutchi, Rohin Garg, Rishav Chakravarti, Samuel Marc Denton, Yuan Xue

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Titel: Waarom "Gemiddelden" Je Bedriegen: Een Nieuwe Manier om Zoekmachines Te Testen

Stel je voor dat je een kok wilt beoordelen op zijn kookkunsten. De huidige manier om dit te doen, is alsof je hem alleen laat koken met pasta. Hij maakt een perfecte pasta, en de jury zegt: "Geweldig! Deze kok is een 10/10!"

Maar wat als die kok in het echt ook vis, soep en desserts moet kunnen maken? Als je hem nooit op die andere gerechten test, weet je niets over zijn echte vaardigheden. Misschien is hij een ramp met vis, maar omdat de test alleen pasta bevatte, zie je dat probleem nooit.

Dit is precies wat er gebeurt met Retrieval-Augmented Generation (RAG) systemen (zoals slimme chatbots die zoeken in grote documenten). De huidige tests gebruiken vaak een lijstje met vragen die niet de hele wereld van kennis dekken. Ze kijken alleen naar het "gemiddelde" resultaat, wat vaak misleidend is.

De auteurs van dit paper zeggen: "Stop met kijken naar het gemiddelde. Kijk naar de dekking!"

Hier is hoe ze dat oplossen, vertaald naar begrijpelijke taal:

1. Het Probleem: De Blinde Vlekken

Stel je een enorme bibliotheek voor met miljoenen boeken over alles: van koken tot quantumfysica, van medische studies tot financiële tips.

  • Huidige tests: Ze kiezen willekeurig vragen uit de bibliotheek, maar ze vallen per ongeluk vaak op dezelfde populaire onderwerpen (bijv. "Hoe maak ik pasta?").
  • Het gevolg: De bibliotheek heeft een hele afdeling met zeldzame boeken over "medische statistieken" of "zeldzame ziektes". Niemand vraagt daar ooit naar in de test. Als de zoekmachine daar faalt, zie je het niet, omdat die afdeling in de testresultaten gewoon "onzichtbaar" is.

De auteurs noemen dit inhoudelijke bias. De test lijkt goed, maar hij test eigenlijk maar een klein stukje van de werkelijkheid.

2. De Oplossing: "Semantische Stratificatie" (Het Kaartspel)

In plaats van willekeurig te vragen, maken de auteurs een kaart van de hele bibliotheek. Ze verdelen alle boeken in duidelijke groepen (strata), zoals:

  • Groep A: Visgerechten
  • Groep B: Desserts
  • Groep C: Medische statistieken
  • Groep D: Financiële adviezen

Vervolgens kijken ze: "Hebben we genoeg vragen voor elke groep?"
Als ze zien dat er geen vragen zijn voor "Medische statistieken", genereren ze speciaal vragen voor die groep. Ze zorgen ervoor dat elk stukje van de kaart wordt getest.

Dit noemen ze Semantische Stratificatie. Het is alsof je een inspecteur bent die niet alleen kijkt of de vloer schoon is (het gemiddelde), maar die elke kamer, elke hoek en elke kast systematisch afloopt om te zien of er stof ligt.

3. Waarom is dit beter? (De Analoge Voorbeelden)

Voorbeeld 1: De Verkeerscontrole

  • Oude manier: Je telt hoeveel auto's er op de snelweg rijden en kijkt naar het gemiddelde aantal ongelukken. Omdat de snelweg altijd vol is, lijkt het veilig.
  • Nieuwe manier: Je kijkt naar specifieke situaties: "Hoe gaat het op de weg bij mist?" of "Hoe gaat het op de weg in de sneeuw?". Misschien is de snelweg veilig, maar in de sneeuw rijden ze allemaal tegen de vangrail. De oude test zag dit nooit; de nieuwe test wel.

Voorbeeld 2: De Schoolrapporten

  • Oude manier: Een leerling krijgt een 7,5 voor "Wiskunde". Dat is het gemiddelde van alle toetsen.
  • Nieuwe manier: Je ziet dat de leerling een 9 heeft voor Algebra, maar een 4 voor Meetkunde. Als je alleen naar het gemiddelde kijkt, denk je dat de leerling alles snapt. Maar als je de "strata" (onderwerpen) apart bekijkt, zie je dat er een groot probleem is met Meetkunde.

4. Wat levert dit op?

Door deze nieuwe methode te gebruiken, ontdekken de auteurs dingen die voorheen verborgen waren:

  1. Verborgen Falen: Ze vinden onderwerpen waar zoekmachines volledig op falen (bijvoorbeeld vragen over zeldzame medische methoden), terwijl de algemene score nog steeds hoog was.
  2. Eerlijke Vergelijking: Je kunt nu twee zoekmachines eerlijk vergelijken. Misschien is Machine A beter in "Financiële vragen" en Machine B beter in "Medische vragen". Met een gemiddelde score zou je denken dat ze gelijk zijn, maar met deze methode zie je precies wie wat goed doet.
  3. Betrouwbare Beslissingen: Bedrijven kunnen nu beter beslissen welke zoekmachine ze moeten kopen, omdat ze weten dat de machine ook werkt in de "donkere hoeken" van hun kennisbank, niet alleen in de populaire gebieden.

Conclusie

De boodschap van dit paper is simpel: Vertrouw niet op het gemiddelde.

Als je wilt weten of een systeem echt goed is, moet je het testen op alles wat er is, niet alleen op wat er makkelijk te vinden is. Door de testvragen te verdelen over alle mogelijke onderwerpen (strata), krijgen we een eerlijk, transparant en betrouwbaar beeld van hoe slim onze AI-systemen echt zijn.

Het is het verschil tussen zeggen: "Deze auto rijdt gemiddeld 100 km/u" (en vergeten dat hij in de modder vastzit) en zeggen: "Deze auto rijdt 100 km/u op de snelweg, maar 0 km/u in de modder, dus hij is niet geschikt voor off-road."

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →