← Nieuwste papers
💬 NLP

How important is Recall for Measuring Retrieval Quality?

Dit artikel adresseert de uitdaging van het meten van de kwaliteit van informatiezoekopdrachten in realistische situaties waarin het totale aantal relevante documenten onbekend is, door bestaande strategieën te evalueren aan de hand van door LLM's gegenereerde oordelen over antwoorden en door een nieuwe, effectieve maatstaf voor te stellen die geen kennis vereist van de volledige recall-set.

Oorspronkelijke auteurs: Shelly Schwartz, Oleg Vasilyev, Randy Sawaya

Gepubliceerd 2026-05-08
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Shelly Schwartz, Oleg Vasilyev, Randy Sawaya

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een chef-kok bent die probeert een perfecte maaltijd (het LLM-antwoord) te bereiden voor een klant. Om dit te doen, stuur je een sous-chef (het Retrieval-systeem) naar de voorraadkast (de Kennisbank) om een specifieke lijst met ingrediënten (documenten) te halen die zullen helpen bij het beantwoorden van de vraag van de klant.

Het probleem? Je weet niet precies hoeveel totale ingrediënten er in de hele voorraadkast zijn die kunnen nuttig zijn. Je weet alleen wat de sous-chef in de mand terugbracht.

Dit artikel stelt een simpele vraag: Hoe weten we of de sous-chef goed werk heeft geleverd, als we het totale aantal goede ingrediënten dat beschikbaar is, niet kennen?

De Oude Manier versus de Nieuwe Manier

De Oude Manier (de "F-Maatstaf"):
Traditioneel had je, om de sous-chef te beoordelen, het totale aantal perfecte ingrediënten in de hele voorraadkast (NpN_p) nodig.

  • Precisie: Hebde de chef voornamelijk goede spullen gepakt?
  • Recall: Hebde de chef alle beschikbare goede spullen gepakt?
  • Het Probleem: In een echte, rommelige voorraadkast kun je niet elk enkel goed ingrediënt tellen. Je kent het totale aantal niet. Je kunt dus geen "Recall" berekenen, en zonder die is de traditionele beoordeling (F-maatstaf) onmogelijk nauwkeurig te berekenen.

De Nieuwe Manier (de "T-Maatstaf"):
De auteurs stellen een nieuw, eenvoudiger beoordelingssysteem voor dat T heet.

  • In plaats van te vragen: "Heb je alles gevonden?" (wat je niet kunt weten), vraagt T: "Heb je een goede mix van nuttige spullen meegebracht en voorkomen dat je te veel onzin meebracht?"
  • Het kijkt alleen naar de mand die de chef terugbracht (de top KK documenten). Het weegt hoeveel goede items erin zitten versus hoeveel slechte items erin zitten.
  • De Analogie: Stel je voor dat je een student beoordeelt op een toets. De oude manier vereist dat je het totale aantal vragen op het hele examen kent om hun score te berekenen. De nieuwe manier (T) kijkt gewoon naar de antwoorden die ze op het ingeleverde blad hebben geschreven en beoordeelt ze op basis van hoeveel er goed versus fout waren, zonder dat je de totale omvang van het examen hoeft te kennen.

Wat Ze Dedden

De onderzoekers richtten een enorm experiment op:

  1. De Testkeuken: Ze gebruikten verschillende "voorraadkasten" (datasets zoals ArXiv-wetenschappelijke papers, HotpotQA en MSMARCO).
  2. De Sous-chefs: Ze gebruikten verschillende AI-tools (Embedding-modellen) om de ingrediënten te kiezen.
  3. De Hoofdkok: Ze gebruikten een krachtige AI (LLM) om de maaltijd daadwerkelijk te bereiden (een antwoord te genereren) met de ingrediënten die de sous-chef bracht.
  4. De Proeverij: Ze vergeleken de bereide maaltijd met een "Perfecte Maaltijd" (gemaakt met alle mogelijke goede ingrediënten) en gaven het een score van 1 tot 5.

Vervolgens controleerden ze: Kwam de nieuwe "T"-beoordeling beter overeen met de Proeverij-score dan de oude "F"-beoordeling of andere beoordelingen?

De Bevindingen (De "Proeverij"-Resultaten)

  1. De "T"-Score is een Uitstekend Vervanger:
    De nieuwe "T"-maatstaf werkt bijna even goed als de oude "F"-maatstaf, zelfs al hoeft "T" het totale aantal ingrediënten in de voorraadkast niet te kennen. Het is een praktisch, makkelijk te gebruiken hulpmiddel voor situaties in de echte wereld waar je geen volledige kaart van de voorraadkast hebt.

  2. De Volgorde Maakt Uit (De "nDCG"-Verrassing):
    Er was een andere maatstaf genaamd nDCG die om de volgorde van de ingrediënten geeft (bijvoorbeeld: plaatste de chef de beste specerijen bovenaan in de mand?).

    • Resultaat: Voor simpele ingrediënten (zoals korte zinnen) maakte de volgorde niet veel uit. Maar voor complexe, moeilijke ingrediënten (zoals dichte wetenschappelijke papers) werd de volgorde zeer belangrijk. Als de chef het beste spul bovenaan zette, bereidde de AI-chef een betere maaltijd. In deze specifieke, moeilijke gevallen was nDCG soms beter dan de anderen.
  3. De "Schatting"-Truc:
    Ze probeerden een middenweg-methode: het totale aantal ingrediënten schatten door naar de eerste 2 manden te kijken die de chef bracht. Verrassend genoeg werkte deze "schattting" soms beter dan het kennen van het exacte totale aantal.

    • Waarom? De ingrediënten die de chef eerst vond (in de top 2 manden) waren waarschijnlijk de belangrijkste voor de AI-chef. Die verderop in de lijst waren minder kritiek. Het tellen van de "beste" was dus eigenlijk nuttiger dan het tellen van de "totale" hoeveelheid.
  4. De Verhouding is Sleutel:
    De belangrijkste factor was niet welk gereedschap de sous-chef gebruikte, maar de verhouding tussen de mandgrootte en het totale aantal goede ingrediënten.

    • Als de mand te klein is, mist de AI-chef belangrijke info.
    • Als de mand te vol zit met onzin, raakt de AI-chef in de war.
    • Er is een "sweet spot" waar de mandgrootte overeenkomt met de complexiteit van de taak.

De Conclusie

In een wereld waar we niet elk enkel relevant document in een enorme database kunnen tellen, hoef je het totale aantal niet te kennen om de kwaliteit van de retrievals te beoordelen.

De auteurs suggereren het gebruik van de eenvoudige "T"-maatstaf. Het negeert het onbekende totaal, richt zich op de kwaliteit van de specifieke batch opgehaalde documenten en correleert zeer goed met hoe goed een AI daadwerkelijk de vraag beantwoordt. Het is een praktisch, "goed genoeg" liniaal voor een rommelige, echte keuken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →