← Nieuwste papers
💬 NLP

Precision Is Not Faithfulness: Coverage-Aware Evaluation of Grounded Generation with a Complete Oracle

Dit artikel introduceert een coverage-aware evaluatiekader voor grounded generatie dat de beperkingen van bestaande precisie-georiënteerde getrouwheidsmetrieken blootlegt door via complete-oracle benchmarks in de Formule 1 en weer-domeinen aan te tonen dat huidige modellen een hoge getrouwheid bereiken door relevante feiten onder te rapporteren, en stelt een verenigde score en een verifier-gestuurde methode voor om zowel precisie als recall te verbeteren.

Oorspronkelijke auteurs: Juan S. Santillana

Gepubliceerd 2026-06-09
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Juan S. Santillana

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Probleem: "Stilte is Goud" (Maar Alleen Halve Waarheid)

Stel je voor dat je een leraar bent die het essay van een leerling beoordeelt. Je hebt een strikte regel: "Elke zin die je schrijft, moet 100% waar zijn."

Als de leerling een essay van 500 woorden schrijft maar één feit fout heeft, zakt hij. Maar hier komt de truc: als de leerling slechts één zin schrijft die waar is, en verder absoluut niets anders zegt, krijgt hij een perfect cijfer van 100%.

Dit is het probleem dat het artikel identificeert bij huidige AI-evaluatietools. Deze tools meten Precisie (hoeveel van de dingen die de AI wel zei, waren waar). Ze belonen de AI voor het extreem voorzichtig te zijn en heel weinig te zeggen. Het is als een leerling die weigert vragen te beantwoorden tenzij hij 100% zeker is, wat resulteert in een blanco toets die op de een of andere manier een "A" krijgt omdat er niets fout op staat.

Het artikel betoogt dat Getrouwheid (Faithfulness — een goede, eerlijke AI zijn) niet alleen moet betekenen "niet liegen". Het moet ook betekenen "niet de belangrijke zaken weglaten."

De Oplossing: Het "Volledige Antwoordblad"

Om dit te bewijzen, hadden de onderzoekers een manier nodig om niet alleen te meten wat de AI goed had, maar ook wat de AI had gemist. Dit wordt Recall genoemd.

Normaal gesproken is dit onmogelijk. Als je een AI vraagt om een verhaal te schrijven over een willekeurige dag in Parijs, hoe weet je dan of het een detail is vergeten? Er is geen "antwoordmodel" voor een creatief verhaal.

De Truc van de Onderzoekers: Formule 1-racerij
De onderzoekers gebruikten Formule 1 (F1) racen-data als hun "antwoordmodel".

  • De Analogie: Denk aan een F1-race als een wiskundeprobleem met één onbetwistbare oplossing. We weten precies welke ronde een coureur de pitstop maakte, welke banden hij gebruikte en wie hij voorbij reed. Er is geen ruimte voor gissen.
  • De "Volledige Oracle": Omdat de data zo precies is, konden de onderzoekers een "Volledig Antwoordblad" maken voor elke beslissing in een race. Ze wisten exact elk enkel feit dat in een perfecte uitleg vermeld moest worden.

Dit stelde hen in staat de AI op twee dingen te beoordelen:

  1. Precisie: Kwamen de feiten die de AI vertelde overeen met het antwoordmodel? (Lügt de AI?)
  2. Recall (Dekking): Werd alle informatie die op het antwoordmodel stond ook vermeld? (Is de AI behulpzaam?)

De Schokkende Ontdekking: De "Slimme" AI was Eigenlijk Lui

De onderzoekers testten de meest geavanceerde AI-modellen ter wereld (zoals Grok, GPT-5 en Gemini) op het uitleggen van F1-racestrategieën.

  • Het Resultaat: Het model met de hoogste "Precisie"-score (degene die nooit loog) was eigenlijk de slechtste in het zijn van behulpzaam.
  • Waarom? Het speelde het veilig. Het zou zeggen: "De coureur pitste op ronde 12." (Waar! 100% score). Maar het zou het feit overslaan dat de coureur overstapte naar harde banden, of dat hij 5 seconden verloor, of dat hij zich verdedigde tegen een rivaal.
  • De Omkering: Wanneer de onderzoekers een straf toevoegden voor het missen van feiten (Recall), veranderden de ranglijsten volledig. De modellen die iets minder "perfect" waren maar veel meer praatgrage en gedetailleerde modellen waren, werden de winnaars.

De Metafoor:
Stel je twee artsen voor die je een diagnose geven.

  • Arts A zegt: "U bent in leven." (100% accuraat, 0% behulpzaam).
  • Arts B zegt: "U heeft een gebroken been, een verstuikte enkel en een hersenschudding. Hier is de behandeling voor elk." (95% accuraat, 100% behulpzaam).

Huidige AI-tools zouden Arts A een perfect cijfer geven en Arts B een lager cijfer omdat Arts B een klein risico nam om op één detail iets minder accuraat te zijn. Dit artikel zegt: Stop met het belonen van Arts A.

De Weertest: Het Gaat Niet Alleen Over Racen

Om er zeker van te zijn dat dit niet slechts een vreemde eigenaardigheid van de F1-data was, testten ze hetzelfde idee op Weerberichten.

  • Ze gaven de AI echte weerdata (temperatuur, wind, kans op regen) en vroegen het om een weervoorspelling te schrijven.
  • Het Resultaat: Hetzelfde gebeurde er. De meest "precieze" AI was degene die het minste zei. De meest "getrouwe" (accuraat + volledig) AI was degene die alle feiten dekte, zelfs als die er een klein foutje in had.

De Oplossing: Een "Verifier" die de AI Stuurt

Het artikel biedt ook een oplossing. In plaats van de AI alleen te vragen om "een verhaal te schrijven", bouwden ze een systeem waarbij:

  1. De AI een conceptversie schrijft.
  2. Een "Verifier" (een strikte controleur) naar het concept kijkt in vergelijking met de data.
  3. De Verifier de AI vertelt: "Je kreeg dit feit goed, maar je vergat de windsnelheid te vermelden, en je loog over de regen."
  4. De AI corrigeert het en probeert het opnieuw.

Deze "Verifier-Guided" methode hielp de AI om zowel accuraat als volledig te worden zonder dat er een mens aan te pas kwam om de tekst te herschrijven.

Samenvatting van de Belangrijkste Punten

  1. Precisie \neq Getrouwheid: Alleen omdat een AI niet liegt, betekent niet dat het een goed werk doet. Als het niets zegt, kan het niet liegen, maar het is nutteloos.
  2. De "Abstention" Valstrik: Huidige AI-benchmarks belonen modellen voor het zwijgen en het vermijden van risico's.
  3. De "Volledige Oracle": Je kunt alleen meten of een AI feiten "mist" als je een perfecte, volledige lijst hebt van wat er zou moeten staan (zoals F1-data of weergegevens).
  4. De Rangschikking-Omkering: Wanneer je zowel nauwkeurigheid als volledigheid meet, verandert de beste AI. De modellen die dapper genoeg zijn om meer te zeggen (en meer feiten te dekken), zijn eigenlijk de beste, zelfs als ze niet perfect zijn.
  5. Taal Maakt Niet Uit: Dit probleem komt in het Engels, Spaans en Portugees evenveel voor.

Kortom: We moeten stoppen met het beoordelen van AI alleen op of ze de waarheid spreken, en beginnen met het beoordelen van of ze de hele waarheid spreken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →