← Nieuwste papers
💬 NLP

Verifiable by Construction: Claim-Level Evaluation of Verbatim Citation in Clinical Question Answering

Dit artikel evalueert het vermogen van twaalf grote taalmodellen om verifieerbare klinische antwoorden te genereren door letterlijke citaten aan feitelijke beweringen te koppelen, waarbij wordt onthuld dat hoewel de meeste modellen er succesvol in slagen om citaten aan meer dan 90% van de beweringen te koppelen, deze citaten er frequent niet in slagen om de details van de beweringen die ze vergezellen volledig te onderbouwen.

Oorspronkelijke auteurs: Jiashuo Zhang, Yuling Chen, Yvonne Commodore-Mensah, Michael Oberst

Gepubliceerd 2026-09-15
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Jiashuo Zhang, Yuling Chen, Yvonne Commodore-Mensah, Michael Oberst

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

In de hooggestoken wereld van de moderne geneeskunde is tijd vaak de meest schaarse hulpbron. Wanneer een arts wordt geconfronteerd met een complexe patiëntencasus, heeft hij antwoorden nodig die niet alleen accuraat zijn, maar ook direct betrouwbaar. Jarenlang heeft kunstmatige intelligentie beloofd te helpen door enorme hoeveelheden medische literatuur te synthetiseren tot helder, leesbaar advies. Echter, een hardnekkig probleem heeft deze hulpmiddelen overschaduwd: de neiging om feiten te verzinnen, een gebrek dat bekend staat als "hallucinatie". In een vakgebied waar één enkele fout een patiënt schade kan berokkenen, kan een arts niet simpelweg het woord van een computer geloven. Hij moet in staat zijn om de bron van elke bewering te verifiëren. Traditioneel gezien, wanneer een AI een antwoord geeft met een citatie, verwijst die citatie vaak naar een breed document, zoals een volledige medische richtlijn of een wetenschappelijk artikel. Dit dwingt de drukke clinicus om door honderden pagina's te zoeken om de specifieke zin te vinden die de bewering ondersteunt, een proces dat het doel van het hebben van een efficiënte assistent tenietdoet. Het doel is dan ook om systemen te bouwen die niet alleen naar een bron wijzen, maar die hun werk bewijzen door de exacte woorden uit die bron direct naast het antwoord te tonen.

Een team onderzoekers aan de Johns Hopkins University zette zich in om te testen of huidige modellen van kunstmatige intelligentie dit daadwerkelijk konden. Ze bouwden een gespecialiseerd systeem ontworpen om klinische vragen te beantwoorden met behulp van vier belangrijke medische richtlijnen over hartziekten, bloeddruk, cholesterol en diabetes. In plaats van de modellen simpelweg informatie te laten samenvatten, instrueerden de onderzoekers hen om hun antwoorden zin voor zin op te bouwen, waarbij aan elke enkele feitelijke bewering een directe, woordelijk citaat uit de originele richtlijn werd gekoppeld. Om te zien of dit werkte, creëerden ze een rigoureus testkader dat fungeerde als een digitale auditor. Dit systeem brak elk antwoord af in de constituerende claims en controleerde deze tegen drie specifieke standaarden: ten eerste, koppelde het model een citatie aan de claim? Ten tweede, was de bijgevoegde quote een exacte, letterlijke kopie van de tekst in de originele richtlijn, zonder wijzigingen of parafrasering? En ten derde, bevatte die specifieke quote daadwerkelijk genoeg informatie om de claim waar te maken, zonder dat de lezer ergens anders naar hoefde te kijken?

De onderzoekers testten twaalf verschillende grote taalmodellen, variërend van krachtige, complexe systemen tot kleinere, snellere systemen, met behulp van 222 synthetische klinische vragen afgeleid van de richtlijnen. De resultaten onthulden een aanzienlijke kloof tussen wat deze modellen kunnen en wat vereist is voor echte betrouwbaarheid. De meeste geavanceerde modellen waren verrassend goed in de eerste twee stappen. Ze slaagden erin om met meer dan 90 procent van hun claims een citatie toe te voegen, en in veel gevallen waren de door hen geleverde quotes exacte overeenkomsten met de brontekst. Echter, het systeem wankelde dramatisch bij de laatste, meest cruciale stap: het bewijzen van de claim. Hoewel een model een perfecte quote zou kunnen leveren, faalde die quote vaak in het ondersteunen van het volledige gewicht van de bewering die het model had gemaakt. Bijvoorbeeld, een model zou een zin kunnen citeren waarin staat dat een medicijn "geprefereerd" is voor een specifieke groep, maar vervolgens die quote gebruiken om een bredere claim te ondersteunen dat het medicijn voor iedereen "vereist" is. In één opvallend geval slaagde een topmodel genaamd Claude Opus 5 erin om bij 98 procent van zijn claims een letterlijke quote toe te voegen, maar slechts 37,1 procent van die claims werd volledig onderbouwd door de quotes alleen. De quotes waren aanwezig, en ze waren accuraat, maar ze waren onvoldoende om het punt te bewijzen.

De studie benadrukte ook dat de omvang en het type van het model er sterk toe deden. Kleinere, lichtere modellen faalden vaak om überhaupt citaties aan hun claims te koppelen, of ze leverden quotes die geen exacte kopieën van de brontekst waren, waardoor hun verificatiepercentages drast evenredig kelderden. Een van de kleinste geteste modellen, Claude Haiku, slaagde er slechts in om ongeveer 25 procent van zijn claims volledig te ondersteunen. In contrast hiermee presteerden de grootste modellen veel beter, waarbij de beste systemen rond de 75 procent van hun claims ondersteunden met exact, voldoende bewijs. De onderzoekers ontdekten dat de primaire reden voor de mislukking niet was dat de modellen loog of dingen verzinnen, maar eerder dat ze moeite hadden met het selecteren van het juiste bewijs. Ze grepen vaak een quote die gerelateerd was aan het onderwerp, maar die niet de specifieke details bevatte die nodig waren om de gehele zin te onderbouwen. Om te testen of het bewijs daadwerkelijk beschikbaar was, vroegen de onderzoekers een aparte AI om de originele documenten te doorzoeken naar quotes die het claims wél volledig zouden hebben ondersteund. Ze ontdekten dat voor veel modellen het ontbrekende bewijs gewoon aanwezig was in de tekst die ze al hadden gelezen; de modellen faalden simpelweg in het extraheren en bijvoegen van de juiste stukjes.

Uiteindelijk laat dit werk zien dat hoewel kunstmatige intelligentie steeds beter in staat is om medische informatie op te halen en te formatteren, het nog niet klaar is om volledig vertrouwd te worden zonder menselijk toezicht in een klinische setting. Het vermogen om een vloeiend antwoord te genereren is verschillend van het vermogen om een verifieerbaar antwoord op te bouwen. De studie toont aan dat huidige modellen vaak de grondstoffen voor verificatie kunnen leveren, maar dat ze er vaak niet in slagen deze te assembleren tot een compleet, zelfstandig bewijs. De weg vooruit vereist systemen die niet alleen bronnen citeren, maar die ervoor zorgen dat elk woord van hun advies wordt ondersteund door een specifiek, voldoende en ongewijzigd stuk bewijs uit de originele richtlijnen. Totdat modellen consistent de kloof kunnen overbruggen tussen het hebben van een quote en het bewijzen van een punt, zal de verantwoordelijkheid voor verificatie stevig in de handen van de menselijke clinicus blijven.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →