Citation reliability of frontier large language models in medical writing and its automated verification
Deze studie onthult dat hoewel grensverleggende grote taalmodellen een aanzienlijk deel onbetrouwbare medische citaties genereren — voornamelijk door misattributie in plaats van fabricage — een geautomatiseerd Chain-of-Verification-systeem deze fouten met expertise-niveau nauwkeurigheid kan detecteren, wat een levensvatbare oplossing biedt voor het waarborgen van de integriteit van citaties in door AI ondersteunde medische teksten.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van een preprint die niet peer-reviewed is. Dit is geen medisch advies. Neem geen gezondheidsbeslissingen op basis van deze inhoud. Lees de volledige disclaimer
In de moderne medische praktijk is het schrijven van een wetenschappelijk artikel of een reviewartikel een rigoureus proces dat absolute precisie vereist. Auteurs moeten niet alleen complexe medische kennis synthetiseren, maar ook elke bewering verankeren aan een specifieke, bestaande bron van bewijs. Deze bronnen zijn citaties, die fungeren als de voetstappen van wetenschappelijke ontdekking en de lezer terugwijzen naar de oorspronkelijke studies die een nieuw idee ondersteunen. Decennialang was dit proces een menselijke inspanning, waarbij zorgvuldige controle van namen, datums en de titels van tijdschriften nodig was om te waarborgen dat een referentie daadwerkelijk bestaat en zegt wat de auteur beweert dat het zegt. Echter, een nieuw hulpmiddel is de laboratoria en de bibliotheken binnengekomen: het grote taalmodel. Dit zijn krachtige computerprogramma's die getraind zijn op enorme hoeveelheden tekst en die artikelen kunnen opstellen, bevindingen kunnen samenvatten en lijsten met referenties in enkele seconden kunnen genereren. Hoewel ze een belofte bieden van snelheid en efficiëntie, is er een kritische vraag ontstaan: kunnen deze machines erop vertrouwd worden om de juiste voetstappen te vinden, of verzinnen ze er soms ook?
Deze vraag is niet louter academisch; het raakt de kern van de medische integriteit. Als een computer een medische review schrijft en een citatie bevat die echt lijkt, maar verwijst naar de verkeerde studie, of erger nog, naar een studie die nooit heeft bestaan, dan kan het hele argument instorten. Dit fenomeen, bekend als hallucinatie, is een bekende zwakte van eerdere computermodellen geweest. Maar naarmate deze tools geëvolueerd zijn en sneller zijn geworden en uitgerust zijn met de mogelijkheid om in realtime op internet te zoeken, is het onduidelijk geworden of ze eindelijk hebben geleerd om correct te citeren. De medische gemeenschap moet weten of deze nieuwe, geavanceerde modellen betrouwbaar genoeg zijn om voor serieus onderzoek te worden gebruikt, en als dat niet het geval is, of er een praktische manier bestaat om hun fouten te ontdekken voordat ze worden gepubliceerd.
Een team van onderzoekers zette zich met deze vragen bekend door drie van de meest geavanceerde computermodellen een strikte test te onderwerpen. Ze vroegen elk model om een reeks korte medische reviews te schrijven over negen verschillende onderwerpen binnen het vakgebied van de cardiologie, de studie van het hart en de bloedvaten. De onderwerpen varieerden van veelvoorkomende aandoeningen tot zeldzame procedures, waardoor een mix ontstond van onderwerpen met veel gepubliceerde studies en onderwerpen met zeer weinig. Elk model kreeg de instructie om een review van ongeveer 600 tot 900 woorden te schrijven en precies dertig referenties voor elk artikel op te nemen, voor een totaal van 270 reviews en meer dan 8.000 citaties. Cruciaal was dat de onderzoekers de modellen toestonden hun ingebouwde webzoektools te gebruiken, waarmee de manier waarop een gebruiker ze in een echte werkomgeving zou gebruiken, werd gesimuleerd. Het doel was om te zien hoeveel van deze duizenden citaties daadwerkelijk correct waren.
De resultaten onthulden een landschap van aanzienlijke variatie en hardnekkige fouten. Toen de onderzoekers elke citatie controleerden tegen de officiële medische database, ontdekten ze dat de modellen niet perfect waren. Eén model, GPT-5.5, presteerde het best en produceerde problematische citaties in ongeveer 11,5 procent van de gevallen. De andere twee modellen, Claude Opus 4.8 en Gemini 3.5 Flash, maakten echter fouten in bijna 30 procent van hun citaties. Dit betekent dat voor elke tien referenties gegenereerd door de minder nauwkeurige modellen, er ongeveer drie gebrekkig waren. De onderzoekers onderzochten ook of de modellen meer moeite hadden met onderwerpen die minder gepubliceerde studies hadden, uit angst dat een gebrek aan beschikbare informatie de computer zou verwarren. Ze ontdekten dat hoewel de foutpercentages iets lager waren voor onderwerpen met meer literatuur, het verschil niet sterk genoeg was om als een definitieve regel te worden beschouwd. De modellen maakten fouten over de hele linie, ongeacht hoeveel informatie er beschikbaar was over het onderwerp.
Misschien wel de meest onthullende ontdekking was de aard van de fouten zelf. De onderzoekers verwachtten veel gevallen te vinden waarin de computer simpelweg een nepartikel bedacht, een klassieke vorm van hallucinatie. In plaats daarvan ontdekten ze dat de overgrote meerderheid van de fouten veel subtieler was. Ongeveer 77 procent van de problematische citaties waren gevallen van misattributie. In deze gevallen leverde de computer een echte, geldige identificatie voor een echt medisch artikel, maar dat artikel was niet degene die het model beweerde te zijn. Het was alsof de computer een echt boek in een bibliotheek had gevonden, maar het op de verkeerde plank had geplaatst, gelabeld met de titel van een ander boek. Dit type fout is bijzonder gevaarlijk omdat het op het eerste gezicht correct lijkt; een menselijke lezer ziet een geldig nummer en neemt aan dat de referentie betrouwbaar is, om pas later te ontdekken dat de bron de bewering niet ondersteunt. Ware fabricage, waarbij de computer een artikel uitvond dat helemaal niet bestaat, was verrassend zeldzaam en maakte minder dan 1 procent van de fouten uit.
In het besef dat deze subtiele fouten voor mensen moeilijk te ontdekken zijn zonder een systematische controle, testten de onderzoekers een nieuwe methode voor verificatie genaamd Chain-of-Verification. Deze aanpak gebruikt het computermodel zelf, maar op een andere manier. In plaats van het model simpelweg te vragen om referenties op te sommen, breekt het systeem de taak af in een reeks kleine, onafhankelijke vragen. Het vraagt het model om het artikel te vinden op basis van de titel en auteur, vervolgens om te controleren of het tijdschrift en het jaar overeenkomen, en tot slot om te bevestigen dat de identificatie naar het juiste document wijst. Door het model te dwingen elk stukje informatie afzonderlijk te verifiëren tegen de database, in plaats van te vertrouwen op zijn geheugen, kan het systeem zijn eigen fouten ontdekken. Wanneer de onderzoekers deze methode testten tegen een set referenties die zorgvuldig door een menselijke expert waren gecontroleerd, bleek het geautomatiseerde systeem opmerkelijk effectief. Het identificeerde 96,8 procent van de problematische citaties correct, inclusief elk geval van misattributie en fabricage, terwijl het zelden een correcte citatie als fout markeerde.
De studie concludeert dat hoewel de nieuwste generatie medische schrijfinstrumenten krachtig is, ze nog niet klaar zijn om zonder toezicht te worden vertrouwd. De meest voorkomende fout is niet het verzinnen van valse feiten, maar het verkeerd labelen van echte feiten, een fout die een specifieke vorm van controle vereist om te detecteren. De onderzoekers ontdekten dat een geautomatiseerd verificatieproces deze controle kan uitvoeren met een nauwkeurigheid die vergelijkbaar is met die van een menselijke expert. Dit suggereert dat de toekomst van AI-ondersteund medisch schrijven niet een keuze zal zijn tussen mens en machine, maar een partnerschap waarbij de machine de inhoud opstelt en een gespecialiseerd verificatiesysteem ervoor zorgt dat elke citatie naar de waarheid wijst. Totdat een dergelijke verificatie standaardpraktijk wordt, moeten de citaties gegenereerd door deze modellen met voorzichtigheid worden behandeld, aangezien ze lezers naar de verkeerde bron van waarheid kunnen leiden.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.