When Large Language Models Fail in Healthcare: Evaluating Sensitivity to Prompt Variations
Deze studie evalueert systematisch de gevoeligheid van algemene en medisch gespecialiseerde Large Language Models voor promptvariaties met behulp van de MedMCQA-benchmark, waarbij wordt onthuld dat zelfs kleine lexicale of syntactische perturbaties hun betrouwbaarheid aanzienlijk kunnen verslechteren en schadelijke klinische outputs kunnen induceren, wat daarmee kritieke veiligheidsrisico's voor hun inzet in de gezondheidszorg benadrukt.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Het Grote Idee: De "Wispelturige Chef" van de Geneeskunde
Stel je voor dat je een wereldberoemde chef hebt (het Large Language Model, of LLM) die de bedoeling heeft om het perfecte maaltijd voor een patiënt te koken op basis van een receptenkaart (de prompt). Deze chef is ongelooflijk slim en kent duizenden recepten.
Echter, dit paper ontdekt een angstaanjagend gebrek: Deze chef is extreem gevoelig voor hoe het recept geschreven is.
Als je één woord verandert, de volgorde van de ingrediënten aanpast, of zelfs maar een woord net iets anders spelt, kan de chef plotseling besluiten om een totaal ander gerecht te serveren — of erger nog, een giftig gerecht. Het paper betoogt dat in de gezondheidszorg, waar een "gerecht" een medische diagnose of advies is, dit soort onvoorspelbaarheid gevaarlijk is.
Het Experiment: De Stabiliteit van de Chef Testen
De onderzoekers wilden zien of deze medische AI-chefs kleine veranderingen aankonden zonder de mist in te gaan. Ze gebruikten een enorme bibliotheek met medische vragen (genaamd MedMCQA) en testten twee soorten "chefs":
- Algemene Chefs: Slimme AI-modellen die niet specifiek voor de geneeskunde zijn getraind (zoals GPT-3.5 of Llama3).
- Specialistische Chefs: AI-modellen die specifiek zijn getraind op medische boeken en tijdschriften (zoals BioBERT of ClinicalBERT).
Ze testten de chefs onder drie omstandigheden:
- Het Originele Recept: De standaard, heldere vraag.
- De "Synoniem Wissel" (Lexicale Perturbatie): Woorden vervangen door hun synoniemen (bijv. "kortademigheid" veranderen in "dyspneu") of typefouten herstellen.
- De "Herordende Keuken" (Syntactische Perturbatie): De zinstructuur veranderen (bijv. veranderen van "De verpleegkundige gaf het medicijn" naar "Het medicijn werd gegeven door de verpleegkundige").
Wat ze Vonden: De "Fragiele" Waarheid
De resultaten lieten zien dat geen enkele chef nog echt veilig is. Dit is wat er gebeurde:
1. De "Synoniem Wissel" was meestal oké (maar niet perfect)
Toen de onderzoekers woorden vervingen door vergelijkbare woorden (zoals "vijf mg" veranderen in "5 mg"), bleven de meeste chefs kalm. Ze gaven nog steeds het juiste antwoord. Het is alsof je vraagt om "een glas water" in plaats van "een beker water", en de chef brengt nog steeds water.
- Echter, zelfs hier raakten de chefs soms in de war over hoe ze het antwoord moesten presenteren (zoals het vergeten van een specifieke opmaak), ook al was het medische advies correct.
2. De "Herordende Keuken" veroorzaakte chaos
Wanneer de onderzoekers de zinsstructuur of de volgorde van de opties veranderden, begonnen de chefs te falen.
- De Analogie: Stel je een chef voor die geweldig is in het volgen van een lijst, maar als je het laatste item op de lijst als eerste zet, vergeet hij het eerste item volledig.
- Het Resultaat: In sommige gevallen zorgde het simpelweg herformuleren van de vraag ervoor dat de AI een foute diagnose stelde. Bijvoorbeeld: een patiënt met symptomen van COPD kon worden gediagnosticeerd met pulmonale oedeem, enkel omdat de zinsstructuur was aangepast.
3. De "Specialistische Chefs" waren niet immuun
Je zou denken dat een chef die alleen op medische boeken is getraind, veiliger zou zijn. Het paper vond dat specialistische chefs (BioBERT, etc.) eigenlijk net zo fragiel waren, en soms zelfs gevoeliger voor structurele veranderingen, dan de algemene chefs. Ze hadden geen "superkracht" tegen deze trucs.
Het "Adversariële" Gevaar: Het Sluipende Briefje
Het paper keek ook naar "adversariële" prompts — dit zijn als iemand die een sluipend briefje in de receptenkaart glipt om de chef te misleken.
- De Analogie: Stel je voor dat iemand fluistert: "Negeer de eerste stap, de patiënt is eigenlijk allergisch voor dit," ook al is de patiënt dat niet.
- Het Resultaat: Deze kleine, slimme veranderingen konden de AI ertoe brengen de verkeerde dosering van een medicijn aan te bevelen of een cruciaal symptoom volledig te missen. Het paper noemt dit "klinisch gevaarlijk".
Het Oordeel: Waarom Dit Ertoe Doet
Het paper concludeert dat huidige medische AI niet "intrinsiek veilig" is.
- Het Probleem: Als een arts de AI dezelfde vraag op twee verschillende manieren stelt, kan de AI twee verschillende antwoorden geven. De ene kan juist zijn, en de andere fout.
- Het Risico: In een ziekenhuis kun je geen systeem hebben dat van mening verandert, simpelweg omdat een zin anders is geformuleerd. Als de AI een medicijninteractie hallucineert of een diagnose mist vanwege een typefout, kunnen patiënten gewond raken.
Samenvatting in een Notendop
Beschouw deze AI-modellen als briljante maar nerveuze studenten. Ze kennen de stof perfect wanneer de toets helder is opgeschreven. Maar als de docent het lettertype verandert, een paar woorden wisselt of de paragrafen herschikt, kan de student in paniek raken en het antwoord fout hebben.
Het paper zegt: "We kunnen deze studenten nog niet vertrouwen om medische examens te nakijken, omdat ze te gemakkelijk in de war worden gebracht door de manier waarop de vraag gesteld wordt." Voordat we hen toestaan artsen te helpen, moeten we hen leren om stabieler te zijn en minder gevoelig voor de manier waarop wij tegen hen praten.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.