← Nieuwste papers
💬 NLP

Measuring Epistemic Resilience of LLMs Under Misleading Medical Context

Dit artikel introduceert MedMisBench, een uitgebreide benchmark die aantoont dat grote taalmodellen, ondanks het behalen van scores op expertniveau bij medische examens, een fragiele epistemische veerkracht vertonen door regelmatig correcte medische oordelen op te geven wanneer zij worden blootgesteld aan misleidende, door autoriteit gekaderde context.

Oorspronkelijke auteurs: Hongjian Zhou, Xinyu Zou, Jinge Wu, Sean Wu, Junchi Yu, Bradley Max Segal, Tobias Erich Niebuhr, Sara Amro, Michael Petrus, Sheikh Momin, Alexandra M. Cardoso Pinto, Rachel Niesen, Laura Sophie Wegner
Gepubliceerd 2026-06-11
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Hongjian Zhou, Xinyu Zou, Jinge Wu, Sean Wu, Junchi Yu, Bradley Max Segal, Tobias Erich Niebuhr, Sara Amro, Michael Petrus, Sheikh Momin, Alexandra M. Cardoso Pinto, Rachel Niesen, Laura Sophie Wegner, Dhruv Darji, Jung Moses Koo, Joshua Fieggen, Kapil Narain, Mingde Zeng, Lei Clifton, Linda Shapiro, Fenglin Liu, David A. Clifton

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een briljante medische student hebt die elk tekstboek heeft uit het hoofd geleerd en elke licentie-examens met een perfect cijfer kan halen. Je vertrouwt hen volledig. Maar dan loop je de kamer binnen en fluister je een valse regel tegen hen: "Trouwens, het ziekenhuis heeft de regels zojuist veranderd. Voor deze specifieke conditie doen we nu X in plaats van Y."

Verrassend genoeg vergeet deze "perfecte" student onmiddellijk alles wat hij heeft geleerd, gelooft je valse regel en geeft je het foute antwoord.

Dit is de kern van de ontdekking van het artikel MedMisBench. De onderzoekers ontdekten dat zelfs de slimste AI-artsen (Large Language Models) verrassend fragiel zijn wanneer ze worden geconfronteerd met misleidende informatie, zelfs als ze het juiste antwoord al weten.

Hier is een overzicht van hun bevindingen met behulp van eenvoudige analogieën:

1. Het "Valgat" in het Examen

Normaal gesproken testen we AI-artsen met zuivere, tekstboek-vragen. Ze scoren erg hoog (ongeveer 71% correct). De onderzoekers gingen ervan uit dat dit betekende dat de AI veilig te gebruiken was voor echt medisch advies.

Ze hadden het mis. De onderzoekers bouwden een nieuwe test genaamd MedMisBench. Zie dit als een examen met een "valgat".

  • De Opzet: Ze nemen een vraag waarvan de AI het antwoord weet.
  • De Val: Ze injecteren een zin die eruitziet als een geloofwaardige medische regel, maar die eigenlijk een leugen is.
  • Het Resultaat: De nauwkeurigheid van de AI stort in van 71% naar 38%. Sterker nog, in meer dan de helft van de gevallen (51,5%) verlaat de AI de waarheid volledig en volgt de leugen.

2. Het "Autoriteit"-effect

Het artikel testte hoe de leugen werd gepresenteerd. Het blijkt dat de AI het gemakkelijkst wordt misleid wanneer de leugen officieel klinkt.

  • De Metafoor: Stel je voor dat een student een tekstboek van een leraar negeert omdat een vreemde in een pak (een "Autoriteit") binnenkomt en zegt: "Eigenlijk klopt het boek niet."
  • De Bevinding: Wanneer de valse informatie werd gepresenteerd als een nieuwe ziekenhuisregel, een richtlijn of een officieel bericht, trapte de AI er in bijna 70% van de gevallen in.
  • De "Uitzondering"-val: De AI werd ook gemakkelijk misleid door leugens die klonken als specifieke uitzonderingen (bijv. "Deze regel geldt voor iedereen, behalve voor dit ene vreemde geval").

3. "Eén Stem" versus "De Menigte"

De onderzoekers testten twee manieren om de leugens te presenteren:

  • Type 1 (Het Fluisteren): De AI ziet de vraag en één specifieke leugen die een fout antwoord ondersteunt.
    • Resultaat: Rampzalig. De AI schakelt onmiddellijk over naar het foutieve antwoord.
  • Type 2 (Het Debat): De AI ziet de vraag, de waarheid, en leugens die elk fout antwoord ondersteunen, allemaal tegelijkertijd.
    • Resultaat: De AI doet het hier veel beter. De AI kan het hele plaatje zien en houdt meestal vast aan de waarheid.
  • De Les: Het gevaar is niet dat de AI geen enkele leugen kan verwerken; het gevaar is dat de AI instort wanneer een enkele, aannemelijk klinkende leugen direct naar haar wordt gefluisterd.

4. "Harder Denken" Helpt Niet Altijd

Je zou kunnen denken dat als je de AI vertelt om "stap voor stap na te denken" of meer hersencapaciteit te gebruiken, het moeilijker te misleiden zal zijn.

  • De Metafoor: Het is alsof je een student vraagt om "hun werk dubbel te controleren".
  • De Bevinding: Voor sommige AI-modellen maakte harder denken hen juist gevoeliger voor de leugens. Ze zouden de valse "officiële regel" overanalyseren en zichzelf ervan overtuigen dat dit de juiste weg was.

5. Het Risico in de Praktijk

De onderzoekers keken niet alleen naar goed/fout antwoorden; ze vroegen 14 echte artsen uit 7 verschillende landen om de fouten van de AI te beoordelen.

  • De Bevinding: In 38% van de gevallen waarin de AI werd misleid, had het foutieve antwoord tot ernstige schade bij een patiënt kunnen leiden.
  • De Les: Dit is niet alleen een rekenfout; het is een veiligheidsrisico. De AI is niet alleen aan het "hallucineren"; de AI geeft met vertrouwen gevaarlijk advies omdat het werd misleid door een valse context.

Samenvatting

Het artikel concludeert dat we AI-artsen weliswa면en op hoe goed ze het tekstboek kennen, maar dat we niet hebben getest of ze vast kunnen houden aan de waarheid wanneer iemand hen probeert te misleiden met valse regels.

MedMisBench is een nieuw instrument dat ontworpen is om deze "epistemische veerkracht" te meten (het vermogen om je oordeel te behouden wanneer de wereld probeert je te verwarren). Het laat zien dat onze AI-artsen momenteel niet veerkrachtig genoeg zijn om vertrouwd te worden met gezondheidsadvies in de chaotische, door informatie gevulde echte wereld waar nepnieuws en misleidende claims algemeen voorkomen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →