← Nieuwste papers
💬 NLP

Do No Harm? Hallucination and Actor-Level Abuse in Web-Deployed Medical Large Language Models

Dit artikel presenteert een grootschalige evaluatie van meer dan 6.000 op het web ingezette medische grote taalmodellen, waarbij aanzienlijke risico's op hallucinaties, schendingen van beleidsregels en privacygaten worden blootgelegd, terwijl er tegelijkertijd nieuwe evaluatiekaders en een dataset worden geïntroduceerd om toekomstige veiligheidsverbeteringen te sturen.

Oorspronkelijke auteurs: Sunday Oyinlola Ogundoyin, Muhammad Ikram, Rahat Masood

Gepubliceerd 2026-05-21
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Sunday Oyinlola Ogundoyin, Muhammad Ikram, Rahat Masood

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je de "App Store" van het internet voor AI, maar in plaats van games of productiviteitstools, zit deze vol met duizenden digitale artsen. Dit zijn aangepaste AI-chatbots (genaamd MedGPT's) die iedereen kan bouwen en publiceren om medisch advies te geven, symptomen te diagnosticeren of behandelingen uit te leggen.

Het paper dat je hebt aangeleverd, is als een enorme, undercover gezondheidsinspectie van deze digitale markt. De onderzoekers keken niet alleen naar de best beoordeelde, populaire artsen; ze auditieerden meer dan 6.000 van hen om te zien of ze veilig, eerlijk zijn of daadwerkelijk gevaarlijk.

Hier is wat ze vonden, opgesplitst in eenvoudige concepten:

1. Het probleem van de "Zekere Leugenaar" (Hallucinaties)

Stel je een gids voor die met absolute zekerheid spreekt, maar feiten over geschiedenis verzonnen. In de medische wereld noemen we dit een hallucinatie.

  • De bevinding: Ongeveer 25% tot 30% van deze AI-artsen "liegt" of verzonnen medische feiten. Ze kunnen je er met zekerheid van overtuigen een gevaarlijk medicijn te nemen of een ernstig symptoom te negeren.
  • De draai: Je zou denken dat de populairste artsen het veiligst zijn. Maar de studie vond dat populariteit een slechte leugendetector is. De "beroemde" AI-artsen waren net zo waarschijnlijk aan het verzonnen als de onbekende. Sterker nog, de minder populaire waren vaak nog slechter.
  • Het blinde vlekje van de gebruiker: De onderzoekers vonden dat gebruikers deze leugens niet lijken te merken. Als een AI een vloeiend, zelfverzekerd antwoord geeft, geven mensen het vijf sterren, zelfs als het advies medisch verkeerd is. Het is alsof je een chef-kok vijf sterren geeft die je een eruitziend heerlijke maar giftige maaltijd serveert.

2. Het probleem van de "Slechte Acteur" (Ontwerpmisbruik)

Sommige van deze AI-artsen zijn niet per ongeluk verkeerd; ze zijn ontworpen om risicovol te zijn.

  • De bevinding: Bijna 50% van de AI-artsen had "rode vlaggen" in hoe ze waren gebouwd.
  • De metafoor: Stel je een restaurantuitbater voor die een bord ophangt met de tekst "Wij zijn een ziekenhuis" (hoewel ze dat niet zijn), het menu verbergt en weigert te laten zien waar het eten vandaan komt.
  • De details:
    • Sommige makers noemden hun bots dingen als "Directe Kankerdiagnose" om mensen te misleiden en te laten denken dat ze echte artsen zijn.
    • Veel van deze bots hebben een functie genaamd "Acties" (waarmee ze verbinding kunnen maken met externe websites), maar 57% van hen had geen privacybeleid. Het is alsof je een kliniek binnenloopt waar de arts een bloedstaal van je neemt, maar weigert te vertellen wat ze ermee zullen doen.
    • Zelfs wanneer ze wel een privacybeleid hadden, waren bijna 70% daarvan gebroken, vaag of beschermden ze je gegevens niet daadwerkelijk.

3. De "Open Source" versus "In de winkel gekocht" Showdown

De onderzoekers vergeleken deze in de winkel gekochte AI-artsen ook met "open source"-versies (modellen die ontwikkelaars vrijelijk delen, zoals een gemeenschapsreceptenboek).

  • De in de winkel gekochte (MedGPT's): Deze waren over het algemeen beter in slim en accuraat klinken (ze kregen de feiten vaker goed). Ze waren echter minder stabiel – soms gaven ze een geweldig antwoord, en de volgende keer dat je dezelfde vraag stelde, gaven ze een totaal ander, verwarrend antwoord.
  • De open source: Deze waren consistenter (ze gaven elke keer hetzelfde antwoord), maar ze waren minder accuraat in de feiten.
  • De les: Geen van beide types is perfect. De "fancy" versies klinken beter maar wiebelen; de "gemeenschaps" versies zijn stabiel maar kunnen de details verkeerd hebben.

4. De "Vertrouwenssignalen" zijn kapot

In een normale app-store vermijd je een app als deze slechte reviews of lage ratings heeft.

  • De bevinding: In deze medische AI-winkel vertellen ratings en reviews je niets over veiligheid.
  • De metafoor: Het is als een autohandel waar de auto's met de meeste proefritten en de hoogste "5-sterren" ratings eigenlijk de auto's zijn met defecte remmen. De onderzoekers vonden dat hoe veel mensen met de AI praatten, bijna geen enkele connectie had met of de AI eigenlijk de waarheid sprak.

De conclusie

Het paper concludeert dat we deze AI-artsen niet kunnen vertrouwen alleen omdat ze populair zijn of omdat ze zelfverzekerd klinken.

  • Het systeem is kapot: De huidige manier van controleren van deze bots (vertrouwen op gebruikersreviews en sterrenratings) faalt.
  • Het gevaar: Omdat patiënten vaak geen medische opleiding hebben, kunnen ze niet zien wanneer de AI liegt of wanneer de arts "autoriteit" neerzet.
  • De oplossing: We hebben een nieuw soort "gezondheidsinspecteur" nodig die de feiten van de AI, het ontwerp en de privacyregels controleert voordat het mag praten met patiënten. De onderzoekers hebben een nieuwe dataset en een reeks tools vrijgegeven om deze inspecteurs te helpen bouwen.

Kortom: De digitale medische markt zit vol met zelfverzekerde leugenaars en risicovolle ontwerpen, en de "klantreviews" helpen ons niet om ze op te sporen. We hebben betere veiligheidscontroles nodig voordat we deze AI-artsen in ons leven toelaten.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →