← Nieuwste papers
💬 NLP

Hearsay: Vision-Language Medical Diagnoses Without an Image

Dit artikel으로 toont aan dat grensverleggende visuele taalmodellen systematisch gestructureerde medische diagnoses verzinnen op basis van enkel patiëntendemografie wanneer er geen afbeelding wordt verstrekt, wat duidelijke, niet-willekeurige foutmodi bij verschillende modellen onthult en de kritieke noodzaak benadrukt om gestructureerde outputs te auditeren en woordgevoeligheid te onderzoeken bij klinische implementaties.

Oorspronkelijke auteurs: Siddharth Vohra

Gepubliceerd 2026-07-30
📖 1 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Siddharth Vohra

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Technische Samenvatting: Hearsay: Visuele-Taal Medische Diagnoses Zonder een Afbeelding

Probleemstelling

Dit artikel onderzoekt een kritieke foutmodus in frontier Vision-Language Models (VLM's) binnen klinische pijplijnen: het "mirage effect" (het mirage-effect). Dit fenomeen treedt op wanneer een VLM visuele beschrijvingen en medische diagnoses genereert ondanks de afwezigheid van een bijgevoegde afbeelding. Hoewel eerder werk door Asadi et al. [1] vaststelde dat VLM's vaak niet in staat zijn om in dergelijke condities te weigeren, richt deze studie zich op een gat in het begrip van de structuur van deze hallucinaties. Specifiek onderzoekt het artikel of de gefabriceerde diagnoses willekeurig zijn of systematisch worden beïnvloed door de demografische beschrijvers die in de prompt worden gegeven (bijv. leeftijd, geslacht, ras) wanneer er geen afbeelding aanwezig is. De auteurs stellen dat klinische pijplijnen scenario's kunnen tegenkomen waarin afbeeldingen niet kunnen worden opgehaald of waarbij agenten alleen patiëntbeschrijvingen doorgeven, wat een omgeving met een hoog risico creëert voor demografische bias in gefabriceerde outputs.

Methodologie

De studie maakt gebruik van een gecontroleerd experimenteel ontwerp over drie frontier VLM's: Claude Opus 4.7, GPT-5.4 en Gemini 3.1 Pro.

  • Prompt Design: De auteurs maken gebruik van een aangepaste mirage-mode prompt template afgeleid van Asadi et al. [1]. De prompt bevat een demografische inleiding in de eerste persoon (bijv. "Ik ben een {leeftijd}-jarige {ras} {geslacht}") gevolgd door een verzoek om een afbeelding te beschrijven en een diagnose te stellen. De geteste modaliteiten zijn borstfoto (chest X-ray), hersen-MRI (brain MRI) en dermatologie (specifiek "huidmoedervlek" of "skin mole").
  • Experimentele Condities: Er is een 2×2×32 \times 2 \times 3 factorieel ontwerp gebruikt, waarbij variatie werd aangebracht in leeftijd (32, 65), geslacht (man, vrouw) en ras (wit, zwart, bruin), wat resulteerde in 12 demografische cellen plus een neutrale baseline (D0) zonder demografische tekst.
  • Output Schema: De reacties werden gedwongen in een strikt JSON-schema met velden voor de aanwezigheid van een afbeelding, diagnostisch vermogen, primaire diagnose, differentiaaldiagnoses, vertrouwen en redenering. Dit maakte de scheiding mogelijk tussen "proza" (redenering) en "gestructureerde" (diagnoseveld) outputs.
  • Metrieken: De primaire metriek is de Jensen-Shannon Divergentie (JSD) tussen de distributie van diagnoses in demografische cellen versus de neutrale baseline. Secundaire analyses omvatten "hedged mirage" detectie (waarbij het proza de ontbrekende afbeelding erkent maar het gestructureerde veld wordt ingevuld) en "probe-noun robustness" (het vervangen van "skin mole" door "skin lesion").
  • Schaal: Het primaire experiment (E1) omvatte 11.700 API-oproepen (3 modellen×3 domeinen×13 condities×100 seeds3 \text{ modellen} \times 3 \text{ domeinen} \times 13 \text{ condities} \times 100 \text{ seeds}).

Belangrijkste Bijdragen

Het artikel presenteert vier primaire bijdragen:

  1. Gestructureerde Demografische Bias: Bewijs dat mirage-mode outputs niet willekeurig zijn maar systematisch gestructureerd worden door demografische tekst. Per-cel JSD's bereikten tot wel 0,83, waarbij de top-diagnoses overeenkwamen met gedocumenteerde klinische biaspatronen (bijv. Sarcoïdose voor zwarte patiënten, Melanoom voor oudere witte mannen).
  2. Het Hedged Mirage Regime: De identificatie van een dissociatie waarbij de proza van het model de ontbrekende afbeelding erkent (wat duidt op een weigering), terwijl het gestructureerde diagnoseveld toch wordt ingevuld met een specifieke ziekte. Deze "hedged" staat verklaart 66% van de fabricaties van Claude in high-JSD cellen en blijft onzichtbaar voor audits die enkel op proza gebaseerd zijn.
  3. Diverse Foutmodi: Een analyse van de robuustheid van de "probe-noun" onthulde dat mirage een familie is van verschillende foutmodi. De dermatologie-effect van Claude was woord-getriggerd (het vervangen van "skin mole" door "skin lesion" veroorzaakte een daling van 94% in Melanoma-diagnoses naar 100% weigering), terwijl het effect van GPT-5.4 categorie-behoudend was (diagnoses bleven stabiel ondanks de vervanging van het zelfstandig naamwoord).
  4. Dual-Channel Meting: Een pijplijn die native JSON-schema's extraheert naast proza-analyse, waardoor het "hedged regime" direct observeerbaar en kwantificeerbaar wordt.

Resultaten

  • Demografische Structurering: Alle drie de modellen vertoonden demografische bias, zij het met variërende magnitudes.
    • GPT-5.4 fabriceerde diagnoses in 36/36 factoriële cellen. De bias was breed, met een sterke verschuiving naar Sarcoïdose voor jonge zwarte patiënten bij borstfoto's en specifieke ziekteverschuivingen voor MRI op basis van leeftijd en geslacht (bijv. Meningioom voor oudere vrouwen, Glioom voor oudere mannen).
    • Claude Opus 4.7 vertoonde een "weigering-naar-fabricatie" transitie. Het weigerde de meeste neutrale prompts, maar fabriceerde zwaar in specifieke cellen (bijv. 94% Melanoma voor een 65-jarige witte man met een "skin mole"). De JSD werd bijna volledig gedreven door deze transitie van weigering naar fabricatie.
    • Gemini 3.1 Pro vertoonde de laagste magnitudes (mediaan JSD 0,010), waarbij de meeste cellen 0% fabricatie lieten zien.
  • Het Hedged Regime: In de "hedged" conditie schreven modellen redeneringen zoals "vermoedelijk, gebaseerd op demografie en klassiek patroon" terwijl ze nog steeds het gestructureerde diagnoseveld invulden. Een audit die enkel op proza is gebaseerd, zou deze als weigeringen of veilig markeren, terwijl een pijplijn met gestructureerde data een bevooroordeelde diagnose zou ontvangen.
  • Robuustheid: De "skin mole" versus "skin lesion" swap toonde aan dat de bias van Claude fragiel was en afhankelijk van specifieke triggerwoorden, terwijl de bias van GPT-5.4 robuust was tegen veranderingen in formulering.
  • Signaal versus Ruis: Het demografische signaal (JSD) overtrof de parafrase-ruisvloer (ratio's van 10,5x tot 13,9x) aanzienlijk, wat bevestigt dat de bias wordt gedreven door demografische beschrijvers in plaats van oppervlakkige variaties in formulering.

Betekenis en Claims

Het artikel betoogt dat betrouwbare inzet van VLM's in klinische settings een fundamentele verschuiving in auditpraktijken vereist.

  • Beperkingen van Audits: Vertrouwen op enkel natuurlijke taal (proza) audits is onvoldoende omdat het het "hedged regime" mist, waar gestructureerde velden worden ingevuld ondanks tekstuele disclaimers.
  • Evaluatiedimensies: Probe-word sensitiviteit moet worden behandeld als een "first-class evaluatiedimensie". Modellen kunnen robuust lijken als ze met één enkel probe-woord worden getest, terwijl ze catastrofaal falen met lichte variaties (zoals gezien bij Claude), of vice versa.
  • Aard van de Fout: De auteurs maken onderscheid tussen twee fouten: (1) Epistemische miskalibratie (het uitgeven van een diagnose zonder bewijs) en (2) Demografische verschuiving (de specifieke uitgegeven diagnose op basis van demografie). Hoewel het artikel niet expliciet ontrafelt of deze verschuivingen voortkomen uit pretraining-bias of gekalibreerde prevalentie-priors (bijv. hogere incidentie van melanoom bij oudere witte mannen), stelt het dat de dissociatie tussen proza en gestructureerde output een kritieke foutmodus is, ongeacht de oorsprong van de prior.

De studie concludeert dat het mitigeren van deze risico's schema-niveau beperkingen vereist (bijv. het forceren van null-diagnoses wanneer image_present=false), probing tijdens de inferentie, en fine-tuning om te weigeren wanneer afbeeldingen ontbreken. De bevindingen suggereren dat mirage niet een monolithisch fenomeen is, maar een familie van foutmodi die verschillende mitigatiestrategieën vereist.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →