← Nieuwste papers
💻 computer science

Polish Medical Visual Question Answering: Vision-Language Models Underutilize Visual Evidence

Dit artikel introduceert een Poolse benchmark voor medische visuele vraagbeantwoording afgeleid van specialisatie-examens en onthult dat huidige visie-taalmodellen visueel bewijs onderbenutten, waarbij ze vaak meer vertrouwen op tekstuele aanwijzingen en antwoordopties dan op de werkelijke afbeeldingen om de taken op te lossen.

Oorspronkelijke auteurs: Jakub Pokrywka, Łukasz Grzybowski, Antoni Lasik, Marek Kubis, Jeremi Ignacy Kaczmarek, Wojciech Kusa

Gepubliceerd 2026-08-14
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Jakub Pokrywka, Łukasz Grzybowski, Antoni Lasik, Marek Kubis, Jeremi Ignacy Kaczmarek, Wojciech Kusa

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot probeert te leren hoe hij een dokter moet zijn. Je zou hem niet alleen een stapel tekstboeken geven; je zou hem ook röntgenfoto's, krabbels van hartmonitoren en foto's van huiduitslag moeten laten zien. Dit is de wereld van Vision-Language Models (VLM's). Denk aan deze modellen als superintelligente studenten die zowel een medisch tekstboek kunnen lezen als tegelijkertijd naar een foto van een gebroken bot kunnen kijken. Ze zijn bedoeld om te combineren wat ze zien met wat ze weten om ingewikkelde vragen te beantwoorden. Maar hier is de grote zorg: wat als de robot gewoon een "bedrieger" is? Wat als hij de afbeelding volledig negeert en het antwoord raadt door simpelweg de meerkeuzeopties of de tekstuele beschrijving te lezen, zoals een student die de antwoorden op het examen uit zijn hoofd heeft geleerd zonder de stof daadwerkelijk te hebben bestudeerd? Dit artikel duikt in precies die vraag, en vraagt zich af of onze AI-dokters echt naar het bewijs kijken of alleen maar de aanwijzingen scannen.

De onderzoekers achter deze studie besloten de Poolse medische AI onder de ultieme test te stellen. Ze bouwden een speciaal examen met echte vragen uit de Poolse Board Certification Examination, de zware test die echte artsen en tandartsen moeten halen om specialist te worden. Ze namen 2ễ6 van deze vragen die afbeeldingen bevatten — zoals CT-scans, hartgolfgrafieken en klinische foto's — en vroegen verschillende AI-modellen om ze op te lossen. Ze creëerden ook een controlegroep met alleen tekstuele vragen om te zien hoe de modellen presteerden zonder enige afbeeldingen.

Dit is wat ze vonden, en het is een beetje een plotwending. Het beste AI-model slaagde erin om ongeveer 79,0% van de antwoorden goed te hebben op de volledige beeldgebaseerde test. Dat klinkt indrukwekkend, maar wanneer ze het vergeleken met echte menselijke artsen die hetzelfde examen aflegden, scoorden de mensen rond de 70,14%. Dus één specifiek commercieel AI-model (GPT-5.6) versloeg de mensen, maar bijna alle andere geteste modellen presteerden slechter dan een menselijke arts zou doen.

Maar de echte magie gebeurde toen de onderzoekers begonnen met "verstoppertje spelen" met de informatie. Ze testten de modellen in verschillende scenario's:

  1. Alleen de keuzes: Ze gaven de AI alleen de vijf mogelijke antwoorden (A, B, C, D, E) en geen vraag of afbeelding. Verrassend genoeg raadden de modellen nog steeds vaker correct dan bij toeval (wat 20% zou zijn).
  2. Alleen tekst: Ze gaven de vraag en de keuzes, maar verborgen de afbeelding.
  3. Alleen afbeelding: Ze gaven de afbeelding en de keuzes, maar verborgen de tekst van de vraag.

De resultaten lieten zien dat de modellen tekst prioriteit geven boven afbeeldingen bij het verwerken van informatie. Wanneer ze moesten kiezen tussen het lezen van de tekst of het bekijken van de afbeelding, leunden ze zwaar op de tekst. Sterker nog, de modellen presteerden beter wanneer de afbeelding ontbrak (maar de tekst aanwezig was) dan wanneer de tekst ontbrak (maar de afbeelding aanwezig was). Dit suggereert dat de AI voor deze specifieke medische vragen meer vertrouwt op de woorden dan op het visuele bewijs.

Ze brachten de vragen ook in kaart op basis van hoeveel de afbeelding ertoe deed. Sommige vragen hadden afbeeldingen die slechts ter decoratie dienden (zoals een grafiek die herhaalde wat de tekst al zei), terwijl andere "beeld-dominant" waren, wat betekent dat je de foto absoluut moest bekijken om het op te lossen. De modellen hadden de meeste moeite met de beeld-dominante vragen. Zelfs wanneer ze de volledige afbeelding en de volledige tekst hadden, behaalden ze minder goede resultaten bij die vragen dan bij de vragen waarbij de tekst al het zware werk deed.

De auteurs suggereren dat dit gebeurt omdat de modellen hebben geleerd om patronen in de antwoordopties of de tekstbeschrijvingen te herkennen die fungeren als afkortingen, waardoor ze correct kunnen raden zonder echt het medische probleem te "zien". Het is als een student die opmerkt dat het langste antwoord meestal het juiste is, en dus gewoon de langste optie kiest zonder de vraag te lezen.

Uiteindelijk zegt dit artikel niet dat AI nutteloos is voor de geneeskunde, maar het luidt wel een serieus alarm. Het suggereert dat wanneer deze modellen hoge scores halen op medische examens, ze misschien niet bewijzen dat ze het visuele bewijs zo goed begrijpen als we hopen. Ze zijn misschien gewoon heel goed in het lezen van de kleine lettertjes. De onderzoekers waarschuwen dat in de echte wereld, waar een arts daadwerkelijk een tumor op een scan of een huiduitslag op de huid moet kunnen zien, het vertrouwen op een AI die de afbeelding negeert gevaarlijk kan zijn. De studie concludeert dat hoewel AI slimmer wordt, we er zeker van moeten zijn dat het ook daadwerkelijk naar het bewijs kijkt, en niet alleen gokt op basis van de aanwijzingen in de tekst.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →