Evaluation of Medical Vision Language Models HuluMed and MedGemma, and general purpose chatbots Gemma 3, ChatGPT Plus, and Claude Pro on real previously unseen wound images
Deze studie evalueert zes vision-language modellen op echte wondafbeeldingen en stelt vast dat algemene systemen zoals ChatGPT en Claude medisch gespecialiseerde modellen aanzienlijk overtreffen bij klinische wondbeoordeling, hoewel alle modellen nog steeds te maken hebben met substantiële beperkingen in autonome betrouwbaarheid.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een groep van zes verschillende "digitale detectives" hebt. Hun taak is om naar foto's van 20 verschillende soorten wonden te kijken (zoals snijwonden, zweren of chirurgische plaatsen) en 12 specifieke vragen te beantwoorden, zoals: "Is dit ontstoken?", "Is er een operatie nodig?" of "Welk type verband moeten we gebruiken?"
De onderzoekers wilden zien welke detective het beste was in het oplossen van deze medische puzzels. Ze lieten twee soorten detectives tegen elkaar strijden:
- De Generalisten: Beroemde, krachtige AI-chatbots (zoals ChatGPT en Claude) die een beetje van alles weten, inclusief geneeskunde.
- De Specialisten: AI-modellen die specifiek voor artsen zijn gebouwd (zoals HuluMed en MedGemma) en die alleen zijn getraind op medische tekstboeken en data.
Dit is wat er gebeurde toen ze de test aflegden:
De Race-resultaten
De Generalisten wonnen de race met een overweldigende voorsprong.
- ChatGPT was de hoogste scorende, met ongeveer 73% van de juiste antwoorden.
- Claude kwam op de tweede plaats met ongeveer 62%.
De Specialisten hadden het aanzienlijk moeilijk.
- HuluMed (de beste uit de specialistische groep) haalde slechts 40% goed.
- De andere medische AI's (MedGemma en Gemma 3) scoorden nog lager, waarbij één van hen minder dan 18% correct had.
Het "Waarom" achter de scores
Het paper legt dit verrassende resultaat uit aan de hand van een paar kernideeën:
1. De "Duizendpoot" versus de "Beperkte Expert"
Beschouw de Generalistische AI's als een Zwitsers zakmes. Ze hebben miljoenen verschillende afbeeldingen en gesprekken gezien. Wanneer ze naar een wond kijken, gebruiken ze hun enorme, brede ervaring om de context te begrijpen.
De Specialistische AI's zijn als een schroevendraaier die alleen ontworpen is voor één specifelijk type schroef. Hoewel ze veel weten over medische termen, lijken ze in de war te raken wanneer ze naar een rommelige, echte foto moeten kijken en moeten beslissen wat ze ermee moeten doen. Het paper suggereert dat het getraind worden op een enorme variëteit aan data hels helpt om deze modellen het "grotere plaatje" beter te laten begrijpen dan wanneer ze alleen met medische data worden getraind.
2. Zien versus Beslissen
De detectives waren goed in het zien van dingen. De meeste van hen konden correct identificeren of een wond er rood uitzag (ontstoken) of dood weefsel (necrose) bevatte.
Echter, ze waren slecht in het beslissen. Wanneer er werd gevraagd: "Moeten we dit wegsnijden?" of "Hebben we een MRI nodig?", gaven de Specialistische AI's vaak vage, aarzelende antwoorden of stelden ze de verkeerde procedure voor.
- Analogie: Het is als een student die een automotor perfect kan beschrijven, maar faalt wanneer hij de vraag krijgt om daadwerkelijk met de auto naar de bestemming te rijden.
**3. Het "Waffelen"-probleem
De onderzoekers gaven de AI's een strikte beoordelingsregel: Je moet een duidelijk "Ja" of "Nee" antwoord geven. Als je zegt: "Het zou ontstoken kunnen zijn, maar misschien ook niet," krijg je nul punten.
De Specialistische AI's hielden van "waffelen" (om het eromheen draaien). Ze zeiden dingen als: "Het is mogelijk dat een interventie nodig is, afhankelijk van de klinische tekenen." Hoewel dit voorzichtig en veilig klinkt, markeerde de test dit als fout omdat het geen duidelijke beslissing was. De Generalistische AI's waren meer direct en zelfverzekerd in hun antwoorden.
De Belangrijkste Conclusie
Het paper concludeert dat, als je op dit moment een AI nodig hebt om naar een foto van een wond te kijken en een arts te helpen een plan te maken, de algemene chatbots momenteel beter zijn dan de medisch-specifieke AI's.
Er zit echter een grote waarschuwing bij dit resultaat. Het paper stelt dat deze AI-tools niet klaar zijn om zelfstandig te werken. Ze zijn als een zeer slimme stagiair die een arts kan helpen bij het ordenen van gedachten, maar ze maken nog steeds fouten. Artsen moeten het werk van de AI altijd controleren voordat ze echte medische beslissingen nemen.
Kortom: De AI's met "algemene kennis" zijn momenteel beter in het oplossen van wondpuzzels dan de AI's met een "medische opleiding", maar geen van beide is nog perfect genoeg om een menselijke arts te vervangen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.