← Nieuwste papers
💻 computer science

Towards Selection of Large Multimodal Models as Engines for Burned-in Protected Health Information Detection in Medical Images

Dit artikel evalueert drie grote multimodale modellen (GPT-4o, Gemini 2.5 Flash en Qwen 2.5 7B) voor het detecteren van beschermde gezondheidsinformatie in medische afbeeldingen en stelt vast dat, hoewel ze traditionele OCR overtreffen bij tekstextractie, hun algehele winst in detectienauwkeurigheid het meest significant is voor complexe afdrukpatronen in plaats van duidelijk leesbare tekst, wat leidt tot op maat gemaakte selectieaanbevelingen en een schaalbare implementatiestrategie.

Oorspronkelijke auteurs: Tuan Truong, Guillermo Jimenez Perez, Pedro Osorio, Matthias Lenga

Gepubliceerd 2026-05-22
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Tuan Truong, Guillermo Jimenez Perez, Pedro Osorio, Matthias Lenga

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een stapel oude medische röntgenfoto's of scans hebt. Verborgen in deze afbeeldingen zitten kleine "stempels" of "watermerken" (zoals data, patiëntnamen of ID-nummers) die direct op de afbeelding zijn gebrand. Als je deze afbeeldingen wilt delen voor onderzoek of onderwijs, moet je die stempels eerst wissen om de privacy van de patiënt te beschermen. Dit heet het vinden en verwijderen van PHI (Protected Health Information).

Lange tijd gebruikten artsen en technische teams een tweestaps-robotproces om dit te doen:

  1. De Scanner: Een gespecialiseerd hulpmiddel (OCR genoemd) dat de afbeelding bekijkt en probeert de tekst te lezen als een zeer snelle typist.
  2. De Editor: Een slim computerprogramma dat leest wat de typist heeft geschreven en beslist: "Is dit een geheim patiëntennaam? Ja, verwijder het. Is dit gewoon een datum voor het ziekenhuis? Nee, behoud het."

Het Nieuwe Idee: De "Super-Leser"

De auteurs van dit artikel vroegen zich af: Wat als we de "Editor" vervangen door een Super-Leser?

Deze Super-Lesers zijn Grote Multimodale Modellen (LMM's) – denk aan hen als ongelooflijk slimme AI-assistenten (zoals GPT-4o, Gemini of Qwen) die tegelijkertijd naar een afbeelding kunnen kijken, de context begrijpen en de tekst lezen. Ze zijn als een menselijk expert die naar een wazige notitie kan kijken en zeggen: "Ah, daar staat 'Jan Janssen', en dat is zeker een patiëntennaam."

De onderzoekers testten drie verschillende Super-Lesers om te zien of ze een betere baan konden doen dan het oude "Scanner + Editor"-team. Ze stelden twee verschillende manieren in om de test uit te voeren:

  • Opstelling A (Het Traditionele Team): Gebruik de oude, snelle "Scanner" om de tekst te lezen, stuur die tekst vervolgens naar de Super-Leser om te beslissen wat er moet worden verwijderd.
  • Opstelling B (Het Alles-in-Één Team): Stuur de ruwe afbeeldingsuitsneden direct naar de Super-Leser en vraag het om zowel het lezen als het beslissen te doen.

Wat Ze Vonden (De Resultaten)

1. De Super-Lesers zijn Geweldig in Lezen (Soms)
Wanneer de tekst op de afbeeldingen rommelig, wazig of moeilijk te zien was, waren de Super-Lesers (vooral de grote, krachtige modellen) veel beter in het lezen van de tekst dan de oude Scanner. Het is als hoe een mens vaak een rommelig handschrift beter kan ontcijferen dan een standaard typemachine.

2. Maar Slim Zijn Betekent Niet Altijd Sneller
Hier zit de adder onder het gras: De Super-Lesers zijn zwaar en traag.

  • De Snelheidstrap: Toen de Super-Leser probeerde om zowel het lezen als het beslissen te doen (Opstelling B), werd het proces aanzienlijk trager – soms 30% tot 70% trager dan het traditionele team.
  • De "Voldoende" Realiteit: Op afbeeldingen waar de tekst al duidelijk en makkelijk te lezen was, deed de Super-Leser niet echt een veel betere baan in het vinden van geheimen dan de oude Scanner. Sterker nog, voor sommige datasets was het traditionele team eigenlijk nauwkeuriger, omdat de Super-Leser verward raakte door te veel tekst of kleine fouten maakte bij het lezen.

3. De "Goudlokje"-Modellen
De onderzoekers testten drie specifieke Super-Lesers:

  • GPT-4o: De "Zwaargewicht Kampioen." Het was het meest nauwkeurig in het vinden van geheimen, maar het was ook het langzaamst en duurst om uit te voeren. Het is als het inhuren van een wereldklasse detective die veel tijd nodig heeft om de zaak op te lossen.
  • Gemini 2.5 Flash: De "Sprinter." Het was bijna net zo goed als de kampioen, maar veel sneller en goedkoper. Het is als een zeer scherpe detective die snel werkt.
  • Qwen2.5-VL 7B: De "Open-Source Lokale knul." Deze is gratis om op je eigen computers te draaien (wat geweldig is voor privacy). Het was goed, maar het raakte soms verward door complexe situaties, zoals het onderscheid maken tussen een patiënt-ID en een studie-ID.

De Grote Conclusie

Het artikel concludeert dat je je oude systeem niet zomaar blindelings moet vervangen door een Super-Leser. Het hangt af van je situatie:

  • Als je rommelige, moeilijk te lezen afbeeldingen hebt: De Super-Leser is de wachttijd waard omdat het dingen kan zien die de oude scanner mist.
  • Als je duidelijke, makkelijk te lezen afbeeldingen hebt: De oude, snelle scanner is vaak net zo goed en veel sneller.
  • Als je gegevens privé wilt houden: Je wilt misschien de "Lokale knul" (Qwen) gebruiken die je op je eigen servers kunt draaien, zelfs als het iets minder perfect is, omdat je geen patiëntgegevens naar de cloud hoeft te sturen.

Kortom: De nieuwe AI-tools zijn krachtig, maar ze zijn geen magische knop die alles direct oplost. Soms zijn de oude, simpele tools eigenlijk de beste keuze, en is de beste oplossing vaak een combinatie van beide, afhankelijk van hoe rommelig de afbeeldingen zijn en hoe snel je de resultaten nodig hebt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →