← Nieuwste papers
⚡ electrical engineering

OpenMedQ: Broad Open Pretraining for Medical Vision-Language Models

OpenMedQ is een geavanceerd medisch vision-language model dat is voorgetraind op een brede, volledig open dataset van 3,35 miljoen monsters en dat aanzienlijk beter presteert dan veel grotere modellen zoals Med-PaLM M op belangrijke benchmarks, terwijl het een superieure prestatie levert in downstream medische classificatietaken.

Oorspronkelijke auteurs: Ibrahim Gulluk, Max Van Puyvelde, Olivier Gevaert

Gepubliceerd 2026-06-12
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Ibrahim Gulluk, Max Van Puyvelde, Olivier Gevaert

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot probeert te leren de complexe wereld van de geneeskunde te begrijpen. Normaal gesproken heb je daarvoor twee dingen nodig: een "brein" dat medische rapporten kan lezen en een paar "ogen" die naar röntgenfoto's, microscopen en pathologiecoupes kunnen kijken.

Lange tijd waren de beste robots (AI-modellen) in dit veld als geheimzinnige genieën. Ze zijn ongelooflijk slim, maar hun makers houden hun trainingsboeken (data) en hun hersengewichten verborgen. Je kunt niet zien hoe ze hebben geleerd, je kunt hun kennis niet hergebruiken en je kunt hun fouten niet herstellen. Andere modellen zijn als gespecialiseerde leerlingen; ze zijn geweldig in één specifieke taak (zoals het lezen van röntgenfoto's), maar hebben niet genoeg boeken gelezen om het hele plaatje te begrijpen.

OpenMedQ is het antwoord van het artikel op dit probleem. Het is een nieuwe, "open-source" medische robot die de auteurs hebben gebouwd door de grootste collectie open, gratis medische tekstboeken en beeldsets die ooit zijn samengesteld te verzamelen om een model van deze omvang te trainen.

Hier is een uitsplitsing van wat ze hebben gedaan en wat ze hebben gevonden, met behulp van eenvoudige analogieën:

1. De "Bibliotheek" (De Trainingsdata)

De meeste medische AI-modellen worden getraind op een kleine, smalle bibliotheek van boeken. OpenMedQ werd echter getraind op een enorme, diverse bibliotheek met 14 verschillende datasets met ongeveer 3,35 miljoen voorbeelden.

Denk er zo over na:

  • Andere modellen lezen misschien alleen boeken over hart-röntgenfoto's.
  • OpenMedQ las boeken over hart-röntgenfoto's, hersenscans, microscoopopnames van cellen en zelfs gewoon tekstgebaseerde medische quizzen.
  • Cruciaal is dat elk boek in deze bibliotheek open en gratis was voor iedereen om te gebruiken. De auteurs hebben hun bronnen niet verborgen.

2. Het "Brein" en de "Ogen" (De Architectuur)

Het model is gebouwd als een standaard moderne AI (een zogenaamde LLaVA-stijl).

  • De Ogen (Vision Encoder): Het gebruikt een vooraf getraind "oog" dat al goed was in het bekijken van medische afbeeldingen (van een model genaamd BiomedCLIP).
  • Het Brein (Language Model): Het verbindt die ogen met een groot taalbrein (LLaMA-7B) dat al goed was in medische tekst.
  • De Training: Ze hebben de ogen en het brein geleerd om met elkaar te communiceren via een techniek genaamd "next-token prediction". Stel je voor dat je de robot een afbeelding en een vraag laat zien, en hem vraagt om het volgende woord in het antwoord te raden, keer op keer, totdat hij het patroon leert.

3. De "Proefrit" (De Resultaten)

De auteurs hebben OpenMedQ door twee hoofdtesten gehaald om te zien hoe goed het heeft geleerd.

Test A: De "Algemene Kennis" Quiz (Visual Question Answering)
Ze stelden de robot medische vragen op basis van afbeeldingen (bijv. "Wat laat deze röntgenfoto zien?").

  • Het Resultaat: OpenMedQ scoorde hoger dan sommige van de grootste, duurste modellen die er bestaan.
  • De Analogie: Stel je voor dat OpenMedQ een student is met een 7B-parameter brein (een middelgroot brein). Het maakte een test tegenover een gigantisch, 562B-parameter brein (een massief supercomputerbrein). Ondanks dat het ongeveer 80 keer kleiner is, behaalde OpenMedQ een betere score op één specifieke test (PathVQA) en evenaarde het de beste scores op een andere (VQA-MED).
  • De Bewering: Dit bewijst dat het hebben van een brede, open bibliotheek aan trainingsdata belangrijker is dan simpelweg het hebben van een enorm, geheim brein.

Test B: Het "Specialisten" Examen (Image Classification)
Ze namen alleen de "ogen" (het visuele deel) van OpenMedQ en testten deze op 8 verschillende medische beeldtaken die het model nog nooit eerder had gezien (zoals het identificeren van borstkanker op een echografie of longontsteking op een borstkasröntgenfoto).

  • Het Resultaat: De "ogen" van OpenMedQ presteerden gemiddeld beter dan de ogen van drie andere top-tier medische modellen (BiomedCLIP, PMC-CLIP, PubMedCLIP) en een model dat vanaf nul is getraind.
  • De Analogie: Het is alsof je een algemeen arts die van alles een beetje heeft gezien, vraagt om specifieke ziekten te diagnosticeren. Omdat ze tijdens hun training een zo grote verscheidenheid aan gevallen hebben gezien, waren ze beter in het herkennen van patronen in nieuwe situaties dan artsen die zich op één nauw gebied specialiseerden.

4. De "Catch" (Beperkingen)

De auteurs zijn eerlijk over waar de robot nog steeds moeite mee heeft.

  • Niet overal perfect: Hoewel OpenMedQ gemiddeld de beste was, won het niet in elke categorie. Bijvoorbeeld, op borst-echografiebeelden was een ander model nog steeds iets beter.
  • Oppervlakkig: De testscores (BLEU-1) meten hoe vergelijkbaar de woorden van de robot zijn met menselijke antwoorden, niet noodzakelijkerwijs of de medische redenering 100% correct is.
  • Het "Grote Brein" wint nog steeds soms: De enorme, geheime modellen (Med-PaLM M) deden het nog steeds beter op sommige specifieke, moeilijke testen met betrekking tot radiologie en microscopie.

De Kernboodschap

De belangrijkste boodschap van het artikel is dat diversiteit en openheid krachtige instrumenten zijn. Je hebt niet noodzakelijkerwijs een geheime, enorme supercomputer nodig om een geweldige medische AI te bous. Als je een middelgroot model traint op de breedste, meest open collectie medische data die beschikbaar is, kun je grotere, gesloten modellen verslaan.

De auteurs hebben hun code, hun trainingsrecepten en een interactieve demo beschikbaar gesteld aan het publiek, en nodigen iedereen uit om hun werk te inspecteren, te hergebruiken en te verbeteren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →