Expert-level vision-language foundation model for real-world radiology and comprehensive evaluation
Dit artikel introduceert RadFound, een grootschalig open-source vision-language fundatiemodel getraind op meer dan 8,1 miljoen radiologische beelden en 250.000 beeld-tekstparen over 19 orgaansystemen, dat door middel van een nieuwe architectuur en een uitgebreide evaluatie op de nieuwe RadVLBench-benchmark een superieure expert-prestatie levert in multimodale perceptie- en generatietaken vergeleken met bestaande modellen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
In het moderne ziekenhuis is de kamer van de radioloog een plek van intense concentratie, waar het menselijk oog duizenden beelden scant om de onzichtbare tekenen van ziekte te vinden. Deze beelden, variërend van platte röntgenfoto's van de borstkas tot driedimensionale doorsneden van de schildklier, zijn meer dan alleen plaatjes; het zijn complexe datasets die een diep begrip van anatomie en pathologie vereisen om correct geïnterpreteerd te worden. Decennialang zijn computers getraind om specifieke patronen in deze beelden te herkennen, als gespecialiseerde hulpmiddelen die een gebroken bot of een longnodule kunnen identificeren. Deze instrumenten waren echter traditioneel beperkt tot enkelvoudige taken, niet in staat om met een arts te converseren of hun redenering in natuurlijke taal uit te leggen. Recentelijk is er een nieuwe generatie kunstmatige intelligentie opgekomen die het vermogen combineert om te zien met het vermogen om taal te begrijpen en te genereren. Deze systemen, bekend als vision-language modellen, beogen de kloof te overbruggen tussen de visuele wereld van medische beeldvorming en de tekstuele wereld van klinische rapporten, met de belofte van een assistent die niet alleen kan zien wat een arts ziet, maar dit ook kan beschrijven met de nuance van een menselijke expert.
Een team van onderzoekers heeft nu een nieuw systeem geïntroduceerd genaamd RadFound, dat specifelijk is ontworpen om de complexe taal van de radiologie te beheersen. In tegen tegenstelling tot eerdere pogingen die vertrouwden op algemene kennis of eenvoudige aanpassingen van bestaande tools, is dit nieuwe model gebouwd op de BLIP-2 architectuur, maar werd het verfijnd met behulp van een enorme collectie medische gegevens. De onderzoekers verzamelden meer dan 8,1 miljoen medische afbeeldingen en 250.000 paren van afbeeldingen en de bijbehorende tekstbeschrijvingen. Deze dataset beslaat 19 belangrijke orgaansystemen en 10 beeldvormingsmodaliteiten, wat ervoor zorgt dat het model leert van een breed scala aan realistische gevallen in plaats van een smalle selectie. Om het systeem te leren zien als een specialist, ontwikkelde het team een unieke trainingsmethode die het model dwingt naar een afbeelding te kijken, delen ervan te verbergen en vervolgens de ontbrekende details te reconstrueren, terwijl het tegelijkertijd de afbeelding vergelijkt met andere gerelateerde beelden. Dit proces helpt de computer niet alleen de fijne details van een enkele scan te leren, maar ook de bredere context van hoe verschillende beelden met elkaar verband houden, waarbij het de manier nabootst waarop een radioloog een huidige scan vergelijkt met de eerdere gegevens van een patiënt.
Het systeem leerde ook deze visuele inzichten te verbinden met taal via een gespecialiseerd uitlijningsproces. In plaats van alleen woorden aan plaatjes te koppelen, werd het model getraind op data waarbij afbeeldingen en tekst in een specifieke volgorde met elkaar verweven waren, wat het leerde de flow van een medisch rapport te begrijpen. Het leerde instructies af te handelen die kunnen inhouden dat er naar meerdere afbeeldingen tegelijk wordt gekeken, zoals het vergelijken van een mammogram vanuit twee verschillende hoeken of het analyseren van een driedimensionale CT-scan van de schildklier. Deze capaciteit stelt het model in staat om complexe klinische vragen te verwerken, zoals het vragen om een vergelijking tussen een huidige scan en een vorige scan, of het verzoeken om een gedetailleerde beschrijving van bevindingen over verschillende lichaamsdelen. De onderzoekers testten dit systeem op een nieuwe set uitdagingen die zij hadden gecreëerd, welke onder meer het beantwoorden van vragen over medische beelden, het schrijven van korte bijschriften en het genereren van volledige diagnostische rapporten voor borstkasröntgenfoto's, mammogrammen en schildklier-scans omvatte.
De resultaten van deze tests toonden aan dat het nieuwe model bestaande systemen die niet specifiek voor de radiologie zijn ontworpen, aanzienlijk overtrof. Wanneer gevraagd werd om vragen over medische beelden te beantwoorden, gaf het model veel vaker de juiste antwoorden dan zijn concurrenten, zelfs wanneer de vragen complex waren of het vergelijken van meerdere aanzichten vereisten. In taken waarbij het model tekst moest genereren, produceerde het rapporten die niet alleen grammaticaal correct waren, maar ook klinisch accuraat. De onderzoekers maten dit succes met standaard computermetrieken, maar gingen nog een stap verder door menselijke artsen de rapporten te laten evalueren. In deze evaluaties werd de output van het model beoordeeld op leesbaarheid, medische redenering en het vermogen om belangrijke abnormaliteiten te detecteren. De bevindingen toonden aan dat het model presteerde op een niveau dat vergelijkbaar is met die van senior radiologen met meer dan tien jaar ervaring, en in sommige gevallen zelfs junior radiologen overtrof. Dit suggereert dat het systeem een niveau van expertise heeft bereikt waarbij het potentieel een betrouwbare partner kan zijn in de klinische workflow, in staat om de diverse en veeleisende taken van de moderne radiologie aan te kunnen.
Ondanks deze indrukwekkende resultaten merken de onderzoekers zorgvuldig op dat het werk een belangrijke stap voorwaarts is en geen definitieve oplossing. Zij erkennen dat hoewel het model goed presteert in gecontroleerde tests, de integratie van dergelijke technologie in de dagelijkse ziekenhuispraktijk verdere investigatie vereist. De huidige evaluatie leunde zwaar op menselijke experts om de kwaliteit van de rapporten te beoordelen, een proces dat accuraat is maar tijdrovend en moeilijk op te schalen. Het team suggereert dat toekomstig werk zich moet richten op het ontwikkelen van betere manieren om de klinische waarde van deze rapporten automatisch te meten zonder uitsluitend te vertrouwen op menselijke scoring. Bovendien blijft de werkelijke impact van het gebruik van dit systeem naast menselijke artsen in een drukke ziekenhuisomgeving nog te bezien. Desalniettemin demonstreert de ontwikkeling van RadFound dat het mogelijk is om een kunstmatige intelligentie te creëren die de unieke complexiteit van medische beeldvorming begrijpt, wat een krachtig nieuw hulpmiddel biedt dat artsen op een dag kan helpen om snellere en nauwkeurigere zorg aan patiënten te bieden.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.