Performance of Large Language Model on Real-World Patient Histories for Imaging Appropriateness.
Deze studie toont aan dat ChatGPT een matige overeenstemming bereikt met radiologen bij het classificeren van de geschiktheid van lumbale MRI-scans op basis van ACR-criteria, waarbij de betrouwbaarheid van de besluitvorming significant toeneemt wanneer de kwaliteit van de redenering hoog wordt beoordeeld.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Technische Samenvatting: Prestaties van een Large Language Model op Real-World Patiëntgeschiedenissen voor de Geschiktheid van Beeldvorming
Probleemstelling
Lage rugpijn (LBP) is een veelvoorkomende mondiale musculoskeletale klacht, wat leidt tot frequente verzoeken voor lumbosacrale wervelkolom-MRI. Systematische reviews geven aan dat ongeveer 29–34% van deze beeldvormingsverzoeken ongepast is, vaak door het ontbreken van "red flags" zoals infectie, maligniteit of trauma. Onnodige MRI's verhogen de zorgkosten, patiëntenzorgen en het risico op overdiagnose. Hoewel klinische beslissingsondersteuningstools en richtlijnen bestaan, wordt hun implementatie in de praktijk gehinderd door uitdagingen in de workflowintegratie en alertmoeheid. Hoewel Large Language Models (LLMs) zijn opgekomen als een schaalbaar alternatief om onnodig gebruik te verminderen, vertrouwden eerdere studies grotendeels op hypothetische klinische scenario's in plaats van echte patiëntgeschiedenissen, maakten zij gebruik van een single-radiologist referentiestandaard, en richtten zij zich op eerdere modelversies (bijv. GPT-4) zonder systematisch de link tussen de kwaliteit van de redenering en de betrouwbaarheid van de beslissing te evalueren.
Methodologie
Deze cross-sectionele studie evalueerde de diagnostische nauwkeurigheid van GPT-5.2 bij het classificeren van de geschiktheid van lumbosacrale wervelkolom-MRI's met behulp van real-world patiëntgeschiedenissen en de criteria van de American College of Radiology (ACR).
- Gegevensverzameling: Gegevens werden retrospectief verzameld van 160 volwassen patiënten (gemiddelde leeftijd 48 ± 15 jaar; 58% man) die tussen september en november 2025 een lumbosacrale MRI ondergingen. Patiënten met een onvoldoende geschiedenis, eerdere spinale chirurgie, vermoedelijke infectie of acuut trauma werden uitgesloten. Een gestructureerde vragenlijst, gevalideerd door vijf specialisten, werd gebruikt om de klinische geschiedenissen vóór de beeldvorming te verzamelen.
- Model Prompting: Patiëntgeschiedenissen werden via gestructureerde prompts in GPT-5.2 ingevoerd, waarbij de rol van een radioloog aan het model werd toegewezen en de opdracht werd gegeven om de indicaties voor MRI te classificeren als "Meestal Geschikt" (UA), "Kan Geschikt Zijn" (MBA), "Meestal Niet Geschikt" (UNA), of "Onvoldoende Klinische Informatie" (ICI) op basis van ACR-richtlijnen, inclusief expliciete redenering.
- Referentiestandaard: Twee onafhankelijke radiologen (met 5 en 10 jaar ervaring) dienden als de referentiestandaard.
- Fase 1: Radiologen beoordeelden de geschiktheid op basis van dezelfde prompts die aan het LLM werden verstrekt, geblindeerd voor de output van het model.
- Fase 2: Radiologen evalueerden de nauwkeurigheid van de aanbevelingen van het LLM en de kwaliteit van de klinische redenering met behulp van een 5-punts Likert-schaal (1–5), geblindeerd voor elkaars beoordelingen.
- Statistische Analyse: Overeenstemming werd gemeten met de gewogen Cohen's kappa () en de Bowker's test van asymmetrie. Voor binaire analyse werden UA en MBA gegroepeerd als "Geschikt", en UNA als "Ongepast". Prestatie-indicatoren omvatten sensitiviteit, specificiteit, PPV, NPV en de Area Under the Curve (AUC). Subgroepanalyses werden uitgevoerd op basis van de door de radioloog beoordeelde kwaliteit van de redenering (Hoog: 4 vs. Laag: <4).
Belangrijkste Resultaten
- Overeenstemming: GPT-5.2 vertoonde een matige overeenstemming met beide radiologen ( vs. Radioloog 1; vs. Radioloog 2). Dit niveau van overeenstemming was vergelijkbaar met de inter-radioloog overeenstemming ().
- Binaire Classificatie: Het model vertoonde een hoge sensitiviteit (~85% tegenover beide radiologen) maar een variabele specificiteit (92,9% vs. Radioloog 1; 61,7% vs. Radioloog 2). De negatieve voorspellende waarde (NPV) was matig (57,8% vs. R1; 64,4% vs. R2), wat wijst op een neiging naar conservatief (restrictief) MRI-gebruik.
- Discriminatief Vermogen: ROC-analyse toonde een goede tot uitstekende discriminatie tegenover Radioloog 1 (AUC 0,891) en een redelijke tot goede discriminatie tegenover Radioloog 2 (AUC 0,751).
- Correlatie Redeneringskwaliteit: Een cruciale bevinding was de sterke associatie tussen de kwaliteit van de redenering en de betrouwbaarheid van de beslissing. Wanneer radiologen de kwaliteit van de redenering van het model als hoog beoordeelden (4), was de exacte overeenstemming over geschiktheid hoog (83,3% vs. R1; 90,4% vs. R2), en de tegenovergestelde discordantie (het meest gevaarlijke type fout) laag (2,3–4,7%). Omgekeerd, wanneer de redenering als laag werd beoordeeld (<4), daalde de exacte overeenstemming naar 0–7,1%, en steeg de tegenovergestelde discordantie naar 71,4–92,8%.
- Expert Evaluatie: Radiologen beoordeelden de outputkwaliteit van het model hoog, met mediane Likert-scores van 5 (maximum) voor zowel geschiktheid als redenering.
Betekenis en Claims
De auteurs claimen dat GPT-5.2 binnen het bereik van de inter-radioloog variabiliteit presteert bij het classificeren van de geschiktheid van lumbosacrale MRI's met behulp van real-world patiëntgeschiedenissen. De studie benadrukt dat de kwaliteit van de redenering van het model een robuuste voorspeller is van de betrouwbaarheid van de beslissing. Specifiek correleert output van hoge kwaliteit met een hoge concordantie met de deskundige beoordeling, terwijl output van lage kwaliteit correleert met significante discordantie.
Het artikel stelt dat LLM's zoals GPT-5.2 het potentieel hebben om te dienen als pre-screening ondersteuningstools om onnodige beeldvormingsverzoeken te verminderen. De auteurs benadrukken echter dat dit potentieel afhankelijk is van de kwaliteit van de redenering van het model, wat wijst op een hybride workflow waarbij outputs met een lage redeneringskwaliteit worden geëscaleerd voor expertbeoordeling. De studie concludeert dat hoewel het model veelbelovend is, veilige klinische integratie voortdurende menselijke supervisie, prospectieve multi-center validatie en het vaststellen van consensus referentiestandaarden vereist om de inter-waarnemer variabiliteit in ambigue gevallen aan te pakken.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.