← Nieuwste papers
📄 medicine

Comparison of the Diagnostic Reliability of ChatGPT in Letournel–Judet Acetabulum Fracture Classification Based on Judet Radiographs According to Orthopaedic Residents

Deze studie toont aan dat ChatGPT-4o fundamenteel ontoereikende diagnostische betrouwbaarheid en verwaarloosbare overeenstemming met expertstandaarden vertoont voor de classificatie van Letournel–Judet acetabulumfracturen, waarbij het significant slechter presteert dan orthopedisch assistenten en daarmee faalt als een levensvatbare beslissingsondersteunende tool voor bekkenletsel.

Oorspronkelijke auteurs: Muhammed Kilic, Ahmet Ozgur Yildirim, Ibrahim Alper Yavuz, Fatih Inci, Erman Ceyhan, Yakup Kahve, Tahsin Aydin, Ozdamar Fuad Oken

Gepubliceerd 2026-07-01
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Muhammed Kilic, Ahmet Ozgur Yildirim, Ibrahim Alper Yavuz, Fatih Inci, Erman Ceyhan, Yakup Kahve, Tahsin Aydin, Ozdamar Fuad Oken

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer complexe, 3D-puzzel hebt gemaakt van gebroken bot in de heup van een persoon. Om dit te repareren, moeten artsen precies uitzoeken hoe de stukken uit elkaar zijn gebroken. Ze gebruiken een speciale kaart genaamd de "Letournel–Judet-classificatie" om de breuk te beschrijven. Deze kaart is lastig; het vereist het bekijken van drie verschillende platte röntgenfoto's (zoals het bekijken van een gebouw van voren, van opzij en van achteren) en het mentaal combineren hiervan om de hele structuur te begrijpen.

Deze studie stelde een eenvoudige vraag: Kan een superintelligente computerchatbot (ChatGPT-4o) deze taak even goed uitvoeren als een arts in opleiding?

Hier is de uitsplitsing van wat er gebeurde, met behulp van eenvoudige analogieën:

De Opzet: De Test

De onderzoekers namen röntgenfoto's van 184 patiënten met gebroken heupkommen. Ze zetten een "test" op met drie groepen:

  1. De Expert: Een ervaren traumachirurg die de uiteindelijke 3D-CT-scans en de daadwerkelijke operatieresultaten heeft gezien. Deze persoon is het "Antwoordmodel".
  2. De Studenten: Twee orthopedisch assistenten (artsen in hun laatste jaar van de opleiding). Zij zagen alleen de platte röntgenfoto's, net als de computer.
  3. De AI: ChatGPT-4o. De onderzoekers gaven de AI dezelfde röntgenfoto's en een specifieke lijst met vragen (een checklist) om het de AI te helpen het type breuk te bepalen.

De Resultaten: Een Grote Kloof

De resultaten waren een enorme schok voor de onderzoekers.

  • De Studenten (Assistenten): Zij waren uitstekend. Ze stelden de diagnose in 88% tot 91% van de gevallen correct. Ze stemden bijna perfect overeen met de Expert.
  • De AI (ChatGPT): Het had het erg moeilijk. Het kreeg de uiteindelijke diagnose slechts in 17,9% van de gevallen goed. Dat betekent dat het in bijna 8 van de 10 gevallen fout zat.

De Analogie:
Stel je een spel voor waarbij je een specifiek type auto-ongeluk moet identificeren door naar drie wazige foto's te kijken.

  • De Assistenten zijn als ervaren monteurs die naar de foto's keken en zeiden: "Dat is een aanrijding van achteren met een verdraaid chassis." Ze hadden bijna altijd gelijk.
  • De AI was als een student die naar de foto's keek en zei: "Dat is een auto die van een klif is gevallen," of "Dat is een auto die een boom heeft geraakt," zelfs toen dat overduidelijk niet het geval was. Het gokte maar wat.

Waar de AI Vastliep

De studie vond dat de AI niet volledig blind was.

  • Het Goede: De AI was eigenlijk best goed in het herkennen van eenvoudige, geïsoleerde zaken. Het kon correct identificeren of een specifelijk deel van de heup (de "iliaca wing") gebroken was, in ongeveer 82% van de gevallen. Het was als een student die correct kan aanwijzen "dat is een gebroken wiel", maar faalt om het hele auto-concept te begrijpen.
  • Het Slechte: De AI faalde jammerlijk bij het moeilijke deel: het samenvoegen van de stukken. Het kon niet begrijpen hoe de voorste en achterste delen van de heup met elkaar verbonden waren. Het verwarde een eenvoudige breuk vaak met een "both-column" fractuur (een zeer complexe breuk); het zag een eenvoudige kras en noemde het een totale ramp.

De onderzoekers merkten op dat de AI leek te lijden aan "hallucinaties". Het zag een schaduw op een röntgenfoto en beweerde dan zelfverzekerd: "Dat is een specifiek teken van een fractuur," zelfs wanneer dat er niet was.

De Conclusie: Gebruik het Nog Niet

De belangrijkste boodschap van het artikel is bot: Gebruik deze AI niet om gebroken heupen te diagnosticeren.

De auteurs stellen dat hoewel AI geweldig is in eenvoudige taken (zoals het opsporen van een gebroken bot in een vinger), het momenteel fundamenteel ongeschikt is voor het complexe, meerstaps denken dat vereist is voor heupkomfracturen. Het kan de verschillende röntgenopnamen niet betrouwbaar combineren om een correcte diagnose te stellen.

Kortom: Als je deze röntgenfoto's aan een menselijke assistent zou geven, zouden ze waarschijnlijk het juiste antwoord krijgen. Als je ze aan deze specifieke AI zou geven, zou het waarschijnlijk het verkeerde antwoord geven, wat kan leiden tot de verkeerde operatie. De onderzoekers zeggen dat we ons voor deze specifieke taak aan menselijke artsen moeten houden totdat de AI veel slimmer wordt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →