← Nieuwste papers
📄 medicine

Concordance of a ChatGPT-4o–based triage model with emergency physician categorization in the emergency department: a prospective observational comparison with emergency medical technicians

Deze prospectieve observationele studie vond dat een op ChatGPT-4o gebaseerd triage-model een significant hogere concordantie vertoonde met de categorisering van spoedeisende artsen dan ambulanceverpleegkundigen bij het gebruik van identieke gestructureerde klinische gegevens, hoewel deze overeenstemming de consistentie van de beoordelaar weerspiegelt in plaats van diagnostische validiteit en gepaard gaat met een neiging tot over-triage van patiënten met een hoge urgentie.

Oorspronkelijke auteurs: Zülküf Sergen Ünlü, Murat Seyit, İbrahim Türkçüer, Atakan Yılmaz, Mert Özen, Alten Oskay

Gepubliceerd 2026-07-03
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Zülküf Sergen Ünlü, Murat Seyit, İbrahim Türkçüer, Atakan Yılmaz, Mert Özen, Alten Oskay

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een drukke spoedeisende hulp voor als een enorm, chaotisch treinstation. Elke minuut arriveren er nieuwe passagiers (patiënten), en iemand moet beslissen wie in de eerste trein stapt (onmiddellijke zorg), wie op het perron wacht (matige zorg), en wie later naar de ticketbalie kan lopen (lage urgentie). Dit proces wordt triage genoemd.

Normaal gesproken maakt een menselijke expert (een arts van de spoedeisende hulp) deze beslissingen. Maar mensen worden moe, afgeleid of beïnvloed door hoe ze zich voelen, waardoor twee verschillende experts dezelfde passagier anders kunnen sorteren.

Deze studie stelde een simpele vraag: Kan een superintelligent computerprogramma (ChatGPT-4o) deze passagiers net zo goed sorteren als een menselijke expert?

Hier is de uitsplitsing van wat de onderzoekers hebben gedaan en gevonden, met behulp van eenvoudige analogieën:

De Opzet: Het "Sorteerspel"

De onderzoekers zetten een spel op met drie spelers, die allemaal naar dezelfde 788 passagiers keken die aankwamen in een Turks ziekenhuis:

  1. De Menselijke Expert (De Gouden Standaard): Een enkele, hoogopgeleide arts van de spoedeisende hulp. Deze arts is de "scheidsrechter".
  2. De Computer (De Nieuwe Speler): Een ChatGPT-4o model. De computer zag de patiënten niet in persoon; het las alleen een gestandaardiseerde checklist met feiten over hen (symptomen, geschiedenis, etc.).
  3. De Triage-Technicus (De Speler in de Praktijk): Verpleegkundigen van de spoedeisende hulp (EMT's). Dit zijn de mensen die normaal gesproken de sortering doen bij de voordeur in dit specifieke ziekenhuis. Zij zagen de echte mensen voor zich staan, net zoals in de echte wereld.

De Regels:

  • De arts en de computer bekeken beide exact dezelfde schriftelijke checklist voor elke patiënt.
  • De EMT's keken naar de echte mensen die voor hen stonden.
  • Iedereen moest de patiënt in een van de drie gekleurde bakken plaatsen: Rood (Noodgeval!), Geel (Even wachten) of Groen (Prima, later gaan).

De Resultaten: Wie won het spel?

1. De Computer versus de Arts
De computer was ongelooflijk goed in het nabootsen van de arts.

  • De Score: Als je je een schaal voorstelt waarbij 1.0 perfecte overeenstemming is, kwamen de computer en de arts in 84% van de gevallen overeen (een score van 0,84).
  • De Metafoor: Het was als een student die de antwoorden sleutel van de leraar zo grondig had bestudeerd dat hij exact dezelfde antwoorden op de toets schreef. Ze waren bijna identiek in hoe ze de patiënten sorteerden.

2. De Computer versus de Triage-Technicus
De computer deed het ook beter dan de menselijke technici die daadwerkelijk bij de deur stonden.

  • De Score: De technici kwamen in 63% van de gevallen overeen met de arts.
  • Het Gat: De computer was aanzienlijk beter in het matchen van de keuzes van de arts dan de technici waren.

3. Het "Rode Bak"-probleem (De Catch)
Hier wordt het lastig. De "Rode" bak is voor levensbedreigende noodgevallen. Een rode patiënt missen is gevaarlijk.

  • De Technici: Zij waren erg voorzichtig. Als ze iemand in de categorie Rood plaatsten, hadden ze meestal gelijk (87% nauwkeurigheid). Echter, ze misten veel echte noodgevallen door 45 van de 79 kritieke patiënten in de "Gele" bak te plaatsen. Ze waren aan het onder-triëren (te voorzichtig spelen).
  • De Computer: De computer ving bijna alle kritieke patiënten (92% van de "Rode" patiënten werd correct geïdentificeerd). Maar, de computer was ook erg "paranoïde". Het plaatste 28 mensen die eigenlijk "Geel" waren, in de "Rode" bak.
  • De Metafoor: De computer was als een beveiliger die "BRAND!" schreeuwt bij de kleinste geur van rook. Het redt iedereen die echt in brand staat, maar het veroorzaakt ook veel valse alarmen, waardoor de nooduitgangen verstopt raken met mensen die ze niet nodig hadden.

Belangrijke Waarschuwingen (De Kleine Lettertjes)

De auteurs zijn zeer voorzichtig om niet te zeggen dat de computer "beter" is dan een arts in het echte leven. Hier is waarom:

  • De "Gedeelde Handboek"-bias: Zowel de computer als de arts keken naar dezelfde schriftelijke aantekeningen. De technici keken naar de mensen. Omdat de computer en de arts beiden vanuit hetzelfde bronmateriaal werkten, waren ze eerder geneigd om overeen te stemmen. Het is alsoan twee mensen die een toets nakijken en beiden de antemensleutel hebben; ze zullen meer overeenstemming vertonen dan iemand die moet gokken op basis van het slordige handschrift van een leerling.
  • Geen "Echte Leven" Test: De studie controleerde niet of de patiënten daadwerkelijk beter werden of slechter. Het controleerde alleen of de computer overeenkwam met de mening van de arts. We weten niet of de "Rode" oproepen van de computer daadwerkelijk levens hebben gered of alleen middelen hebben verspild.
  • De Slechtste Gevallen Missen: De studie sloot de ziekste patiënten uit (die bewusteloos waren of onmiddellijk reanimatie nodig hadden). We weten dus niet hoe de computer omgaat met de absoluut meest kritieke noodgevallen.
  • Eén Arts: De "Gouden Standaard" was slechts de mening van één arts. Als die arts een slechte dag had of een specifieke bias had, kopieerde de computer simpelweg die bias.

De Kern van het Verhaal

Deze studie is een proof-of-concept. Het is alsof je laat zien dat een nieuw type motor op een testbaan met hoge snelheden kan rijden.

  • Wat het bewees: Een ChatGPT-4o model kan een patiëntendossier lezen en hen in categorieën indelen bijna exact zoals een specialistische arts dat doet, en het doet dit consistenter dan de frontlinie-technici in deze specifieke setting.
  • Wat het niet bewees: Het bewees niet dat de computer al veilig is om in een echt ziekenhuis te gebruiken. Het heeft de neiging om noodsituaties te overschatten (valse alarmen), en we weten niet of het werkt bij de ziekste patiënten of met verschillende talen en ziekenhuissystemen.

De onderzoekers concluderen dat deze technologie veelbelovend is, maar dat er veel meer testen nodig zijn voordat het mensen in een echte spoedeisende hulp kan vervangen of zelfs ondersteunen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →