Large Language Models for Pulmonary Embolism Health Education: A Four- Model Comparison of Reliability, Quality, and Readability
Deze studie vergelijkt vier grote taalmodellen op het gebied van gezondheidseducatie over longembolie en stelt vast dat hoewel Copilot en Perplexity een superieure betrouwbaarheid en bronvermelding toonden, geen van de modellen voldeed aan de aanbevolen leesbaarheidsnormen voor patiënteneducatie, wat de noodzaak van professioneel toezicht onderstreept.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je het internet voor als een enorme, drukke bibliotheek waar iedereen naar binnen kan lopen en een vraag kan stellen. In het verleden, als je iets vroeg over een angstaanjagende medische aandoening, kreeg je misschien een stapel oude boeken, een verwarrend krantenartikel of een wild gerucht van een vreemde. Maar onlangs is er een nieuw soort bibliothecaris gearriveerd: het Large Language Model (LLM). Denk aan deze als superintelligente, onvermoeibare robots die bijna alles hebben gelezen wat er op het internet geschreven is en met je kunnen chatten in gewoon Engels. Ze zijn geweldig in het schrijven van verhalen, het oplossen van wiskundige problemen en zelfs het beantwoorden van gezondheidsvragen.
Maar hier komt het lastige deel: als het gaat om ernstige gezondheidsproblemen, is een goede verhalenverteller niet genoeg. Je hebt een bibliothecaris nodig die de feiten kent, toegeeft wanneer hij het niet zeker weet en dingen simpel genoeg uitlegt voor een vermoeid, bezorgd persoon om te begrijpen. Eén zodanige angstaanjagende aandoening is een longembolie (PE). Het is als een verkeersopstopping in de longen veroorzaakt door een bloedstolsel, en het kan zeer gevaarlijk zijn. Omdat het zo ernstig is, zoeken mensen vaak snel op Google naar antwoorden. Dit artikel stelt een grote vraag: Als je vier verschillende AI-bibliothecarissen naar PE vraagt, geven ze je dan hetzelfde goede advies? Of zullen sommigen zelfverzekerd klinken maar fout zitten, of antwoorden geven die te moeilijk te lezen zijn?
De Grote AI-Showdown: Wie is de Beste Gezondheidsbibliothecaris?
In dit onderzoek besloten onderzoekers van het Xinfeng County People's Hospital vier van de meest populaire AI-chatbots aan de tand te voelen. Ze kozen voor ChatGPT, Gemini, Microsoft Copilot en Perplexity AI. Om het een eerlijk gevecht te maken, stelden ze de robots geen vreemde, verzonnen vragen. In plaats daarvan keken ze naar wat echte mensen daadwerkelijk zochten op Google over een periode van vijf jaar. Ze vonden de 31 meest voorkomende vragen die mensen stellen over longembolie — zaken als "Wat zijn de symptomen?", "Hoe wordt het behandeld?" en "Is het gevaarlijk tijdens de zwangerschap?".
Vervolgens voerden ze deze exacte 31 vragen in bij elk van de vier AI-modellen. Omdat er vier modellen en 31 vragen waren, kwamen de onderzoekers uit op 124 verschillende antwoorden om te beoordelen. Ze gedroegen zich als strenge leraren en gebruikten vier verschillende "rapportcijfers" om de antwoorden te controleren:
- Betrouwbaarheid: Gaaf de AI toe wat het wel en niet wist? Liet het zijn huiswerk zien (bronnen)?
- Kwaliteit: Was het advies gebalanceerd en nuttig?
- Leesbaarheid: Was de taal simpel genoeg voor een leerling uit de 6e klas (groep 8/onderbouw) om te begrijpen? (Artsen adviseren meestal dat gezondheidsinformatie deze eenvoud moet hebben zodat iedereen het kan begrijpen).
- Algemene Flow: Verliep de tekst vloeiend?
De Resultaten: Het "Goede" Nieuws en het "Slechte" Nieuws
Hier komt de plotwending: Alle vier de AI-modellen beantwoordden elke vraag. Geen van hen crashte of weigerde te praten. Ze klonken allemaal zelfverzekerd en schreven in heldere, vloeiende zinnen. Als je alleen de eerste paragraaf zou lezen, leken ze allemaal op behulpzame experts.
Echter, toen de onderzoekers beter keken, waren de verschillen enorm.
De "Bron" Score (JAMA Benchmark):
Stel je een essay voor waarbij je punten krijgt voor het vermelden van je bronnen. Twee modellen, Copilot en Perplexity, waren de enigen die de moeite namen om hun werk te laten zien. Ze gaven citaties (links naar de plek waar ze de informatie vandaan hadden). De andere twee, ChatGPT en Gemini, gaven meestal gewoon antwoorden zonder te laten zien waar ze vandaan kwamen. Sterker nog, ChatGPT en Gemini kregen een score van 0 voor het tonen van bronnen, terwijl Copilot en Perplexity iets hoger scoorden (rond de 1 van de 4). Dit betekent dat als je wilde controleren of de AI de waarheid sprak, je dat eigenlijk alleen bij de eerste twee kon doen.
De "Betrouwbaarheid" Score (DISCERN):
Deze score controleert of het advies gebalanceerd en veilig is.
- Copilot en Perplexity scoorden een mediaan van 41.
- ChatGPT scoorde 35.
- Gemini scoorde 33.
Op een schaal waarbij 63 "uitstekend" is en 16 "zeer slecht", kwamen alle vier de modellen in de categorie "slecht" tot "redelijk" terecht. Zelfs de "winnaars" (Copilot en Perplexity) bereikten niet het niveau "goed". Ze waren oké, maar niet geweldig.
Het "Leesbaarheid" Probleem:
Dit is waar het verhaal een beetje frustrerend wordt. De American Medical Association zegt dat gezondheidsadvies geschreven moet worden op een leesniveau van de 6e klas zodat iedereen, ongeacht de opleiding, het kan begrijpen.
- De onderzoekers controleerden de antwoorden met zes verschillende wiskundige formules om te meten hoe moeilijk de tekst te lezen was.
- Geen van de vier modellen slaagde voor de test.
- De makkelijkste antwoorden waren nog steeds geschreven op een 9e-klas niveau (ChatGPT).
- De moeilijkste antwoorden waren geschreven op een 16e-klas niveau (Copilot), wat gelijk staat aan het niveau van een universiteit!
- De "Flesch Reading Ease" score (waarbij hoger makkelijker is) lag voor alle modellen rond de 35 tot 48. Om te slagen, hadden ze een score van 80 of hoger nodig.
In essentie schreven de AI-robots in een taal die te ingewikkeld is voor de gemiddelde persoon om snel te lezen, vooral wanneer diegene bang en bezorgd is om een medisch noodgeval.
Het Eindoordeel: Laat de Robot Niet de Auto Besturen
De studie concludeerde dat hoewel deze AI-modellen goed zijn in het intelligent klinken en het organiseren van informatie, ze er nog niet klaar voor zijn om een arts te vervangen.
- Copilot en Perplexity waren de "betere" leerlingen omdat ze hun bronnen lieten zien en een iets betere structuur hadden, maar ze gebruikten nog steeds te veel moeilijke woorden.
- ChatGPT en Gemini waren iets minder goed in het tonen van bronnen, ook al klonken ze net zo vloeiend.
- Cruciaal was dat de studie vond dat geen enkel model betrouwbare feiten, duidelijke bronnen EN eenvoudige taal combineerde.
De auteurs concluderen dat deze AI-tools als een behulpzame co-piloot zijn, maar ze mogen nooit degene zijn die de auto bestuurt. Ze kunnen helpen uitleggen wat een ziekte is of welke vragen je aan een arts kunt stellen, maar ze kunnen je niet diagnosticeren, niet bepalen of je veilig bent, en niet beslissen over je behandeling. Als je AI gebruikt voor gezondheidsinformatie, moet je onthouden dat het zelfverzekerd maar fout kan zijn, en dat het te moeilijk te lezen kan zijn. Het beste plan is om de AI te gebruiken als startpunt, maar vervolgens een echte menselijke arts het werk te laten controleren.
Kortom: de AI-bibliothecarissen zijn beleefd en snel, maar ze leren nog steeds hoe ze "menselijk" moeten spreken en hoe ze kunnen bewijzen dat ze niet zomaar dingen verzinnen. Totdat ze beter worden, moeten we een mens in de loop houden.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.