Evaluating Five Generative AI Chatbots for Myocarditis-Related Public Health Consultation: A Multidimensional Assessment of Safety, Accuracy, Empathy, Reliability, Quality, and Readability
Deze studie evalueerde vijf generatieve AI-chatbots op volksgezondheidsvragen met betrekking tot myocarditis en stelde vast dat hoewel de meeste antwoorden over het algemeen veilig waren, er significante variaties bestonden in nauwkeurigheid, empathie en kwaliteit, waarbij alle modellen niet voldeden aan de leesbaarheidsdoelstellingen en specifieke risico's vertoonden op het gebied van triage en behandelingsbegeleiding die toezicht door een clinicus noodzakelijk maken.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een superintelligente, alwetende robotvriend hebt die elk vraag aan je kan beantwoorden, van "Waarom is de lucht blauw?" tot "Hoe repareer ik mijn fiets?". Deze robot wordt aangedreven door iets dat Generatieve AI wordt genoemd, een type computerbrein dat leert van een enorme bibliotheek aan menselijke teksten om nieuwe, vloeiende antwoorden te creëren. In de wereld van de gezondheid beginnen mensen deze robots vragen te stellen zoals: "Mijn borst doet pijn na een vaccinatie; is dat ernstig?" of "Kan ik weer gaan voetballen?". Maar hier zit de adder onder het gras: hoewel deze robots erg goed zijn in het klinken van zelfverzekerd en vriendelijk, zijn ze geen artsen. Ze hebben geen hartslag en ze kunnen soms feiten verzinnen of kleine maar gevaarlijke details missen. Dit geldt met name voor een aandoening genaamd myocarditis, wat een chic woord is voor ontsteking van de hartspier. Het is alsof er een vuur brandt in de motor van het hart; soms is het een klein flikkertje, en andere keren is het een woedende inferno die het hart kan doen stoppen met functioneren. Omdat de belangen zo groot zijn, moeten we weten of onze robotvrienden veilig zijn om mee te praten wanneer we ons zorgen maken over ons hart, of dat ze ons per ongeluk een waarschuwingssignaal laten negeren.
Een team van onderzoekers besloot om vijf van deze populaire AI-chatbots op de proef te stellen, waarbij ze hen behandelden als studenten die een zeer serieuze examen afleggen. Ze stelden niet zomaar willekeurige vragen; ze verzamelden 52 echte zorgen die mensen daadwerkelijk hebben over myocarditis, zoals zorgen over pijn op de borst, wat er gebeurt na een infectie, of vaccins veilig zijn en wanneer het weer oké is om te sporten. Ze vroegen elk van de vijf chatbots (ChatGPT, Gemini, DeepSeek, Doubao en Copilot) om deze vragen precies te beantwoorden zoals een gebruiker dat zou doen, zonder speciale instructies om zich beter te gedragen. Vervolgens beoordeelde een groep van vijf expert-cardiologen, die niet wisten welke robot welk antwoord had gegeven, de reacties op een schaal van "veilig" tot "onveilig", "accuraat" tot "foutief", "empathisch" tot "kil" en "makkelijk leesbaar" tot "verwarrend".
De resultaten waren een mix van goed nieuws en enkele ernstige waarschuwingen. Ten eerste het goede nieuws: meestal waren de robots veilig. Ongeveer 90% tot 94% van hun antwoorden bevatte geen gevaarlijk advies. Echter, de onderzoekers ontdekten dat "grotendeels veilig" niet hetzelfde is als "perfect". Zelfs de beste robots maakten fouten in lastige situaties. Zo waren sommige robots te snel met het geruststellen van mensen dat een vaccinatie-gerelateerd hartprobleem onschadelijk was, of gaven ze vaag advies over wanneer men moet stoppen met sporten, wat riskant kan zijn als iemands hart nog steeds ontstoken is. Het is alsof een robot tegen je zegt: "Je automotor is waarschijnlijk in orde," terwijl hij eigenlijk direct naar de garage gesleept moet worden.
Wat betreft nauwkeurigheid en vriendelijkheid waren de robots niet allemaal gelijk. Sommigen, zoals Gemini, Copilot en DeepSeek, waren erg goed in het juist krijgen van de medische feiten. DeepSeek was de "vriendelijkste" van de groep en klonk meer ondersteunend en begripvol voor de angst van een patiënt. Maar dit is het grootste probleem: geen van de robots schreef op een manier die voor een gewone persoon gemakkelijk te begrijpen was. Ze gebruikten allemaal woorden die te complex waren, alsof een professor een simpel concept uitlegt met een woordenboek vol grote woorden. De onderzoekers wilden dat de antwoorden leesbaar waren voor een zesdeklasleerling, maar elke robot faalde voor deze test. Hun antwoorden waren meer als een college tekstboek dan een vriendelijk gesprek.
De studie concludeert dat hoewel deze AI-tools nuttig kunnen zijn voor het leren van algemene feiten over hartgezondheid, ze niet klaar zijn om een vervanging te zijn voor een echte arts. Je moet ze niet vragen te beslissen of je een hartaanval krijgt, of ze je kunnen vertellen of je kunt stoppen met medicijnen, of je het groene licht kunnen geven om een marathon te lopen. De robots zijn als een zeer goed onderlegde bibliotheekassistent die je naar het juiste boek kan wijzen, maar ze kunnen de auto niet voor je besturen. Als je ze gebruikt, heb je een echte menselijke arts nodig om hun antwoorden te controleren, de grote woorden te vertalen naar begrijpelijk Engels, en om er zeker van te zijn dat je geen rode vlaggen mist. De robots worden beter, maar voor iets dat zo delicaat is als jouw hart, hebben ze nog steeds een menselijke supervisor nodig.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.