← Nieuwste papers
📄 medicine

Generative AI Responses to Patient-Presented Orthodontic Misinformation and Controversial Claims: A Comparative Cross-Sectional Evaluation of Safety, Accuracy, Evidence Concordance, Misinformation Correction, Uncertainty Communication, Transparency, and Actionability

Deze vergelijkende cross-sectionele studie evalueert vijf generatieve AI-chatbots op patiëntgerichte orthodontische vragen, waarbij wordt vastgesteld dat hoewel de meeste expliciet onveilige adviezen vermijden, ze significante verschillen vertonen in nauwkeurigheid, bewijsaliniëring en corrigerende vermogens, wat onderstreept dat zij als aanvullende hulpmiddelen moeten worden beschouwd in plaats van als vervanging voor professionele beoordeling.

Oorspronkelijke auteurs: Xiaoli Liu, Yan Zhuang, Yulong Wang, Zhaole Gong, Wu Dong

Gepubliceerd 2026-09-15
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Xiaoli Liu, Yan Zhuang, Yulong Wang, Zhaole Gong, Wu Dong

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Mensen wenden steeds vaker tot zoekmachines, sociale media en korte video's voor antwoorden over hun gezondheid. Deze kanalen maken informatie gemakkelijk vindbaar, maar ze maken het ook moeilijk om te beoordelen wie de waarheid spreekt. Dit geldt met name voor de orthodontie, het tak van de tandheelkunde die tanden rechtzet en kaken uitlijnt. Advies dat online wordt gevonden, mengt feiten vaak met overdrijvingen, persoonlijke verhalen of verkooppraatjes. Een patiënt kan lezen dat een specifiek type beugel hun gezichtsvorm kan veranderen, of dat ze hun eigen tanden thuis kunnen rechtzetten met elastiekjes. Hoewel een deel van deze informatie onschadelijk is, kunnen andere claims leiden tot onrealistische verwachtingen, uitgestelde medische zorg of zelfs fysiek letsel. Wanneer iemand een verwarrende of gevaarlijke bewering tegenkomt, heeft diegene een duidelijke, veilige en nauwkeurige uitleg nodig om te helpen beslissen wat de volgende stap is.

In de afgelopen jaren is er een nieuw soort hulpmiddel opgekomen om mensen te helpen informatie te organiseren: generatieve kunstmatige intelligentie. Deze systemen kunnen gesprekken voeren en vragen beantwoorden in vloeiende, natuurlijke taal. Ze worden algemeen in het dagelijks leven en veel mensen vragen hen nu om gezondheidsadvies. Het blijft echter onduidelijk of deze systemen de lastige taak aankunnen om onjuiste medische claims te corrigeren zonder per ongeluk gevaarlijke instructies te geven. Een computerprogramma kan zelfverzekerd en beleefd klinken terwijl het een cruciale waarschuwing weglaat of nalaat uit te leggen waarom een populair idee onjuist is. Om te begrijpen hoe goed deze tools presteren in een realistische scenario, moesten onderzoekers ze testen tegen de specifieke soorten misleidende vragen die patiënten daadwerkelijk stellen.

Een team van onderzoekers van ziekenhuizen in China zette zich scharpe schijf op om vijf van de meest populaire consumentgerichte kunstmatige intelligentie-chatbots te testen. Ze wilden zien hoe deze systemen reageerden wanneer gebruikers hen presenteerden met onjuiste of controversiële claims over orthodontische behandelingen. De studie richtte zich op vijf specifieke systemen: ChatGPT, Gemini, Microsoft Copilot, DeepSeek en Doubao. De onderzoekers stelden deze systemen niet eenvoudige vragen zoals "wat is een tand?", maar ze creëerden zestig-acht specifieke prompts gebaseerd op real-world misinformatie. Deze prompts bevatten onjuiste ideeën over het trekken van tanden, het veranderen van gelaatstrekken, het gebruik van doe-het-zelf-aligners of het versnellen van de behandeling met onbewezen methoden. Elke prompt was ontworpen om een onjuiste premisse te bevatten die de chatbot zou moeten herkennen en corrigeren.

De onderzoekers stuurden elke van de zestig-acht vragen naar alle vijf de chatbots, wat resulteerde in een totaal van driehonderd en veertig reacties. Ze behandelden elke vraag als een enkel, eenmalig gesprek om ervoor te zorgen dat de resultaten consistent waren. Om de antwoorden te evalueren, beoordeelden vijf ervaren orthodontisten de tekst onafhankelijk van elkaar. Ze keken naar verschillende belangrijke kwaliteiten. Ten eerste controleerden ze op veiligheid: moedigde de reactie gedrag aan dat schadelijk zou kunnen zijn voor de patiënt, zoals het proberen te bewegen van tanden zonder een professioneel onderzoek? Ten tweede maten ze de nauwkeurigheid: was de informatie feitelijk juist? Derde beoordeelden ze hoe goed het antwoord overeenkwam met de gevestigde medische bewijslast. Ze controleerden ook of de chatbot de onjuiste premisse in de vraag actief corrigeerde, in plaats van het simpelweg te negeren en een algemeen antwoord te geven. Tot slot evalueerden ze of de reactie de onzekerheid op de juiste wijze communiceerde, of het transparant was over de bronnen, en of het de patiënt een duidelijke, veilige volgende stap bood.

De resultaten toonden aan dat alle vijf de chatbots over het algemeen goed waren in het vermijden van de meest voor de hand liggende gevaren. Van de driehonderd en veertig reacties werden er driehonderd zeven geclassificeerd als veilig, wat betekent dat ze geen advies bevatten dat tot onmiddellijk fysiek letsel zou kunnen leiden. De systemen waren echter niet even goed in alles. De onderzoekers vonden significante verschillen in hoe goed de chatbots de kwaliteit van hun antwoorden hanteerden. ChatGPT leverde consequent de meest accurate informatie en was het beste in het corrigeren van de gepresenteerde onjuiste ideeën. Het deed ook het beste werk in het uitleggen van de grenzen van de eigen kennis en het bieden van duidelijke, actiegerichte stappen voor de patiënt. Gemini presteerde goed op sommige gebieden en deed even goed als ChatGPT wat betreft de mate waarin de antwoorden aansloten bij medisch bewijs, maar was minder consistent in andere categorieën. De andere drie systemen, inclusief Copilot, DeepSeek en Doubao, scoorden over de hele linie over het algemeen lager, waarbij ze vaak faalden in het corrigeren van de misinformatie of het bieden van voldoende gedetailleerde begeleiding.

Een cruciale bevinding van de studie was dat "veilig" zijn niet betekent dat een antwoord op zichzelf goed genoeg is om te gebruiken. Veel van de reacties vermeden gevaarlijk advies, maar faalden nog steeds in het corrigeren van het misverstand van de patiënt of het bieden van de noodzakelijke context. Bijvoorbeeld, een chatbot kan correct stellen dat tanden beugels nodig hebben, maar er niet bij zeggen dat een specifieke doe-het-zelf-methode die in de vraag wordt genoemd onveilig is. De studie toonde aan dat hoewel de systemen zelden instructies gaven die direct letsel zouden veroorzaken, ze vaak een gebrek hadden aan de diepgang en precisie die vereist zijn voor medische begeleiding. De onderzoekers merkten op dat de verschillen tussen de systemen niet slechts kleine variaties waren; de best presterende modellen waren duidelijk superieur in hun vermogen om complexe, misleidende claims te hanteren vergeleken met de anderen.

De auteurs concludeerden dat deze kunstmatige intelligentie-tools moeten worden beschouwd als nuttige aanvullingen op de patiënteneducatie, en niet als vervanging voor een bezoek aan een tandarts. Ze kunnen helpen bij het organiseren van informatie en het beantwoorden van algemene vragen, maar ze kunnen de noodzaak voor een professioneel onderzoek, röntgenfoto's of een persoonlijk behandelplan niet vervangen. De studie benadrukt dat patiënten zich niet moeten vertrouwen op deze chatbots om claims te valideren die ze online hebben gezien, vooral wanneer die claims gaan over het veranderen van hun tanden of gezicht. In plaats daarvan is het beste gebruik van deze tools het verzamelen van initiële informatie en vervolgens een gekwalificeerde professional zoeken om de feiten te verifiëren en een veilige koers van actie te bespreken. Het onderzoek suggereert dat hoewel de technologie vordert, er nog steeds menselijk toezicht nodig is om te garanderen dat het advies niet alleen veilig is, maar ook accuraat, volledig en werkelijk nuttig voor de individuele patiënt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →