Generative AI Responses to Patient-Presented Orthodontic Misinformation and Controversial Claims: A Comparative Cross-Sectional Evaluation of Safety, Accuracy, Evidence Concordance, Misinformation Correction, Uncertainty Communication, Transparency, and Actionability
Diese vergleichende Querschnittsstudie evaluiert fünf generative KI-Chatbots hinsichtlich patientenbezogener kieferorthopädischer Anfragen und stellt fest, dass diese zwar größtenteils offensichtlich unsichere Ratschläge vermeiden, jedoch signifikante Unterschiede in der Genauigkeit, der Übereinstimmung mit Evidenz und den Korrekturfähigkeiten aufweisen, was die Notwendigkeit unterstreicht, sie als ergänzende Werkzeuge und nicht als Ersatz für eine professionelle Beurteilung zu betrachten.
Originalarbeit lizenziert unter CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Immer häufiger wenden sich Menschen an Suchmaschinen, soziale Medien und Kurzvideos, um Antworten auf ihre Gesundheitsfragen zu finden. Diese Kanäle machen Informationen leicht auffindbar, erschweren es jedoch gleichzeitig, zu beurteilen, wer die Wahrheit sagt. Dies gilt insbesondere für die Kieferorthopädie, das Fachgebiet der Zahnmedizin, das sich mit dem Begradigen von Zähnen und der Ausrichtung des Kiefers befasst. Ratschläge, die online zu finden sind, vermischen oft Fakten mit Übertreibungen, persönlichen Geschichten oder Verkaufsstrategien. Ein Patient könnte lesen, dass eine bestimmte Art von Spange sein Gesicht verändern kann oder dass er seine Zähne zu Hause mit Gummibändern selbst begradigen kann. Während ein Teil dieser Informationen harmlos ist, können andere Behauptungen zu unrealistischen Erwartungen, verzögerter medizinischer Versorgung oder sogar körperlichen Verletzungen führen. Wenn eine Person auf eine verwirrende oder gefährliche Behauptung stößt, benötigt sie eine klare, sichere und genaue Erklärung, um entscheiden zu können, was als Nächstes zu tun ist.
In den letzten Jahren ist ein neues Werkzeug entstanden, das Menschen hilft, Informationen zu organisieren: generative künstliche Intelligenz. Diese Systeme können Gespräche führen und Fragen in flüssiger, natürlicher Sprache beantworten. Sie werden im Alltag immer üblicher, und viele Menschen fragen sie nun nach Gesundheitsratschlägen. Es bleibt jedoch unklar, ob diese Systeme die schwierige Aufgabe bewältigen können, falsche medizinische Behauptungen zu korrigieren, ohne versehentlich gefährliche Anweisungen zu geben. Ein Computerprogramm kann zwar selbstbewusst und höflich klingen, dabei aber eine entscheidende Warnung auslassen oder nicht erklären, warum eine populäre Idee falsch ist. Um zu verstehen, wie gut diese Werkzeuge in einem realen Szenario abschneiden, mussten Forscher sie gegen die spezifischen Arten von irreführenden Fragen testen, die Patienten tatsächlich stellen.
Ein Forscherteam aus Krankenhäusern in China unternahm den Versuch, fünf der populärsten, für Endverbraucher zugänglichen KI-Chatbots zu testen. Sie wollten sehen, wie diese Systeme reagierten, wenn Nutzer ihnen falsche oder kontroverse Behauptungen über kieferorthopädische Behandlungen präsentierten. Die Studie konzentrierte sich auf fünf spezifische Systeme: ChatGPT, Gemini, Microsoft Copilot, DeepSeek und Doubao. Die Forscher stellten diesen Systemen keine einfachen Fragen wie „Was ist ein Zahn?“, stattdessen erstellten sie achtundsechzig spezifische Prompts, die auf realweltlichen Fehlinformationen basierten. Diese Prompts enthielten falsche Ideen über das Ziehen von Zähnen, die Veränderung von Gesichtszügen, die Verwendung von Do-it-yourself-Alignern oder die Beschleunigung der Behandlung mit unbewiesenen Methoden. Jeder Prompt war so konzipiert, dass er eine falsche Prämisse enthielt, die der Chatbot erkennen und korrigieren müsste.
Die Forscher leiteten jede der achtundsechzig Fragen an alle fünf Chatbots weiter und generierten so insgesamt dreihundertvierzig Antworten. Sie behandelten jede Frage als ein einzelnes, einmaliges Gespräch, um die Ergebnisse konsistent zu halten. Zur Bewertung der Antworten wurden fünf erfahrene Kieferorthopäden die Texte unabhängig voneinander geprüft. Sie untersuchten mehrere Schlüsselqualitäten. Zuerst prüften sie die Sicherheit: Förderte die Antwort ein Verhalten, das dem Patienten schaden könnte, wie etwa das Versuchen, Zähne ohne professionelle Untersuchung zu bewegen? Zweitens maßen sie die Genauigkeit: War die Information faktisch korrekt? Drittens bewerteten sie, wie gut die Antwort mit der etablierten medizinischen Evidenz übereinstimmte. Sie prüften auch, ob der Chatbot die falsche Prämisse der Frage aktiv korrigierte, anstatt sie nur zu ignorieren und eine allgemeine Antwort zu geben. Schließlich bewerteten sie, ob die Antwort die Unsicherheit angemessen kommunizierte, ob sie transparent über ihre Quellen war und ob sie dem Patienten einen klaren, sicheren nächsten Schritt aufzeigte.
Die Ergebnisse zeigten, dass alle fünf Chatbots im Allgemeinen gut darin waren, die offensichtlichsten Gefahren zu vermeiden. Von den dreihundertvierzig Antworten wurden dreihundertsieben als sicher eingestuft, was bedeutet, dass sie keine Ratschläge enthielten, die zu unmittelbarer körperlicher Schädigung führen könnten. Die Systeme waren jedoch nicht in allen Bereichen gleichermaßen gut. Die Forscher stellten signifikante Unterschiede darin fest, wie gut die Chatbots die Qualität ihrer Antworten handhabten. ChatGPT lieferte konsistent die genauesten Informationen und war am besten darin, die in den Fragen präsentierten falschen Ideen zu korrigieren. Es war auch am besten darin, die Grenzen seines Wissens aufzuzeigen und klare, umsetzbare Schritte für den Patienten anzubieten. Gemini schnitt in einigen Bereichen gut ab und lag bei der Übereinstimmung der Antworten mit der medizinischen Evidenz gleichauf mit ChatGPT, war jedoch in anderen Kategorien weniger konsistent. Die anderen drei Systeme, einschließlich Copilot, DeepSeek und Doubao, schnitten generell flächendeckend schlechter ab und versäumten es oft, die Fehlinformationen zu korrigieren oder ausreichend detaillierte Anleitungen zu geben.
Ein entscheidender Befund der Studie war, dass „sicher“ zu sein nicht bedeutet, dass eine Antwort für sich genommen gut genug ist. Viele der Antworten vermieden zwar gefährliche Ratschläge, versäumten es aber dennoch, das Missverständnis des Patienten zu korrigieren oder den notwendigen Kontext zu liefern. Zum Beispiel könnte ein Chatbot korrekt feststellen, dass Zähne eine Spange benötigen, aber versäumen, zu erklären, dass eine spezifische Do-it-yourself-Methode, die in der Frage erwähnt wurde, unsicher ist. Die Studie zeigte, dass die Systeme zwar selten Anweisungen gaben, die eine unmittelbare Verletzung verursachen würden, aber oft nicht die Tiefe und Präzision besaßen, die für eine medizinische Beratung erforderlich sind. Die Forscher merkten an, dass die Unterschiede zwischen den Systemen nicht nur geringfügige Variationen waren; die leistungsstärkeren Modelle waren deutlich überlegen in ihrer Fähigkeit, komplexe, irreführende Behauptungen zu handhaben, verglichen mit den anderen.
Die Autoren kamen zu dem Schluss, dass diese Werkzeuge der künstlichen Intelligenz als hilfreiche Ergänzungen zur Patientenaufklärung betrachtet werden sollten, nicht als Ersatz für einen Besuch beim Zahnarzt. Sie können helfen, Informationen zu organisieren und allgemeine Fragen zu beantworten, aber sie können nicht den Bedarf an einer professionellen Untersuchung, Röntgenaufnahmen oder einem personalisierten Behandlungsplan ersetzen. Die Studie unterstreicht, dass Patienten sich nicht darauf verlassen sollten, dass diese Chatbots Behauptungen validieren, die sie online gesehen haben, insbesondere wenn diese Behauptungen die Veränderung ihrer Zähne oder ihres Gesichts betreffen. Stattdessen ist der beste Einsatz dieser Werkzeuge, erste Informationen zu sammeln und dann einen qualifizierten Fachmann aufzusuchen, um die Fakten zu überprüfen und einen sicheren Kurs der Vorgehensweise zu besprechen. Die Forschung legt nahe, dass die Technologie zwar voranschreitet, aber dennoch menschliche Aufsicht erfordert, um sicherzustellen, dass der gegebene Rat nicht nur sicher, sondern auch korrekt, vollständig und für den einzelnen Patienten wirklich hilfreich ist.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.