Performance of Large Language Models in Providing Patient-Oriented Information on Gingival Recession: A Comparative Study
Diese Vergleichsstudie ergab, dass ChatGPT, Google Gemini und Claude zwar ähnlich genaue und umfassende patientenorientierte Informationen über Zahnfleischrückgang bereitstellen, Experten jedoch Gemini und Claude bevorzugten, obwohl ChatGPT schnellere Antwortzeiten und eine größere Prägnanz aufwies.
Originalarbeit lizenziert unter CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Immer häufiger wenden sich Patienten an künstliche Intelligenz, um ihre Gesundheit zu verstehen, und fragen Chatbots nach Rat bei allem, von der gewöhnlichen Erkältung bis hin zu komplexen Zahnproblemen. Diese Werkzeuge, bekannt als große Sprachmodelle, sind darauf ausgelegt, in natürlicher Sprache zu kommunizieren und bieten direkte Antworten anstelle einer Liste von Suchlinks. Ein solcher Zustand, der rezessive Gingiva (Zahnfleischrückgang), tritt auf, wenn sich das das Zahnfleisch, das die Zähne umgibt, zurückzieht und die Zahnwurzel freilegt. Diese Freilegung kann zu Empfindlichkeit, Karies und ästhetischen Bedenken führen, was viele Menschen dazu veranlasst, Informationen online zu suchen, bevor sie einen Zahnarzt aufsuchen. Während diese digitalen Assistenten versprechen, die Lücke zwischen Patienten und medizinischem Wissen zu schließen, bleiben Fragen offen, ob sie zuverlässige, vollständige und sichere Informationen liefern, insbesondere bei spezifischen zahnmedizinischen Problemen, bei denen Präzision entscheidend ist.
Eine aktuelle Studie untersuchte, wie gut drei führende Systeme der künstlichen Intelligenz Fragen zum Zahnfleischrückgang behandeln. Die Forscher konzentrierten sich auf ChatGPT, Google Gemini und Claude und stellten jedem von ihnen dieselben zwanzig Fragen, die ein typischer Patient stellen könnte. Diese Anfragen deckten die Ursachen des Zustands, Behandlungsoptionen, Risiken und die Erwartungen nach einer Operation ab. Um sicherzustellen, dass die Antworten fair bewertet wurden, überprüften fünf Fachärzte für Parodontologie jede Antwort, ohne zu wissen, welches Computerprogramm die Antwort generiert hatte. Die Experten bewerteten die Antworten danach, wie faktisch korrekt sie waren, wie vollständig die Informationen waren und wie gut die Modelle im Hinblick auf die Gesamtqualität miteinander verglichen wurden. Sie maßen auch, wie lange jedes System benötigte, um seine Antwort zu schreiben, und zählten die Anzahl der verwendeten Wörter.
Die Ergebnisse zeigten, dass alle drei Systeme der künstlichen Intelligenz in Bezug auf die Kernfakten bemerkenswert gut abschnitten. Es gab keinen signifikanten Unterschied in der Genauigkeit oder Vollständigkeit der bereitgestellten Informationen durch ChatGPT, Gemini oder Claude. Jedes System schaffte es, Antworten zu generieren, die die Experten als klinisch akzeptabel empfanden, wobei die meisten Antworten hohe Punktzahlen für die Richtigkeit erhielten. Die Modelle unterschieden sich jedoch merklich darin, wie sie diese Informationen lieferten. ChatGPT war am schnellsten und erstellte seine Antworten in durchschnittlich weniger als sechs Sekunden, während Claude fast fünfzehn Sekunden benötigte. ChatGPT schrieb auch die prägnantesten Antworten mit durchschnittlich etwa 232 Wörtern pro Antwort. Im Gegensatz dazu lieferte Gemini die längsten Antworten mit durchschnittlich 438 Wörtern, und Claude lag irgendwo dazwischen.
Trotz der ähnlichen Qualität der Fakten hatten die menschlichen Experten eine klare Präferenz dafür, wie die Informationen präsentiert wurden. Als sie gebeten wurden, die Antworten von der besten zur schlechtesten zu ranken, wurden Gemini und Claude häufiger als die beste Antwort ausgewählt als ChatGPT. Die Experten wählten Gemini und Claude in 38 Prozent der Fälle als die beste Antwort aus, während ChatGPT nur in 24 Prozent der Bewertungen den ersten Platz belegte. Dies deutet darauf hin, dass ChatGPT zwar schneller und kürzer war, die anderen beiden Modelle jedoch einen Erklärungsstil boten, den die Spezialisten als gründlicher oder besser organisiert empfanden. Die Studie fand auch heraus, dass alle drei Modelle besonders gut darin waren, Fragen zur postoperativen Pflege und zu Nachsorgeanweisungen zu beantworten, da diese Themen wahrscheinlich auf standardisierten Leitlinien basieren. Sie waren etwas weniger konsistent, wenn es um die spezifische Diagnose oder die Eignung für eine Behandlung ging, was ein eher individuelles Urteil erfordert.
Letztendlich kommt die Studie zu dem Schluss, dass diese Werkzeuge der künstlichen Intelligenz zuverlässig genug werden, um als hilfreiche Ergänzung zur Patientenaufklärung zu dienen. Sie können genaue und detaillierte Informationen über den Zahnfleischrückgang liefern, die professionellen Standards entsprechen. Die Forscher betonen jedoch, dass diese Werkzeuge eine Konsultation bei einem Zahnarzt unterstützen, aber nicht ersetzen sollten. Der beste Ansatz besteht darin, diese schnellen und wissensreichen Systeme zu nutzen, um ein allgemeines Verständnis für eine Erkrankung zu erlangen, während man sich auf einen menschlichen Experten verlässt, um diese Informationen im Kontext der eigenen spezifischen gesundheitlichen Bedürfnisse zu interpretieren.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.