Assessing the Quality, Safety, and Readability of Large Language Model Responses from ChatGPT and Gemini for Knee Osteoarthritis Patient Education
In einer vergleichenden Evaluierung der Patientenaufklärung bei Kniearthrose zeigte ChatGPT eine im Vergleich zu Gemini überlegene, von Klinikern bewertete Genauigkeit und Vollständigkeit, obwohl beide Modelle Inhalte mit Lesbarkeitsniveaus erzeugten, die die empfohlenen Standards überschritten, und vor der klinischen Anwendung einer professionellen Überprüfung bedürfen.
Originalarbeit lizenziert unter CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich vor, Sie haben ein schmerzendes Knie und möchten wissen, wie Sie es heilen können. Anstatt einen Arzt anzurufen, fragen Sie zwei verschiedene superintelligente Roboter-Bibliothekare: ChatGPT und Gemini. Sie stellen ihnen 36 verschiedene Fragen zu Ihren Knieschmerzen, die von „Welche Übungen helfen?“ bis hin zu „Kann ich dieses spezifische Unani-Medikament einnehmen?“ reichen.
Diese Studie ist wie ein Zeugnis, das die Antworten dieser beiden Roboter-Bibliothekare auf diese Fragen vergleicht. Hier ist, was die Forscher herausgefunden haben, einfach erklärt:
Der Aufbau: Ein Blindverkostungstest
Die Forscher haben die Roboter nicht nur gefragt; sie ließen fünf erfahrene Knie-Ärzte (die seit über 10 Jahren praktizieren) die Antworten bewerten. Die Ärzte wussten nicht, welcher Roboter welche Antwort geschrieben hatte – sie waren gegenüber der Marke „blind“. Sie bewerteten die Antworten nach fünf Kriterien:
- Genauigkeit (Accuracy): Ist die Tatsache wahr?
- Vollständigkeit (Completeness): Wurde die ganze Geschichte erzählt oder nur ein Teil davon?
- Klarheit (Clarity): War es leicht zu verstehen?
- Sicherheit (Safety): Wurde Ratschläge gegeben, die Ihnen schaden könnten?
- Vertrauenswürdigkeit (Trustworthiness): Klangen sie zuverlässig?
Sie prüften auch, wie „schwer“ das Lesen war, so als würde man prüfen, ob ein Buch für einen Sechstklässler oder einen College-Professor geschrieben ist.
Die Ergebnisse: Wer hat gewonnen?
1. Der „Faktencheck“-Score (Genauigkeit & Vollständigkeit)
- Der Gewinner: ChatGPT.
- Die Analogie: Stellen Sie sich vor, Sie backen einen Kuchen. Wenn Sie nach einem Rezept fragen, gab Gemini Ihnen ein Rezept, das weitgehend korrekt war, aber einige wichtige Zutaten vergessen hatte (wie zum Beispiel die Erwähnung, dass Sie Eier benötigen). ChatGPT gab Ihnen ein Rezept, das nicht nur korrekt war, sondern auch alle Schritte und Warnungen enthielt.
- Die Daten: Die Ärzte gaben ChatGPT höhere Punktzahlen für die Genauigkeit und Vollständigkeit. Dieser Unterschied war stark genug, um nicht nur ein glücklicher Zufall zu sein.
2. Der „Sicherheits- & Vertrauens“-Score
- Das Ergebnis: Es war ein Unentschieden.
- Die Analogie: Beide Roboter waren gleichermaßen vorsichtig darauf bedacht, Ihnen nicht zu raten, etwas Gefährliches zu tun (wie etwa Ihre Medikamente ohne Rücksprache mit einem Arzt abzusetzen). Keiner war signifikant sicherer oder vertrauenswürdiger als der andere.
3. Der „Leseniveau“-Score
- Der Gewinner: Gemini (mit einem kleinen Vorsprung).
- Die Analogie: Denken Sie an das Leseniveau wie an die Höhe eines Zauns. Beide Roboter bauten Zäune, die zu hoch waren, um ein durchschnittlicher Mensch leicht darüber springen zu können. Jedoch war der Zaun von Gemini etwas niedriger (leichter zu überspringen) als der von ChatGPT.
- Der Haken: Obwohl Gemini „einfacher“ war, schrieben beide auf einem Niveau, das für viele Patienten zu schwer ist. Sie schrieben wie College-Studenten, aber medizinische Ratschläge sollten auf dem Niveau eines 6. oder 8. Klässlers verfasst sein.
Das „Menschliche Faktor“-Problem
Hier ist der knifflige Teil der Studie: Die fünf Ärzte, die die Antworten bewerteten, waren sich nicht immer einig.
- Die Analogie: Stellen Sie sich fünf Preisrichter bei einer Talentshow vor. Wenn ein Richter einem Sänger eine 4/5 und ein anderer eine 2/5 gibt, ist es schwer zu wissen, wer recht hat.
- Was das bedeutet: Die Ärzte hatten Schwierigkeiten, sich über die „Klarheit“ oder „Sicherheit“ der Antworten einig zu sein. Doch wenn man den Durchschnitt aller fünf Ärzte betrachtete, war der Unterschied zwischen ChatGPT und Gemini in Bezug auf die Genauigkeit immer noch deutlich erkennbar.
Die „Unani“-Besonderheit
Die Studie beinhaltete Fragen zur Unani-Medizin (einem traditionellen Heilsystem, das in Südasien beliebt ist) und kulturelle Gewohnheiten wie das Beten auf dem Boden. Die Forscher wollten sehen, ob die Roboter dieses spezifische kulturelle Verständnis besitzen. Während die Studie diese Fragen untersuchte, lag die Hauptschlussfolgerung bei der allgemeinen Qualität der Antworten und nicht bei einem spezifischen Ranking dafür, wie gut sie speziell mit der Unani-Medizin umgingen.
Das Fazzeit
Wenn Sie ein Patient mit Knieschmerzen sind und diese Roboter um Hilfe bitten:
- ChatGPT liefert tendenziell vollständigere und genauere Informationen, wie ein detailliertes Lexikon.
- Gemini ist etwas leichter zu lesen, aber nicht viel.
- Beide schreiben auf einem Niveau, das für den Durchschnittsmenschen möglicherweise zu kompliziert ist, um es leicht zu verstehen.
Die letzte Warnung: Die Forscher sagen, dass – obwohl ChatGPT besser abschnitt – keiner der Roboter ohne die vorherige Prüfung durch einen menschlichen Arzt verwendet werden sollte. Sie sollten die Antwort des Roboters nicht als das letzte Wort betrachten; ein echter Arzt muss die Arbeit überprüfen, um sicherzustellen, dass sie sicher und richtig für Sie ist.
Kurz gesagt: ChatGPT war das bessere „Lehrbuch“, aber beide brauchen einen Lehrer (einen Arzt), der den Schülern (dem Patienten) die Lektionen erklärt.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.