← Neueste Arbeiten
📄 urology

Evaluation of Large Language Models for Post-Cystectomy Sexual Health Counseling in Women: A Pilot Study

Diese Pilotstudie bewertete drei große Sprachmodelle zur Generierung von sexueller Gesundheitsberatung nach einer Zystektomie und stellte fest, dass ChatGPT die richtlinienkonformsten Antworten lieferte, während alle Modelle Inhalte mit übermäßiger Lesekomplexität erzeugten, wobei die Adhärenz stark von der Prompt-Struktur beeinflusst wurde.

Ursprüngliche Autoren: Shafau, F., Dave, A. A., Omole, I., Guzman, T., Rehman, N., Enemchukwu, E., Bresler, L.

Veröffentlicht 2026-07-08
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Shafau, F., Dave, A. A., Omole, I., Guzman, T., Rehman, N., Enemchukwu, E., Bresler, L.

Originalarbeit lizenziert unter CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ⚕️ Dies ist eine KI-generierte Erklärung eines Preprints, das nicht peer-reviewed wurde. Dies ist kein medizinischer Rat. Treffen Sie keine Gesundheitsentscheidungen auf Grundlage dieses Inhalts. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie hätten drei verschiedene „digitale Bibliothekare“ (ChatGPT, Gemini und Perplexity) und Sie bitten sie, einen Leitfaden für Frauen zu schreiben, die sich einer großen Blasenoperation namens Zystektomie unterziehen müssen. Speziell möchten Sie, dass sie erklären, was mit ihrer sexuellen Gesundheit und ihren Beziehungen nach der Operation passieren wird.

Diese Studie ist wie ein Zeugnis für diese Bibliothekare. Die Forscher wollten zwei Dinge herausfinden:

  1. Haben sie sich an das Regelwerk gehalten? (Haben sie alle wichtigen Ratschläge aufgeführt, die Ärzte geben sollten?)
  2. War die Sprache zu schwer zu verstehen? (Schrieben sie wie ein Professor oder wie ein freundlicher Nachbar?)

Hier ist das, was sie herausgefunden haben, einfach aufgeschlüsselt:

1. Der „Regelwerk“-Test (Einhaltung von Leitlinien)

Die Forscher gaben den Bibliothekaren eine Checkliste, die auf offiziellen medizinischen Leitlinien basierte. Sie baten die Bibliothekare, sechs verschiedene Fragen über das Leben nach der Operation zu beantworten.

  • Der Gewinner: ChatGPT war der beste Schüler. Es hielt sich am engsten an das Regelwerk und deckte etwa 77 % der erforderlichen Punkte ab.
  • Die Zweitplatzierten: Gemini und Perplexity schnitten deutlich schlechter ab und deckten nur etwa 50 % bzw. 46 % der Punkte ab. Sie ließen viel der wichtigen Ratschläge aus.
  • Der „Trick mit der einfachen Frage“: Die Forscher bemerkten etwas Interessantes. Wenn sie die Bibliothekare mit einfacher, alltäglicher Sprache fragten (so wie ein Patient fragen würde), waren die Antworten besser und hielten sich häufiger an die Regeln. Wenn sie unter Verwendung von komplexem medizinischem Jargon fragten (so wie ein Arzt fragen würde), wurden die Bibliothekare tatsächlich schlechter darin, den Regeln zu folgen. Es ist, als ob die Bibliothekare durch die schicken Wörter verwirrt wurden und die Grundlagen vergaßen.

2. Der „Leseniveau“-Test (Lesbarkeit)

Selbst wenn die Bibliothekare die Fakten richtig hatten, spielt es keine Rolle, wenn der Patient die Antwort nicht lesen kann. Die Forscher prüften, wie schwer der Text zu verstehen war.

  • Das Problem: Alle drei Bibliothekare schrieben in einer Sprache, die zu schwer war. Sie schrieben auf einem Niveau, das für Hochschulabsolventen oder sogar Menschen mit fortgeschrittenen akademischen Graden geeignet ist.
  • Die Realität: Die meisten Menschen lesen auf einem 6. Klasse-Niveau. Wenn man einem Patienten, der bereits wegen einer Krebsoperation gestresst ist, ein Merkblatt auf dem Niveau der 12. oder 16. Klasse aushändigt, wird er es vielleicht gar nicht verstehen.
  • Der Vergleich: Perplexity schrieb die schwierigste, „akademische“ Prosa. Gemini war etwas einfacher, aber immer noch zu komplex. ChatGPT war am einfachsten zu lesen von den dreien, aber selbst es war immer noch zu schwer für den Durchschnittsmenschen.

3. Die Entdeckung „Einer großen Idee“

Die Forscher verwendeten ein spezielles mathematisches Werkzeug (eine Hauptkomponentenanalyse), um die verschiedenen Arten zu untersuchen, wie sie „Schwierigkeit“ gemessen haben. Sie fanden heraus, dass alle verschiedenen Tests für Schwierigkeit im Grunde dasselbe maßen. Es ist, als hätte man fünf verschiedene Lineale, die alle sagen, dass der Tisch 1,80 Meter lang ist; es sind nicht fünf verschiedene Messungen, sondern nur fünf Wege, dasselbe zu sagen. Dies bestätigte, dass der Text flächendeckend zu komplex war.

Das Fazit

Betrachten Sie diese KI-Tools als sehr sachkundige, aber etwas ungeschickte Assistenten.

  • ChatGPT ist der zuverlässigste Assistent, wenn es darum geht, sich an die wichtigen Regeln zu erinnern, aber selbst es spricht in einer Sprache, die für einen Patienten zu schick ist, um sie leicht verdauen zu können.
  • Gemini und Perplexity sind weniger zuverlässig bei den Regeln und sprechen eine noch kompliziertere Sprache.
  • Der Prompt zählt: Wenn Sie diese Assistenten in einfachem, klarem Englisch fragen, machen sie tatsächlich einen besseren Job bei der Einhaltung der Regeln, als wenn Sie versuchen, wie ein Arzt zu klingen.

Die Erkenntnis: Obwohl diese KI-Tools hilfreich sein können, produzieren sie derzeit Informationen, die zu komplex sind, als dass Patienten sie verstehen könnten, und sie variieren stark darin, wie viel wichtige medizinische Beratung sie enthalten. Sie sind noch nicht bereit, das Gespräch eines Arzors zu ersetzen, insbesondere bei sensiblen Themen wie der sexuellen Gesundheit nach einer Krebsoperation.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →