Performance, safety, and repeated-query stability of large language models versus early-career urologists in urological oncology: a source-masked vignette benchmark
Diese Studie zeigt, dass urologische Fachärzte am Anfang ihrer Karriere im Bereich der urologischen Onkologie hinsichtlich der Gesamtgenauigkeit, Sicherheit und Antwortstabilität die gängigen Large Language Models für Endverbraucher deutlich übertreffen, wobei die häufigen sicherheitskritischen Fehler und inkonsistenten Ausgaben der Modelle die Notwendigkeit einer klinischen Aufsicht anstelle eines autonomen Einsatzes unterstreichen.
Originalarbeit lizenziert unter CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
In der sich schnell entwickelnden Landschaft der modernen Medizin hat die künstliche Intelligenz damit begonnen, eine neue Art der Unterstützung zu bieten, die in der Lage ist, riesige Bibliotheken medizinischer Literatur zu lesen und komplexe Fragen in Sekundenschnelle zu beantworten. Diese Systeme, bekannt als große Sprachmodelle, funktionieren durch das Vorhersagen der wahrscheinlichsten Wörter, die auf einen Prompt folgen, was es ihnen ermöglicht, kohärente und oft überzeugende Antworten auf klinische Szenarien zu generieren. Für Ärzte verspricht diese Technologie ein leistungsstarkes Werkzeug, um Informationen zu organisieren, Leitlinien zu prüfen und die Entscheidungsfindung zu unterstützen. Das Fachgebiet der Medizin basiert jedoch auf einem Fundament der Präzision und Sicherheit, in dem ein einz Kann Fehler im Urteil lebensverändernde Folgen haben kann. Die entscheidende Frage, vor der die medizinische Gemeinschaft steht, ist nicht nur, ob diese Maschinen kompetent klingen können, sondern ob man ihnen vertrauen kann, sichere, konsistente und vollständige Entscheidungen zu treffen, wenn die Gesundheit eines Patienten auf dem Spiel steht.
Um dies zu beantworten, entwarf ein Forscherteam in der Türkei einen strengen Test, um zu sehen, wie gut drei populäre, für Endverbraucher entwickelte Systeme der künstlichen Intelligenz in der hochsensiblen Welt der urologischen Onkologie abschnitten, die sich mit Krebs des Harnsystems befasst. Sie erstellten einhundert detaillierte, synthetische Patientengeschichten, die fünf verschiedene Arten von Krebs und verschiedene Phasen der Versorgung abdeckten, von der Erstdiagnose bis zur langfristigen Nachsorge. Diese Geschichten wurden den drei Modellen der künstlichen Intelligenz sowie zwei jungen Urologen vorgelegt, die vor kurzem ihre spezialisierte Ausbildung abgeschlossen hatten. Den Ärzten und den Maschinen wurden exakt dieselben Anweisungen gegeben, und es war ihnen nicht gestattet, Antworten nachzuschlagen oder externe Ressourcen zu nutzen. Zwei unabhängige Experten, die nicht wussten, ob die Antworten von einem Menschen oder einer Maschine stammten, bewerteten daraufhin jede einzelne Antwort anhand eines strengen Satzes von Richtlinien, die von der Europäischen Vereinigung für Urologie festgelegt wurden. Bei der Bewertung wurde auf vier Punkte geachtet: ob der Rat den aktuellen medizinischen Leitlinien entsprach, ob er sicher für den Patienten war, ob er alle notwendigen Schritte abdeckte und ob das Krankheitsstadium korrekt identifiziert wurde.
Die Ergebnisse zeigten eine deutliche Lücke zwischen der Leistung der menschlichen Ärzte und den Systemen der künstlichen Intelligenz. Die beiden jungen Urologen erreichten einen hohen Erfolgsgrad und lieferten in fünfundachtzig bzw. neunundachtzig Prozent der Fälle sichere und vollständige Antworten. Im Gegensatz dazu waren die Modelle der künstlichen Intelligenz nur in sechzig bis siebzig Prozent der Fälle erfolgreich. Während die Maschinen oft Antworten produzierten, die oberflächlich betrachtet korrekt erschienen, übersahen sie häufig entscheidende Details oder versäumten es, spezifische Sicherheitshinweise einzubeziehen, die die menschlichen Ärzte erkannten. Die besorgniserregendste Erkenntnis bezog sich auf die Patientensicherheit. Ungefähr jede vierte Antwort der Systeme der künstlichen Intelligenz enthielt einen Fehler, der schwerwiegenden Schaden hätte verursachen können, wie etwa die Empfehlung einer Behandlung, die gefährlich für den Patienten war, oder das Übersehen eines kritischen Warnsignals. Die menschlichen Ärzte machten im Vergleich dazu in nur ein oder zwei Prozent der Fälle solche sicherheitskritischen Fehler.
Über die Genauigkeit der Antworten hinaus untersuchte die Studie auch, wie zuverlässig die Systeme der künstlichen Intelligenz waren, wenn sie mehrmals dieselbe Frage gestellt wurden. In der realen Welt würde ein Arzt bei jeder Überprüfung des Falls dieselbe Beratung für denselben Patienten geben. Die Forscher stellten fest, dass die Modelle der künstlichen Intelligenz überraschend inkonsistent waren. Wenn dieselbe Patientengeschichte dreimal hintereinander abgefragt wurde, gab das System weniger als die Hälfte der Zeit dieselbe Klassifizierung von Erfolg oder Misserfolg an. Noch beunruhigender war, dass das System manchmal beim ersten Versuch eine sichere Antwort gab, beim zweiten eine unsichere und beim dritten wieder eine sichere. Diese mangelnde Stabilität bedeutet, dass die Ausgabe dieser Werkzeuge unvorhersehbar variieren kann, was es schwierig macht, sich auf sie für eine konsistente medizinische Beratung zu verlassen.
Die Forscher kamen zu dem Schluss, dass diese Systeme der künstlichen Intelligenz zwar nützliche Informationen generieren können, aber noch nicht bereit sind, unabhängig in einem klinischen Umfeld zu operieren. Die Studie legt nahe, dass der beste Einsatz für diese Werkzeuge derzeit als überwachter Assistent ist, bei dem ein menschlicher Arzt jede Empfehlung überprüft, bevor sie bei einem Patienten angewendet wird. Die Maschinen können helfen, Informationen zu organisieren oder Optionen vorzuschlagen, aber die endgültige Entscheidung muss in menschlicher Hand bleiben, um Sicherheit und Konsistenz zu gewährleisten. Bis diese Systeme die Zuverlässigkeit und die Sicherheitsbilanz menschlicher Spezialisten erreichen können, sollte ihre Rolle in der Krebsversorgung unterstützend statt autonom sein – als ein zweites Paar Augen statt als primärer Entscheidungsträger.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.