Citation reliability of frontier large language models in medical writing and its automated verification
Diese Studie zeigt auf, dass führende große Sprachmodelle zwar einen erheblichen Anteil unzuverlässiger medizinischer Zitate generieren – primär durch Fehlattribution statt durch Erfindung –, ein automatisiertes Chain-of-Verification-System diese Fehler jedoch mit fachlicher Genauigkeit erkennen kann, was eine praktikable Lösung zur Gewährleistung der Zitierintegrität beim KI-gestützten medizinischen Schreiben bietet.
Originalarbeit lizenziert unter CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung eines Preprints, das nicht peer-reviewed wurde. Dies ist kein medizinischer Rat. Treffen Sie keine Gesundheitsentscheidungen auf Grundlage dieses Inhalts. Vollständigen Haftungsausschluss lesen
In der modernen medizinischen Praxis ist das Schreiben einer Forschungsarbeit oder eines Review-Artikels ein strenger Prozess, der absolute Präzision erfordert. Autoren müssen nicht nur komplexes medizinisches Wissen synthetisieren, sondern auch jede Behauptung an eine spezifische, existierende Quelle von Beweisen ankern. Diese Quellen sind Zitate, die als Fußabdrücke wissenschaftlicher Entdeckungen fungieren und den Leser zurück zu den Originalstudien führen, die eine neue Idee stützen. Jahrzehntelang war dieser Prozess ein menschliches Bestreben, das eine sorgfältige Überprüfung von Namen, Daten und Zeitschriftentiteln erforderte, um sicherzustellen, dass eine Referenz tatsächlich existiert und das aussagt, was der Autor behauptet. Doch nun ist ein neues Werkzeug in das Labor und die Bibliothek eingezogen: das Large Language Model (großes Sprachmodell). Dies sind leistungsstarke Computerprogramme, die auf riesigen Mengen an Text trainiert wurden und in der Lage sind, Artikel zu entwerfen, Ergebnisse zusammenzufassen und Literaturverzeichnisse in Sekundenschnelle zu generieren. Während sie das Versprechen von Schnelligkeit und Effizienz bieten, ist eine kritische Frage aufgetaucht: Können diesen Maschinen vertraut werden, um die richtigen Fußabdrücke zu finden, oder erfinden sie manchmal welche?
Diese Frage ist nicht bloß akademischer Natur; sie rührt an den Kern der medizinischen Integrität. Wenn ein Computer eine medizinische Übersicht schreibt und ein Zitat enthält, das echt aussieht, aber auf die falsche Studie verweist, oder schlimmer noch, auf eine Studie, die nie existiert hat, könnte das gesamte Argument in sich zusammenbrechen. Dieses Phänomen, bekannt als Halluzination, war eine bekannte Schwäche früherer Computermodelle. Doch während diese Werkzeuge sich weiterentwickelt haben, schneller geworden sind und die Fähigkeit erhalten haben, in Echtzeit im Internet zu suchen, bleibt unklar, ob sie endlich gelernt haben, korrekt zu zitieren. Die medizinische Gemeinschaft muss wissen, ob diese neuen, fortgeschrittenen Modelle zuverlässig genug sind, um in ernsthafter Forschung eingesetzt zu werden, und falls nicht, ob es einen praktischen Weg gibt, ihre Fehler zu entdecken, bevor sie veröffentlicht werden.
Ein Team von Forschern setzte sich zum Ziel, diese Fragen zu beantworten, indem sie drei der fortschrittlichsten Computermodelle einem strengen Test unterzogen. Sie baten jedes Modell, eine Reihe kurzer medizinischer Reviews zu neun verschiedenen Themen innerhalb des Fachbereichs der Kardiologie – der Lehre von Herz und Blutgefäßen – zu schreiben. Die Themen reichten von häufig vorkommenden Erkrankungen bis hin zu seltenen Eingriffen, um eine Mischung aus Subjekten mit vielen veröffentlichten Studien und solchen mit sehr wenigen zu gewährleisten. Jedes Modell wurde angewiesen, einen Review von etwa 600 bis 900 Wörtern zu schreiben und genau dreißig Referenzen für jeden Artikel anzugeben, was insgesamt 270 Reviews und über 8.000 Zitate ergab. Entscheidend war, dass die Forscher den Modellen erlaubten, ihre integrierten Websuchwerkzeuge zu nutzen, um so zu simulieren, wie ein Nutzer sie in einer realen Umgebung tatsächlich verwenden würde. Das Ziel war es zu sehen, wie viele dieser tausenden Zitate tatsächlich korrekt waren.
Die Ergebnisse offenbarten eine Landschaft erheblicher Variation und beständiger Fehler. Als die Forscher jedes einzelne Zitat gegen die offizielle medizinische Datenbank prüften, stellten sie fest, dass die Modelle nicht perfekt waren. Ein Modell, GPT-5.5, schnitt am besten ab und produzierte in etwa 11,5 Prozent der Fälle problematische Zitate. Die anderen beiden Modelle, Claude Opus 4.8 und Gemini 3.5 Flash, machten jedoch Fehler in fast 30 Prozent ihrer Zitate. Das bedeutet, dass für je zehn von den weniger genauen Modellen generierte Referenzen etwa drei fehlerhaft waren. Die Forscher untersuchten auch, ob die Modelle eher mit Themen Schwierigkeiten hatten, zu denen weniger Studien veröffentlicht wurden, aus der Befürchtung heraus, dass ein Mangel an verfügbaren Informationen den Computer verwirren könnte. Sie fanden heraus, dass die Fehlerraten bei Themen mit mehr Literatur zwar etwas niedriger waren, der Unterschied jedoch nicht stark genug war, um als definitive Regel zu gelten. Die Modelle machten über alle Bereiche hinweg Fehler, unabhängig davon, wie viel Information über das jeweilige Thema verfügbar war.
Die vielleicht aufschlussreichste Entdeckung war die Art der Fehler selbst. Die Forscher erwarteten, viele Fälle zu finden, in denen der Computer einfach einen fiktiven Artikel erfand – eine klassische Form der Halluzination. Stattdessen stellten sie fest, dass die überwiegende Mehrheit der Fehler weita viel subtiler war. Etwa 77 Prozent der problematischen Zitate waren Fälle von Fehlattribution. In diesen Fällen lieferte der Computer eine echte, gültige Kennung für einen echten medizinischen Artikel, aber dieser Artikel war nicht derjenige, den das Modell behauptete. Es war, als hätte der Computer ein echtes Buch in einer Bibliothek gefunden, es aber ins falsche Regal gestellt und mit dem Titel eines anderen Buches beschriftet. Diese Art von Fehler ist besonders gefährlich, da er auf den ersten Blick korrekt aussieht; ein menschlicher Leser sieht eine gültige Nummer und nimmt die Referenz als vertrauenswürdig an, nur um später festzustellen, dass die Quelle die aufgestellte Behauptung nicht stützt. Echte Fabrikation, bei der der Computer einen Artikel erfand, der überhaupt nicht existiert, war überraschend selten und machte weniger als 1 Prozent der Fehler aus.
Da die Forscher erkannten, dass diese subtilen Fehler für Menschen ohne systematische Prüfung schwer zu entdecken sind, testeten sie eine neue Methode zur Verifizierung namens „Chain-of-Verification“. Dieser Ansatz nutzt das Computermodell selbst, aber auf eine andere Weise. Anstatt das Modell einfach nur darum zu bitten, Referenzen aufzulisten, zerlegt das System die Aufgabe in eine Reihe kleiner, unabhängiger Fragen. Es bittet das Modell, den Artikel basierend auf Titel und Autor zu finden, dann zu prüfen, ob die Zeitschrift und das Jahr übereinstimmen, und schließlich zu bestätigen, dass die Kennung auf das korrekte Dokument verweist. Indem das System das Modell zwingt, jedes Informationsstück separat gegen die Datenbank zu verifizieren, anstatt sich auf sein Gedächtnis zu verlassen, kann das System seine eigenen Fehler erkennen. Als die Forscher diese Methode an einem Satz von Referenzen testeten, die sorgfältig von einem menschlichen Experten geprüft worden waren, erwies sich das automatisierte System als bemerkenswert effektiv. Es identifizierte 96,8 Prozent der problematischen Zitate korrekt, einschließlich jedes einzelnen Falles von Fehlattribution und Fabrikation, während es nur selten eine korrekte Zitation als Fehler markierte.
Die Studie kommt zu dem Schluss, dass die neueste Generation medizinischer Schreibwerkzeuge zwar leistungsstark ist, aber noch nicht bereit ist, ohne Aufsicht vertraut zu werden. Das häufigste Versagen ist nicht die Erfindung falscher Fakten, sondern die Fehlbeschriftung echter Fakten – ein Fehler, der eine spezifische Art der Prüfung erfordert, um entdeckt zu werden. Die Forscher fanden heraus, dass ein automatisierter Verifizierungsprozess diese Prüfung mit einer Genauigkeit durchführen kann, die der eines menschlichen Experten entspricht. Dies deutet darauf hin, dass die Zukunft des KI-gestützten medizinischen Schreibens nicht die Wahl zwischen Mensch und Maschine ist, sondern eine Partnerschaft, in der die Maschine den Inhalt entwirft und ein spezialisiertes Verifizierungssystem sicherstellt, dass jedes einzelne Zitat zur Wahrheit führt. Bis eine solche Verifizierung zum Standardpraktikum wird, sollten die von diesen Modellen generierten Zitate mit Vorsicht behandelt werden, da sie den Leser zur falschen Quelle der Wahrheit führen können.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.