← Neueste Arbeiten
💬 NLP

Verifiable by Construction: Claim-Level Evaluation of Verbatim Citation in Clinical Question Answering

Diese Arbeit bewertet die Fähigkeit von zwölf großen Sprachmodellen, verifizierbare klinische Antworten zu generieren, indem sie faktischen Behauptungen wortgetreue Zitate beifügt, wobei sich zeigt, dass die meisten Modelle zwar erfolgreich Zitate zu über 90 % der Behauptungen anfügen können, diese Zitate jedoch häufig daran scheitern, die Details der von ihnen begleiteten Behauptungen vollständig zu belegen.

Ursprüngliche Autoren: Jiashuo Zhang, Yuling Chen, Yvonne Commodore-Mensah, Michael Oberst

Veröffentlicht 2026-09-15
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Jiashuo Zhang, Yuling Chen, Yvonne Commodore-Mensah, Michael Oberst

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

In der hochriskanten Welt der modernen Medizin ist Zeit oft die knappste Ressource. Wenn ein Arzt mit einem komplexen Patientenfall konfrontiert wird, benötigt er Antworten, die nicht nur präzise, sondern auch augenblicklich vertrauenswürdig sind. Jahrelang hat die künstliche Intelligenz versprochen, zu helfen, indem sie versprach, riesige Mengen medizinischer Literatur in klare, lesbare Ratschläge zu synthetisieren. Doch ein hartnäckiges Problem überschattet diese Werkzeuge: die Tendenz, Fakten zu erfinden, ein Fehler, der als „Halluzination“ bekannt ist. In einem Bereich, in dem ein einziger Fehler einen Patienten schädigen kann, kann ein Arzt dem Wort eines Computers nicht einfach vertrauen. Er muss in der Lage sein, die Quelle jeder Aussage zu verifizieren. Traditionell verweist eine KI, wenn sie eine Antwort mit einer Zitierung bereitstellt, oft auf ein breites Dokument, wie etwa eine gesamte medizinische Leitlinie oder eine Forschungsarbeit. Dies zwingt den beschäftigten Kliniker dazu, sich durch hunderte von Seiten zu wühlen, um den spezifischen Satz zu finden, der die Behauptung stützt – ein Prozess, der den Zweck eines effizienten Assistenten zunichtemacht. Das Ziel ist es daher, Systeme zu bauen, die nicht nur auf eine Quelle verweisen, sondern die ihre Arbeit beweisen, indem sie die exakten Worte aus dieser Quelle direkt neben der Antwort anzeigen.

Ein Team von Forschern der Johns Hopkins University unternahm den Versuch zu testen, ob aktuelle Modelle der künstlichen Intelligenz dies tatsächlich leisten können. Sie entwickelten ein spezialisiertes System, das darauf ausgelegt ist, klinische Fragen unter Verwendung von vier wichtigen medizinischen Leitlinien zu Herzerkrankungen, Blutdruck, Cholesterin und Diabetes zu beantworten. Anstatt die Modelle einfach nur die Informationen zusammenfassen zu lassen, wiesen die Forscher sie an, ihre Antworten Satz für Satz aufzubauen und jeder einzelnen faktischen Behauptung ein direktes, wortgetreues Zitat aus der Originalleitlinie beizufügen. Um zu sehen, ob dies funktionierte, entwickelten sie ein strenges Testverfahren, das wie ein digitaler Auditor fungierte. Dieses System zerlegte jede Antwort in ihre Bestandteile und prüfte sie anhand von drei spezifischen Standards: Erstens, fügte das Modell der Behauptung eine Zitierung bei? Zweitens, war das beigefügte Zitat eine exakte, wortgetreue Kopie des Textes aus der Originalleitlinie, ohne Änderungen oder Paraphrasierungen? Und drittens, enthielt dieses spezifische Zitat tatsächlich genügend Informationen, um die Behauptung zu beweisen, ohne dass der Leser an anderer Stelle nachsehen müsste?

Die Forscher testeten zwölf verschiedene große Sprachmodelle, die von leistungsstarken, komplexen Systemen bis hin zu kleineren, schnelleren Modellen reichten, unter Verwendung von 222 synthetischen klinischen Fragen, die aus den Leitlinien abgeleitet wurden. Die Ergebnisse zeigten eine signifikante Lücke zwischen dem, was diese Modelle leisten können, und dem, was für echte Zuverlässigkeit erforderlich ist. Die meisten fortgeschrittenen Modelle waren überraschend gut im ersten beiden Schritten. Es gelang ihnen, bei über 90 Prozent ihrer Behauptungen eine Zitierung beizufügen, und in vielen Fällen waren die von ihnen bereitgestellten Zitate exakte Übereinstimmungen mit dem Originaltext. Das System geriet jedoch beim letzten, entscheidenden Schritt dramatisch ins Straucheln: dem Beweis der Behauptung. Während ein Modell vielleicht ein perfektes Zitat lieferte, erfüllte dieses Zitat oft nicht die volle Tragweite der vom Modell aufgestellten Behauptung. Zum Beispiel könnte ein Modell ein Zitat anführen, das besagt, ein Medikament sei für eine bestimmte Gruppe „bevorzugt“, aber dann dieses Zitat nutzen, um die breitere Behauptung zu stützen, das Medikament sei für alle „erforderlich“. In einem bemerkenswerten Fall gelang es einem Top-Modell namens Claude Opus 5, bei 98 Prozent seiner Behauptungen ein wortgetreues Zitat beizufügen, doch nur 37,1 Prozent dieser Behauptungen konnten allein durch die Zitate vollständig untermauert werden. Die Zitate waren vorhanden, und sie waren korrekt, aber sie waren unzureichend, um den Punkt zu beweisen.

Die Studie verdeutlichte auch, dass die Größe und der Typ des Modells eine große Rolle spielten. Kleinere, leichtgewichtige Modelle scheiterten oft daran, überhaupt Zitierungen zu ihren Behauptungen beizufügen, oder sie lieferten Zitate, die keine exakten Kopien des Quelltextes waren, was ihre Verifizierungsraten massiv einbrechen ließ. Eines der kleinsten getesteten Modelle, Claude Haiku, vermochte nur etwa 25 Prozent seiner Behauptungen vollständig zu stützen. Im Gegensatz dazu schnitten die größten Modelle viel besser ab, wobei die besten Systeme rund 75 Prozent ihrer Behauptungen mit exakten, ausreichenden Beweisen untermauerten. Die Forscher fanden heraus, dass der Hauptgrund für das Scheitern nicht darin lag, dass die Modelle lügen oder Dinge erfinden, sondern dass sie Schwierigkeiten hatten, die richtigen Belege auszuwählen. Sie griffen oft ein Zitat, das zwar mit dem Thema verwandt war, aber nicht die spezifischen Details enthielt, die nötig waren, um den gesamten Satz zu stützen. Um zu testen, ob die Beweise tatsächlich verfügbar waren, baten die Forscher eine separate KI, die Originaldokumente nach Zitaten zu durchsuchen, die die Behauptungen vollumfänglich gestützt hätten. Sie fanden heraus, dass für viele Modelle die fehlenden Beweise direkt in den Texten vorhanden waren, die die Modelle bereits gelesen hatten; die Modelle versäumten es schlichtweg, die korrekten Teile zu extrahieren und beizufügen.

Letztlich zeigt diese Arbeit, dass künstliche Intelligenz zwar zunehmend in der Lage ist, medizinische Informationen abzurufen und zu formatieren, sie aber noch nicht bereit ist, ohne menschliche Aufsicht in einem klinischen Umfeld voll vertraut zu werden. Die Fähigkeit, eine flüssige Antwort zu generieren, ist etwas anderes als die Fähigkeit, eine verifizierbare Antwort aufzubauen. Die Studie zeigt, dass aktuelle Modelle oft die Rohmaterialien für eine Verifizierung liefern können, aber häufig daran scheitern, diese zu einem vollständigen, in sich geschlossenen Beweis zusammenzufügen. Der Weg nach vorn erfordert Systeme, die nicht nur Quellen zitieren, sondern sicherstellen, dass jedes einzelne Wort ihres Rats durch ein spezifisches, ausreichendes und unverändertes Beweisstück aus den Originalleitlinien gestützt wird. Bis Modelle konsistent die Lücke zwischen dem Vorhandensein eines Zitats und dem Beweis eines Punktes schließen können, wird die Verantwortung für die Verifizierung fest in den Händen des menschlichen Klinikers bleiben.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →