← Neueste Arbeiten
💻 computer science

Clinical explainable AI evaluations prioritize trust over effective human oversight: a scoping review

Diese Scoping Review von 49 klinischen XAI-Studien zeigt, dass Evaluationen überwiegend Nutzervertrauen und Wahrnehmungen gegenüber kritischen Aufsichtskapazitäten wie der Erkennung von Fehlern und Bias priorisieren, wobei sie stark auf nicht validierten Maßen basieren und selten die Leistung in eingesetzten Systemen bewerten.

Ursprüngliche Autoren: Nicolas Frey, Louis Agha-Mir-Salim, Linn Renner, Stefan Haufe, Lily Voge, Felix Balzer

Veröffentlicht 2026-09-24
📖 6 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Nicolas Frey, Louis Agha-Mir-Salim, Linn Renner, Stefan Haufe, Lily Voge, Felix Balzer

Originalarbeit lizenziert unter CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

In modernen Krankenhäusern verlassen sich Ärzte zunehmend auf Computerprogramme, um bei der Diagnose von Krankheiten zu helfen und Behandlungsvorschläge zu unterbreiten. Diese Werkzeuge, die auf komplexen mathematischen Modellen basieren, können riesige Mengen an Patientendaten schneller verarbeiten als jeder Mensch. Diese Modelle funktionieren jedoch oft wie eine „Black Box“, die eine Empfehlung abgibt, ohne zu erklären, wie sie zu diesem Schluss gekommen ist. Um diese Undurchsichtigkeit zu beheben, hat die Forschung ein Feld namens erklärbare künstliche Intelligenz (Explainable Artificial Intelligence) entwickelt. Das Ziel ist einfach: dem Computer seine Argumentation neben seiner Antwort zur Verfügung zu stellen, ganz so, wie ein Arzt seinen Rechenweg an einer Tafel vorzeigt. Die Hoffnung ist, dass ein Kliniker durch das Verständnis der Logik hinter einem Vorschlag entscheiden kann, ob er ihm vertrauen, einen Fehler entdecken oder ihn überstimmen kann, falls der Rat gefährlich ist. Diese Fähigkeit, die Maschine zu prüfen und zu korrigieren, wird als menschliche Aufsicht (Human Oversight) bezeichnet und gilt als essenziell für die Sicherheit bei medizinischen Entscheidungen mit hohem Einsatz.

Eine neue Übersicht wissenschaftlicher Forschung deutet jedoch darauf an, dass die derzeitige Art und Weise, wie wir diese Erklärungen testen, den kritischsten Teil der Aufgabe vermissen lässt. Nicolas Frey und seine Kollegen an der Charité – Universitätsmedizin Berlin untersuchten neunundvierzig zwischen 2015 und Anfang 2026 veröffentlichte Studien, die testeten, wie Ärzte und medizinische Auszubildende mit diesen erklärbaren Werkzeugen interagieren. Die Forscher wollten wissen, ob die Studien tatsächlich bewiesen, dass Erklärungen Kliniker dabei helfen, Fehler zu finden, oder ob sie lediglich maßen, wie sehr den Klinikern das Aussehen der Erklärung gefiel. Sie fanden eine signifikante Lücke. Während die Studien häufig Ärzte fragten, ob sie die Erklärungen vertrauenswürdig oder leicht verständlich fanden, testeten sie fast nie, ob diese Erklärungen den Ärzten tatsächlich halfen, zu erkennen, wenn der Computer falsch lag.

Die Übersicht kartierte genau, was diese neunundvierzig Studien maßen. Die Ergebnisse zeigten einen starken Fokus auf Gefühlen und Wahrnehmungen. In zweiundvierzig der Studien fragten die Forscher die Teilnehmer, wie sehr sie dem System vertrauten. In vierunddreißig Studien fragten sie, ob die Erklärungen nützlich waren, und in dreiunddreißig, ob sie verständlich waren. Diese Fragen stützen sich auf Selbstberichte, bei denen ein Arzt einfach sagt: „Ich fühle mich bei dieser Antwort sicher.“ Die Forscher fanden heraus, dass nur ein winziger Bruchteil der Studien einen Schritt weiterging, um tatsächliches Verhalten zu testen. Nur drei Studien testeten, ob ein Arzt einen spezifischen Fehler in der Logik des Computers entdecken konnte, und nur eine Studie testete, ob ein Arzt eine systematische Voreingenommenheit (Bias) in der Beratung des Systems erkennen konnte. Vielleicht am auffälligsten war, dass keine einzige Studie testete, ob ein Arzt korrekt vorhersagen konnte, was der Computer in einer neuen Situation tun würde – eine Fähigkeit, die für echtes Verständnis grundlegend wäre.

Die Beweise legen nahe, dass die aktuelle Forschungslandschaft das Gefühl von Sicherheit gegenüber der Mechanik der Sicherheit priorisiert. Die meisten der Studien fanden in kontrollierten, simulierten Umgebungen statt und nicht in echten, geschäftigen Krankenhäusern. In diesen Simulationen wurden Ärzten oft sowohl korrekte als auch inkorrekte Ratschläge des Computers gezeigt, aber die Studien maßen selten, ob die Ärzte die falsche Empfehlung erfolgreich zurückwiesen. Stattdessen wurde oft gemessen, ob die Ärzte mit dem Computer übereinstimmten, ohne zu wissen, ob diese Übereinstimmung mit einer richtigen oder einer falschen Antwort erfolgte. Die Forscher stellten fest, dass ein Arzt ein hohes Vertrauen in ein System melden kann und dennoch blind einer gefährlichen Empfehlung folgt, oder dass er sich durch eine Erklärung verwirrt fühlen kann, aber dennoch die richtige Entscheidung trifft, indem er den Computer ignoriert. Da sich die Studien so stark auf Ersteres konzentrierten – darauf, was die Ärzte sagten, dass sie fühlten –, lieferten sie kaum Beweise dafür, dass die Erklärungen den Ärzten tatsächlich halfen, Fehler zu finden, wenn der Computer falsch lag.

Darüber hinaus waren die Methoden zur Datenerhebung oft schwach. Mehr als die Hälfte der Messungen beruhte auf Ad-hoc-Fragen oder unverifizierten Skalen anstatt auf etablierten, wissenschaftlich getesteten Instrumenten. Nur zehn von zweihundertdreiundfünfzig Datenpunkten der Übersicht verwendeten ein validiertes Instrument, was ein Standard, zuverlässiger Test für Dinge wie Vertrauen oder Zufriedenheit ist. Die große Mehrheit der Daten stammte aus einfachen Umfragen, in denen Ärzte ihre Erfahrung auf einer Skala bewerteten. Die Übersicht hob auch hervor, dass nur zwei der neunundvierzig Studien Systeme betrachteten, die tatsächlich in realen klinischen Settings eingesetzt wurden. Der Rest waren Experimente, in denen das Verhalten des Computers von den Forschern gesteuert wurde, was bedeutet, dass wir nicht wissen, ob die Erklärungen standhalten, wenn ein Arzt unter Zeitdruck steht, müde ist oder mit einem komplexen Patientenfall konfrontiert wird.

Die Autoren argumentieren, dass dieses Ungleichgewicht ein falsches Sicherheitsgefühl erzeugt. Sie weisen darauf hin, dass Vertrauen eine Einstellung ist, während Aufsicht eine Handlung ist. Ein Arzt kann ein sehr vertrauensvolles Verhältnis zu einem System haben, aber dennoch eine falsche Empfehlung nicht überstimmen. Um wirklich zu wissen, ob eine Erklärung sicher ist, müssen Forscher spezifische Verhaltensweisen testen: Kann der Arzt vorhersagen, was der Computer als Nächstes sagen wird? Kann er einen Fehler erkennen, wenn der Computer falsch liegt? Kann er erkennen, wenn der Computer gegenüber einer bestimmten Patientengruppe voreingenommen ist? Die Übersicht fand heraus, dass diese sicherheitskritischen Fähigkeiten fast vollständig in der aktuellen Literatur fehlten. Die Studien zeigten uns, wie sich Erklärungen für einen Kliniker anfühlen, aber sie zeigten uns nicht, ob diese Erklärungen einem Kliniker helfen, seinen Job besser zu machen, wenn die Maschine versagt.

Das Paper schließt mit dem Argument, dass sich die Art und Weise, wie wir erklärbare KI testen, ändern muss, damit sie wirklich nützlich und sicher ist. Zukünftige Studien müssen über das Fragen von Ärzten, wie sie sich fühlen, hinausgehen und statreten, was sie tatsächlich tun. Das bedeutet, Experimente zu entwerfen, bei denen die Korrektheit des Computers manipuliert wird, um zu sehen, ob Ärzte zwischen richtig und falsch unterscheiden können. Es bedeutet, bewährte, zuverlässige Instrumente zu verwenden, um Einstellungen zu messen, anstatt auf einfachen Umfragen zu raten. Schließlich bedeutet es, diese Systeme in der realen Welt über einen längeren Zeitraum zu testen, um zu sehen, ob die Erklärungen die Entscheidungsfindung weiterhin unterstützen, wenn der Einsatz hoch und der Druck real ist. Bis diese Veränderungen stattfinden, wird die medizinische Gemeinschaft zwar ein klares Bild davon haben, wie sehr Ärzte die Erklärungen mögen, aber nur sehr wenig Beweise dafür, dass diese Erklärungen die Patienten tatsächlich schützen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →