← Neueste Arbeiten
📄 allergy and immunology

Can Large Language Models Diagnose Primary Immunodeficiency from Patient-Described Symptoms?

Diese Studie zeigt, dass große Sprachmodelle primäre Immundefizien aus von Ärzten verfassten Anamnesen zwar effektiv identifizieren können, ihre diagnostische Genauigkeit jedoch signifikant sinkt, wenn sie auf Beschreibungen der Symptome durch Patienten selbst angewiesen sind, was eine kritische Lücke in der Leistungsfähigkeit basierend auf der Sprache und Rahmung medizinischer Eingaben verdeutlicht.

Ursprüngliche Autoren: Reteig, L. C., Woloshin, S., Maglione, P. J., Farmer, J. R., Ong, M.-S.

Veröffentlicht 2026-10-04
📖 6 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Reteig, L. C., Woloshin, S., Maglione, P. J., Farmer, J. R., Ong, M.-S.

Originalarbeit lizenziert unter CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ⚕️ Dies ist eine KI-generierte Erklärung eines Preprints, das nicht peer-reviewed wurde. Dies ist kein medizinischer Rat. Treffen Sie keine Gesundheitsentscheidungen auf Grundlage dieses Inhalts. Vollständigen Haftungsausschluss lesen

Für Millionen von Menschen ist der Weg zu einer medizinischen Diagnose keine gerade Linie, sondern eine lange, verwirrende Reise. Dies gilt insbesondere für Menschen mit seltenen Erkrankungen, bei denen die Symptome vage, gewöhnlich oder leicht mit etwas anderem zu verwechseln sein können. In den letzten Jahren haben viele dieser Personen eine neue Art von Helfer aufgesucht: große Sprachmodelle. Dies sind fortschrittliche Computerprogramme, die auf riesigen Mengen an Text trainiert wurden und in der Lage sind, Gespräche zu führen und Fragen zum Gesundheitszustand zu beantworten. Sie sind zu einer gefragten Ressource für Menschen geworden, die versuchen, ihren eigenen Körper zu verstehen, oft noch bevor sie jemals einen Spezialisten aufsuchen. Doch eine entscheidende Frage bleibt: Können diese digitalen Werkzeuge einen Patienten wirklich verstehen, wenn der Patient derjenige ist, der das Problem beschreibt? Die Antwort hängt stark davon ab, wer spricht. Wenn ein Arzt einen Fall unter Verwendung präziser medizinischer Fachbegriffe zusammenfasst, versteht der Computer das perfekt. Wenn eine Privatperson ihren Schmerz, ihre Müdigkeit oder ihre wiederkehrenden Infektionen in Alltagssprache beschreibt, verliert sich der Computer oft.

Ein Forscherteam setzte sich zum Ziel, diese Lücke zwischen Fachsprache und Patientensprache zu testen, wobei der Fokus auf einer Gruppe von seltenen Störungen lag, die als primäre Immundefizienzen bekannt sind. Dies sind Zustände, bei denen das natürliche Abwehrsystem des Körpers, das normalerweise Keime bekämpft, gestört oder fehlend ist. Menschen mit diesen Erkrankungen werden sehr oft krank, manchmal mit schweren Infektionen, die eine Krankenhausaufnahme erfordern, und sie stehen vor einem hohen Risiko für andere Komplikationen wie Autoimmunerkrankungen. Da diese Erkrankungen selten und komplex sind, warten Patienten oft Jahre auf eine korrekte Diagnose, eine Verzögerung, die gefährlich und emotional belastend sein kann. Während dieser Wartezeit wenden sich viele an Chatbots, um Antworten zu finden. Die Forscher wollten wissen, ob diese Chatbots Anzeichen eines defekten Immunsystems erkennen können, wenn die Beschreibung direkt vom Patienten kommt und nicht von einem Arzt.

Um dies herauszufinden, sammelte das Forscherteam Geschichten von einundzwanzig Erwachsenen, die bereits mit einem primären Immundefizit diagnostiziert worden waren. Diese Personen hatten alle lange Verzögerungen bei ihrer Diagnose erlebt. Das Team bat sie, die allerersten Symptome zu beschreiben, die ihnen das Gefühl gaben, dass etwas nicht stimmte. Die Forscher nahmen diese rohen, uneditierten Beschreibungen – genau so, wie die Patienten sie ausgesprochen hatten, mit all ihrem Zögern, ihren Wiederholungen und ihren alltäglichen Wörtern – und speisten sie in ein leistungsstarkes großes Sprachmodell ein. Sie entfernten jegliche Erwähnung der endgültigen Diagnose, sodass der Computer allein auf die Symptome angewiesen war. Das Ziel war einfach: Würde der Computer vorschlagen, dass der Patient ein primäres Immundefizit haben könnte, oder zumindest erkennen, dass das Immunsystem das Problem war?

Die Ergebnisse zeigten einen eklatanten Unterschied zwischen der Leistung des Computers mit Experteninput gegenüber Patienteneingaben. In einer früheren Studie mit demselben Computermodell, bei der Ärzte die Patientengeschichten in professioneller medizinischer Sprache verfassten, identifizierte der Computer die Erkrankung in sechsundneunzig Prozent der Fälle korrekt. Es war nahezu fehlerfrei. Als die Forscher jedoch die eigenen Worte der Patienten verwendeten, sank die Leistung des Computers dramatisch. Er identifizierte das primäre Immundefizit nur in sieben der einundzwanzig Fälle korrekt, was etwa einem Drittel entspricht. Der Computer versäumte es, in der Mehrheit der Fälle die spezifische Erkrankung zu benennen, obwohl die Patienten genau dieselben Krankheiten beschrieben.

Trotz des Versagens bei der spezifischen Diagnose war der Computer nicht völlig nutzlos. In siebzehn der einundzwanzig Fälle schlug er vor, dass der Patient allgemeine Probleme mit dem Immunsystem haben könnte, selbst wenn er die spezifische seltene Krankheit nicht benannte. Dies ist ein bedeutender Befund, da er darauf hindeutet, dass das Werkzeug dennoch als nützliches Signal dienen kann. Für einen Patienten, dem von mehreren Ärzten gesagt wurde, seine Symptome seien nur Stress oder Allergien, könnte ein Computer, der „Immunsystemprobleme“ vorschlägt, ihn dazu ermutigen, einen Spezialisten aufzusuchen. Die Studie zeigte jedoch auch, dass der Computer oft andere, häufigere Erkrankungen vermutete. Er schlug häufig Allergien, Umweltfaktoren wie schlechte Luftqualität oder endokrine Probleme wie Schilddrüsenbeschwerden vor. Dies sind die Dinge, die Ärzte zuerst in Betracht ziehen, aber sie können auch Sackgassen für jemanden sein, der tatsächlich an einer seltenen Immunstörung leidet.

Die Forscher fanden heraus, dass der Computer am wahrscheinlichsten die richtige Diagnose stellte, wenn die Geschichte des Patienten drei spezifische Hinweise enthielt: Infektionen, die in der Kindheit begannen, sehr schwere Infektionen, die eine Krankenhausaufnahme erforderten, oder Symptome, die gar keine Infektionen waren, wie etwa Wachstumsstörungen oder Verdauungsprobleme. Wenn Patienten ihre Kämpfe auf diese klaren, klassischen Arten beschrieben, hatte der Computer eine bessere Chance, die Zusammenhänge herzustellen. Aber wenn die Beschreibungen subtiler waren oder sich auf das allgemeine Gefühl des Unwohlseins konzentrierten, hatte der Computer Schwierigkeiten. Dies verdeutlicht eine fundamentale Schwäche: Das Werkzeug reagiert hochsensibel darauf, wie die Geschichte erzählt wird. Es gedeiht bei der strukturierten, präzisen Sprache der Medizin, gerät aber ins Straucheln, wenn es mit der ungeordneten, emotionalen und variablen Art konfrontiert wird, wie Menschen tatsächlich über ihre Gesundheit sprechen.

Die Autoren der Studie betonen vorsichtig, dass dies kein endgültiges Urteil über die Sicherheit oder den Nutzen dieser Werkzeuge ist, sondern vielmehr eine Warnung davor, wie sie derzeit verwendet werden. Sie weisen darauf hin, dass ihr Test ein Best-Case-Szenario war. Die interviewten Patienten kannten ihre Diagnose und könnten sich möglicherweise besser an ihre Symptome erinnern als zu Beginn ihrer Erkrankung. Wenn der Computer bei diesen klaren, retrospektiven Berichten so schlecht abschneidet, könnte er bei verwirrten Patienten vor der Diagnose, die nicht sicher wissen, was ihnen fehlt, noch schlechter abschneiden. Darüber hinaus testete die Studie nicht, wie oft der Computer bei gesunden Menschen Fehlalarme auslösen würde, was ein großes Problem darstellt. Wenn das Werkzeug zu viele gesunde Menschen als Personen mit Immunproblemen markiert, könnte es Ärzte überlasten und die Versorgung derer verzögern, die es wirklich brauchen.

Letztlich unterstreicht diese Forschung eine wachsende Herausforderung in der modernen Medizin. Da immer mehr Menschen für gesundheitliche Orientierung auf künstliche Intelligenz zurückgreifen, wird die Kluft zwischen dem, was die Technologie leisten kann, und der Art und Weise, wie Menschen sie tatsächlich nutzen, zu einem Sicherheitsproblem. Der Computer ist nicht kaputt; er ist lediglich darauf trainiert, die Sprache der Experten zu verstehen, nicht die Sprache der Patienten. Für die Millionen von Menschen, die sich auf einer diagnostischen Odyssee befinden, bleibt das Versprechen dieser Werkzeuge unerfüllt, bis sie wirklich in der Lage sind, der Person im Raum zuzuhören, nicht nur der Krankenakte. Der Weg nach vorn erfordert die Entwicklung von Systemen, die diese Kluft überbrücken können, um sicherzustellen, dass die Antwort, die ein Patient erhält, wenn er sein Leiden in seinen eigenen Worten beschreibt, nicht nur eine Vermutung ist, sondern ein zuverlässiger Wegweiser zur Pflege, die er benötigt.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →