Do established comorbidity scores predict in-hospital mortality equally well in women and men? A nationwide validation in 166.7 million German inpatient cases, 2010-2024
In einer landesweiten Validierung von 166,7 Millionen deutschen stationären Fällen wurde festgestellt, dass drei etablierte Komorbiditäts-Scores gleichermaßen diskriminativ, aber systematisch zwischen Frauen und Männern falsch kalibriert waren, was die Notwendigkeit einer geschlechtsspezifischen Rekalibrierung unterstützt, um ein faires Krankenhaus-Benchmarking zu gewährleisten.
Originalarbeit lizenziert unter CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung eines Preprints, das nicht peer-reviewed wurde. Dies ist kein medizinischer Rat. Treffen Sie keine Gesundheitsentscheidungen auf Grundlage dieses Inhalts. Vollständigen Haftungsausschluss lesen
Krankenhäuser vergleichen ständig ihre Leistung und stellen dabei eine grundlegende Frage: Halten sie Patienten besser am Leben als andere Krankenhäuser? Um dies fair zu beantworten, müssen sie berücksichtigen, wie krank ein Patient vor der Ankunft war. Ein Patient, der mit einem Beinbruch und einem gesunden Herzen eingeliefert wird, steht vor einem anderen Risiko als jemand, der mit einem Beinbruch und einem schwachen Herzen eintrifft. Um diesen Vergleich zu ermöglichen, verwenden Ärzte „Komorbiditäts-Scores“. Dies sind einfache Zahlen, die aus der Krankengeschichte eines Patienten berechnet werden, indem alle seine bestehenden Leiden zu einer einzigen Risikoschätzung zusammengefasst werden. Jahrzehntelang wurden diese Scores für jeden mit derselben Formel angewendet, unabhängig davon, ob es sich um einen Mann oder eine Frau handelt. Die Annahme war, dass die Mathematik für beide Geschlechter gleich funktioniert. Doch in der Welt der Medizin, in der die Biologie oft zwischen Männern und Frauen differiert, wurde diese Annahme selten in großem Maßstab getestet. Wenn die Formel für eine Gruppe leicht fehlerhaft ist, könnte dies die Ergebnisse tausender Studien verzerren und die Art und Weise beeinflussen, wie Krankenhäuser bewertet werden, wodurch manche besser oder schlechter dastehen, als sie tatsächlich sind.
Ein Forscherteam setzte sich zum Ziel, diese Annahme mithilfe eines Datensatzes von beispielloser Größe zu testen. Sie untersuchten fast 167 Millionen stationäre Aufnahmen von Erwachsenen in Deutschland über einen Zeitraum von fünfzehn Jahren, von 2010 bis 2024. Dies war keine kleine Stichprobe; es war ein vollständiges Protokoll fast jeder akuten Krankenhausaufnahme des Landes in dieser Zeit. Die Forscher konzentrierten sich auf drei spezifische Bewertungssysteme, die weltweit verwendet werden, um das Sterberisiko im Krankenhaus vorherzusagen. Sie wollten sehen, ob diese Scores den Tod gleichermaßen gut für Männer und Frauen vorhersagten. Konkret prüften sie zwei Dinge: erstens, ob das vorhergesagte Risiko mit der tatsächlichen Anzahl der Todesfälle übereinstimmte (Kalibrierung), und zweitens, ob die Scores erfolgreich zwischen Patienten, die sterben würden, und denen, die überleben würden, unterscheiden konnten (Diskriminierung).
Die Ergebnisse zeigten ein klares und konsistentes Muster. Während die Scores im Allgemeinen gut darin waren, Patienten einzustufen – das heißt, sie konnten immer noch zwischen Patienten mit höherem und niedrigerem Risiko unterscheiden –, sagten sie die tatsächliche Anzahl der Todesfälle nicht gleichermaßen gut für Männer und Frauen voraus. Als die Forscher Gruppen von Patienten mit demselben Score betrachteten, stellten sie fest, dass Männer häufiger starben als Frauen. Beispielsweise war in einem der Bewertungssysteme die Wahrscheinlichkeit, dass Männer mit einem bestimmten Risikoniveau im Krankenhaus starben, etwa 21 Prozent höher als bei Frauen mit exakt demselben Score. Dieser Unterschied war kein Zufall; er trat konsistent über alle fünfzehn Jahre der Daten und über fast alle Altersgruppen hinweg auf. Die Scores neigten dazu, das Risiko für Männer zu unterschätzen und für Frauen zu überschätzen, oder umgekehrt, je nach spezifischem Score, was eine systematische Lücke erzeugte.
Interessanterweise blieb die Fähigkeit der Scores, Patienten korrekt einzustufen, für beide Geschlechter sehr ähnlich. Der Unterschied darin, wie gut die Scores Überlebende von Nicht-Überlebenden trennten, war so geringfügig, dass er fast vernachlässigbar war. Das eigentliche Problem war nicht, dass die Scores nicht in der Lage waren, zu identifizieren, wer kränker war, sondern dass sie die tatsächliche Sterbewahrscheinlichkeit für jedes Geschlecht falsch berechneten. Die Forscher merkten an, dass dieser Unterschied für einen einzelnen Patienten zu gering ist, um eine unmittelbare Behandlungsentscheidung eines Arztes zu beeinflussen. Da diese Scores jedoch dazu verwendet werden, ganze Krankenhäuser zu vergleichen und nationale Gesundheitspolitiken zu leiten, verschwindet der Fehler nicht. Stattdessen summiert er sich. Wenn ein Krankenhaus mehr Männer als Frauen behandelt, oder umgekehrt, kann die Standardformel dieses Krankenhaus so aussehen lassen, als würde es schlechter oder besser abschneiden, als es tatsächlich ist, einfach weil die Mathematik nicht zur spezifischen Patientenmischung passt.
Die Studie untersuchte auch, warum dies geschehen könnte. Die Daten zeigten, dass Männer in der Krankenhauspopulation eine höhere Last der schwersten, mit dem Tod verbundenen Erkrankungen trugen, wie etwa Lebererkrankungen und Herzrhythmusstörungen, während Frauen höhere Raten an Erkrankungen wie Depressionen aufwiesen. Die Scores zählen diese Zustände, berücksichtigen aber nicht den Umstand, dass dieselbe Erkrankung je nach Geschlecht des Patienten eine unterschiedliche Gewichtung oder Schwere haben kann. Die Forscher fanden heraus, dass das Muster unabhängig vom Jahr oder dem Alter des Patienten bestehen blieb, was darauf hindeutet, dass das Problem in die Art und Weise eingebaut ist, wie die Scores ursprünglich erstellt wurden und wie sie derzeit verwendet werden.
Diese massive Analyse legt nahe, dass die langjährige Praxis, eine einzige Formel für alle zu verwenden, in Bezug auf die Vorhersage der Krankenhaussterblichkeit fehlerhaft ist. Die Autoren kommen zu dem Schluss, dass diese etablierten Scores für Männer und Frauen unterschiedlich kalibriert sind. Während die Scores immer noch gut genug funktionieren, um Patienten einzustufen, bedeutet der systematische Unterschied bei der Vorhersage der tatsächlichen Sterberate, dass sie eine Verzerrung in Krankenhausvergleichen und in der Forschung einführen. Die Studie behauptet nicht, das Problem gelöst zu haben, aber sie liefert starke Beweise dafür, dass die aktuellen Werkzeuge neu überprüft werden müssen. Um faire Vergleiche zwischen Krankenhäusern und eine genaue Forschung zu gewährleisten, schlagen die Autoren vor, dass diese Scores möglicherweise spezifisch für Männer und Frauen rekalibriert werden oder dass das Geschlecht als ein Faktor in die Berechnung aufgenommen werden sollte. Bis dahin könnten die Zahlen, die zur Bewertung der Krankenhausleistung verwendet werden, durch das Geschlecht der Patienten, die sie beschreiben sollen, still und leise verzerrt sein.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.