Do established comorbidity scores predict in-hospital mortality equally well in women and men? A nationwide validation in 166.7 million German inpatient cases, 2010-2024
In een landelijke validatie van 166,7 miljoen Duitse klinische gevallen werd vastgesteld dat drie gevestigde comorbiditeitsscores eveneens discriminerend waren, maar systematisch verkeerd gekalibreerd waren tussen vrouwen en mannen, wat het belang van geslachtsspecifieke herkalibratie ondersteunt om eerlijke vergelijking van ziekenhuizen te waarborgen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van een preprint die niet peer-reviewed is. Dit is geen medisch advies. Neem geen gezondheidsbeslissingen op basis van deze inhoud. Lees de volledige disclaimer
Ziekenhuizen vergelijken hun prestaties voortdurend en stellen de fundamentele vraag: houden zij patiënten beter in leven dan andere ziekenhuizen? Om dit eerlijk te kunnen beantwoorden, moeten zij rekening houden met hoe ziek een patiënt was vóór aankomst. Een patiënt die binnenkomt met een gebroken been en een gezond hart, loopt een ander risico dan iemand die binnenkomt met een gebroken been en een falend hart. Om deze vergelijking te maken, gebruiken artsen "comorbiditeitsscores". Dit zijn eenvoudige getallen die worden berekend op basis van de medische geschiedenis van een patiënt, waarbij al hun bestaande aandoeningen worden gecombineerd in één enkele risikoschatting. Decennialang zijn deze scores voor iedereen toegepast met exact dezelfde formule, ongeacht of de patiënt een man of een vrouw is. De aanname was dat de wiskunde voor beide geslachten hetzelfde werkt. Maar in de wereld van de geneeskunde, waar de biologie vaak verschilt tussen mannen en vrouwen, is deze aanname zelden op grote schaal getest. Als de formule voor één groep slechts een klein beetje afwijkt, kan dit de resultaten van duizenden studies scheef trekken en de manier waarop ziekenhuizen worden gerangschikt verstoren, waardoor sommige er slechter of beter voor lijken dan ze in werkelijkheid zijn.
Een team van onderzoekers besloot deze aanname te testen met een dataset van ongekende omvang. Ze bekeken bijna 167 miljoen volwassen ziekenhuisopnames in Duitsland over een periode van vijftien jaar, van 2010 tot 2024. Dit was geen kleine steekproef; het was een volledig overzicht van bijna elk acuut ziekenhuisverblijf in het land tijdens die periode. De onderzoekers concentreerden zich op drie specifieke scoresystemen die wereldwijd worden gebruikt om het risico op overlijden in het ziekenhuis te voorspellen. Ze wilden zien of deze scores sterfte even goed voorspelden voor mannen als voor vrouwen. Specifiek controleerden ze twee zaken: eerst, of het voorspelde risico overeenkwam met het werkelijke aantal sterfgevallen (kalibratie), en ten tweede, of de scores er succesvol in slaagden om onderscheid te maken tussen patiënten die zouden overlijden en patiënten die zouden overleven (discriminatie).
De resultaten toonden een duidelijk en consistent patroon. Hoewel de scores over het algemeen goed waren in het rangschikken van patiënten — wat betekent dat ze nog steeds onderscheid konden maken tussen patiënten met een hoger en een lager risico — voorspelden ze het werkelijke aantal sterfgevallen niet gelijkmatig voor mannen en vrouwen. Wanneer de onderzoekers naar groepen patiënten met dezelfde score keken, ontdekten ze dat mannen vaker stierven dan vrouwen. In één van de scoresystemen waren mannen met een specifiek risiconiveau bijvoorbeeld ongeveer 21 procent meer geneigd om in het ziekenhuis te overlijden dan vrouwen met exact dezelfde score. Dit verschil was geen toevalstreffer; het kwam consistent voor over alle vijftien jaar aan data en over bijna elke leeftijdsgroep. De scores hadden de neiging het risico voor mannen te onderschatten en voor vrouwen te overschatten, of andersom afhankelijk van de specifieke score, wat een systematisch gat creëerde.
Interessant genoeg bleef het vermogen van de scores om patiënten correct te rangschikken zeer vergelijkbaar voor beide geslachten. Het verschil in hoe goed de scores overlevers van niet-overlevers scheidden, was zo klein dat het bijna verwaarloosbaar was. Het echte probleem was niet dat de scores er niet in slaagden te identificeren wie zieker was, maar dat ze de werkelijke waarschijnlijkheid van overlijden voor elk geslacht verkeerd berekenden. De onderzoekers merkten op dat dit verschil voor een individuele patiënt te klein is om een directe behandelbeslissing van een arts te veranderen. Echter, omdat deze scores worden gebruikt om volledige ziekenhuizen te vergelijken en om nationaal gezondheidsbeleid te sturen, verdwijnt de fout niet. In plaats daarvan stapelt deze zich op. Als een ziekenhuis meer mannen dan vrouwen behandelt, of andersom, kan de standaardformule dat ziekenhuis doen lijken alsof het slechter of beter presteert dan het in werkelijkheid doet, simpelweg omdat de wiskunde niet past bij de specifieke mix van patiënten.
De studie onderzocht ook waarom dit zou gebeuren. De gegevens lieten zien dat mannen in de ziekenhuispopulatie een hogere last droegen van de meest ernstige aandoeningen die gelinkt zijn aan de dood, zoals leverziekte en hartritmestoornissen, terwijl vrouwen hogere percentages hadden van aandoeningen zoals depressie. De scores tellen deze aandoeningen, maar houden geen rekening met het feit dat dezelfde aandoening een andere impact of ernst kan hebben afhankelijk van het geslacht van de patiënt. De onderzoekers ontdekten dat het patroon standhield, ongeacht het jaar of de leeftijd van de patiënt, wat suggereert dat het probleem besloten ligt in de manier waarop de scores oorspronkelijk zijn gecreëerd en hoe ze momenteel worden gebruikt.
Deze massale analyse suggereert dat de langdurige praktijk van het gebruik van een enkele formule voor iedereen gebrekkig is als het gaat om het voorspellen van mortaliteit in het ziekenhuis. De auteurs concluderen dat deze gevestigde scores verschillend gekalibreerd zijn voor mannen en vrouwen. Hoewel de scores nog steeds goed genoeg werken om patiënten te rangschikken, betekent het systematische verschil in het voorspellen van het werkelijke sterftecijfer dat ze een bias introduceren in ziekenhuisvergelijkingen en onderzoek. De studie beweert niet het probleem te hebben opgelost, maar levert sterk bewijs dat de huidige instrumenten een herziening behoeven. Om eerlijke vergelijkingen tussen ziekenhuizen en nauwkeurig onderzoek te garanderen, suggereren de auteurs dat deze scores specifiek voor mannen en vrouwen opnieuw gekalibreerd moeten worden, of dat het geslacht als een factor aan de berekening moet worden toegevoegd. Tot die tijd kunnen de cijfers die worden gebruikt om de prestaties van ziekenhuizen te beoordelen, door het geslacht van de patiënten die ze bedoeld zijn te beschrijven, stilletjes worden vervormd.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.