Do established comorbidity scores predict in-hospital mortality equally well in women and men? A nationwide validation in 166.7 million German inpatient cases, 2010-2024
In una validazione nazionale di 166,7 milioni di casi di degenza ospedaliera tedesca, tre punteggi di comorbidità consolidati sono risultati ugualmente discriminanti ma sistematicamente mal calibrati tra donne e uomini, a sostegno della necessità di una ricalibrazione specifica per sesso per garantire un benchmarking ospedaliero equo.
Articolo originale sotto licenza CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA di un preprint non sottoposto a revisione paritaria. Non è un consiglio medico. Non prendere decisioni sulla salute basandoti su questo contenuto. Leggi il disclaimer completo
Gli ospedali confrontano costantemente le proprie prestazioni, ponendosi una domanda fondamentale: stanno mantenendo in vita i pazienti meglio di altri ospedali? Per rispondere in modo equo, devono tenere conto di quanto un paziente fosse malato prima del ricovero. Un paziente che arriva con una gamba fratturata e un cuore sano affronta un rischio diverso rispetto a uno che arriva con una gamba fratturata e un cuore debole. Per rendere questo confronto, i medici utilizzano i "punteggi di comorbidità". Questi sono numeri semplici calcolati dalla storia clinica di un paziente, che combinano tutte le sue condizioni preesistenti in una singola stima del rischio. Per decenni, questi punteggi sono stati applicati a tutti utilizzando la stessa identica formula, indipendentemente dal fatto che il paziente sia uomo o donna. L'assunto è stato che la matematica funzioni allo stesso modo per entrambi i sessi. Ma nel mondo della medicina, dove la biologia spesso differisce tra uomini e donne, questo assunto è stato raramente testato su larga scala. Se la formula è leggermente errata per un gruppo, potrebbe falsare i risultati di migliaia di studi e distorcere il modo in cui gli ospedali vengono classificati, facendo apparire alcuni peggiori o migliori di quanto siano realmente.
Un team di ricercatori ha deciso di testare questo assunto utilizzando un dataset di dimensioni senza precedenti. Hanno esaminato quasi 167 milioni di ricoveri ospedalieri per adulti in Germania in un periodo di quindici anni, dal 2010 al 2024. Non si trattava di un campione piccolo; era l'intero record di quasi ogni ricovero acuto nel paese durante quel periodo. I ricercatori si sono concentrati su tre sistemi di punteggio specifici che vengono utilizzati in tutto il mondo per prevedere il rischio di morte in ospedale. Volevano vedere se questi punteggi prevedevano la morte in modo ugualmente efficace per uomini e donne. Nello specifico, hanno controllato due cose: prima, se il rischio previsto corrispondesse al numero effettivo di decessi (calibrazione), e secondo, se i punteggi riuscissero a distinguere con successo i pazienti che sarebbero morti da quelli che sarebbero sopravvissuti (discriminazione).
I risultati hanno rivelato un modello chiaro e costante. Sebbene i punteggi fossero generalmente bravi a classificare i pazienti — il che significa che potevano ancora distinguere tra coloro che erano ad alto rischio e quelli a basso rischio — non prevedevano il numero effettivo di decessi in modo uguale per uomini e donne. Quando i ricercatori hanno osservato gruppi di pazienti con lo stesso punteggio, hanno scoperto che gli uomini morivano più spesso delle donne. Ad esempio, in uno dei sistemi di punteggio, gli uomini con un determinato livello di rischio avevano circa il 21% di probabilità in più di morire in ospedale rispetto alle donne con lo stesso identico punteggio. Questa differenza non era un caso fortuito; appariva costantemente in tutti i quindici anni di dati e in quasi tutti i gruppi di età. I punteggi tendevano a sottostimare il rischio per gli uomini e a sovrastimarlo per le donne, o viceversa a seconda del punteggio specifico, creando un divario sistematico.
Interessante notare che la capacità dei punteggi di classificare correttamente i pazienti rimaneva molto simile per entrambi i sessi. La differenza nel modo in cui i punteggi separavano i sopravvissuti dai non sopravvissuti era così piccola da essere quasi trascurabile. Il vero problema non era che i punteggi non riuscissero a identificare chi fosse più malato, ma che calcolavano erroneamente la probabilità effettiva di morte per ciascun sesso. I ricercatori hanno osservato che, per un singolo paziente, questa differenza è troppo piccola per cambiare la decisione terapeutica immediata di un medico. Tuttavia, poiché questi punteggi vengono utilizzati per confrontare interi ospedali e per guidare le politiche sanitarie nazionali, l'errore non scompare. Al contrario, si accumula. Se un ospedale tratta più uomini che donne, o viceversa, la formula standard potrebbe far apparire quell'ospedale come se stesse performando peggio o meglio di quanto non faccia in realtà, semplicemente perché la matematica non si adatta alla specifica composizione dei pazienti.
Lo studio ha anche esplorato il motivo per cui ciò possa accadere. I dati hanno mostrato che gli uomini nella popolazione ospedaliera portavano un carico maggiore delle condizioni più gravi legate alla morte, come le malattie epatiche e i problemi del ritmo cardiaco, mentre le donne presentavano tassi più elevati di condizioni come la depressione. I punteggi contano queste condizioni, ma non tengono conto del fatto che la stessa condizione può avere un peso o una gravità diversa a seconda del sesso del paziente. I ricercatori hanno scoperto che il modello rimaneva invariato indipendentemente dall'anno o dall'età del paziente, suggerendo che il problema sia intrinseco al modo in cui i punteggi sono stati originariamente creati e a come vengono attualmente utilizzati.
Questa analisi massiccia suggerisce che la pratica di lungo corso di utilizzare una singola formula per tutti è fallace quando si tratta di prevedere la mortalità ospedaliera. Gli autori concludono che questi punteggi stabiliti sono calibrati diversamente per uomini e donne. Sebbene i punteggi funzionino ancora abbastanza bene per classificare i pazienti, la differenza sistematica nella previsione dei tassi di mortalità effettivi significa che introducono un bias nei confronti dei confronti tra ospedali e nella ricerca. Lo studio non sostiene di aver risolto il problema, ma fornisce una prova forte che gli strumenti attuali debbano essere riesaminati. Per garantire confronti equi tra gli ospedali e ricerche accurate, gli autori suggeriscono che questi punteggi potrebbero dover essere ricalibrati specificamente per uomini e donne, o che il sesso debba essere aggiunto come fattore nel calcolo. Fino ad allora, i numeri usati per giudicare la performance degli ospedali potrebbero essere silenziosamente distorti dal sesso dei pazienti che dovrebbero descrivere.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.