Incorporating Missing Data Considerations into Sample Size Calculations for Developing Clinical Prediction Models
Questo studio dimostra che l'assenza di dati sui predittori aumenta significativamente i requisiti di dimensione campionaria per lo sviluppo di modelli di predizione clinica stabili e ben calibrati, e propone un adattamento pratico dei calcoli della dimensione campionaria basati sulla distribuzione a posteriori per incorporare direttamente le ipotesi sui dati mancanti e le strategie di imputazione.
Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
Il quadro generale: perché abbiamo bisogno di più dati quando le cose mancano
Immagina di essere uno chef che cerca di creare una nuova ricetta perfetta per una zuppa (un Modello di Predizione Clinica). Per assicurarti che la zuppa abbia il sapore giusto per tutti, devi farla assaggiare a un grande gruppo di persone.
Di solito, gli statistici hanno una "regola empirica" per determinare quante persone sono necessarie per l'assaggio al fine di ottenere una ricetta affidabile. Essi presuppongono che ogni singola persona che chiedi avrà tutti gli ingredienti pronti (ad esempio, tutti hanno sale, pepe e carote).
Il problema: Nel mondo reale, le persone spesso dimenticano di portare un ingrediente. Forse qualcuno non ha le carote, o il sale manca. Questo sono i dati mancanti.
Questo documento sostiene che, se ti aspetti che manchino ingredienti, la tua vecchia "regola empirica" su quante persone far assaggiare è sbagliata. È troppo bassa. Se ti attieni al vecchio numero, la tua zuppa potrebbe avere un ottimo sapore nella tua piccola cucina di prova, ma sarà un disastro quando proverai a servirla a tutto il mondo.
La scoperta fondamentale: gli ingredienti mancanti richiedono una pentola più grande
I ricercatori hanno eseguito una massiccia simulazione (un esperimento al computer) per vedere cosa succede quando si cerca di cucinare con ingredienti mancanti.
- Lo scenario "Perfetto": Se tutti portano tutti i loro ingredienti, la ricetta standard per il numero di assaggiatori funziona bene.
- Lo scenario "Mancante": Quando il 20%, il 40% o addirittura il 60% degli assaggiatori mancano di ingredienti, la ricetta inizia a fallire. La zuppa diventa "sovra-adattata" (over-fitted).
- Analogia: Pensa all'"over-fitting" come alla memorizzazione di un test specifico. Se studi solo le domande esatte di un test di pratica, potresti prendere il 100% in quel test. Ma se entri nell'esame reale e le domande sono leggermente diverse (o alcune mancano), fallisci. Il modello ha imparato le "stranezze" del piccolo e disordinato set di dati piuttosto che il vero schema.
La scoperta: Per ottenere la stessa ricetta di zuppa affidabile quando mancano ingredienti, spesso sono necessari il doppio degli assaggiatori rispetto a quanto suggeriscono le regole standard.
La soluzione: una nuova "cucina di simulazione"
Il documento propone un nuovo modo per capire quante persone sono necessarie. Invece di fare solo un rapido calcolo matematico, suggeriscono di eseguire una simulazione (una prova generale) prima ancora di iniziare il tuo vero studio.
Ecco come funziona il loro nuovo metodo, passo dopo passo:
- Crea un mondo finto: Prima, crei un enorme mondo computerizzato perfetto di 500.000 persone in cui sai esattamente quale dovrebbe essere la "vera" ricetta della zuppa.
- Rompi il mondo: Poi, "rompi" intenzionalmente questo mondo facendo sì che alcune persone dimentichino i loro ingredienti (simulando dati mancanti).
- La prova generale: Cerchi di cucinare la tua zuppa usando diverse strategie:
- Strategia A: Scarta chiunque manchi di un ingrediente (Analisi dei casi completi).
- Strategia B: Indovina l'ingrediente mancante in base a ciò che hanno portato (Imputazione).
- Controlla il sapore: Assaggi la zuppa. Corrisponde alla "vera" ricetta?
- Regola la dimensione della pentola: Se la zuppa ha un sapore cattivo, aumenti il numero di assaggiatori nella tua simulazione e riprovi. Continui a farlo finché non trovi il numero esatto di assaggiatori necessario per garantire che la zuppa avrà un buon sapore, anche con ingredienti mancanti.
Concetti chiave spiegati semplicemente
- Overfitting (Sovra-adattamento): Immagina uno studente che memorizza le risposte a un quiz di pratica specifico. Prende un A. Ma quando arriva il vero test e manca una domanda, va nel panico e fallisce. Il modello è "sovra-adattato" perché ha imparato il rumore (le stranezze dei dati mancanti) invece del segnale (il vero schema).
- Pendenza di calibrazione (Calibration Slope): Questo è un punteggio che ti dice quanto il tuo modello è "avvolto nel pellicola". Un punteggio di 1,0 è perfetto. Un punteggio inferiore a 0,9 significa che il tuo modello è troppo sicuro di sé e probabilmente sbagliato. Il documento ha scoperto che con dati mancanti, i punteggi spesso scendevano sotto 0,9 a meno che non si raddoppiasse la dimensione del campione.
- Imputazione: Questo è l'atto di "indovinare" i valori mancanti. Il documento ha testato diversi modi di indovinare (come l'uso di una foresta casuale o una semplice media) e ha scoperto che, sebbene indovinare aiuti, non risolve il problema interamente: hai ancora bisogno di più dati.
- EVPI (Valore Atteso dell'Informazione Perfetta): Questo è un modo elegante per chiedere: "Quanto stiamo perdendo non avendo dati perfetti?". Calcola il costo dell'incertezza. Il documento mostra che i dati mancanti aumentano questo "costo", e aggiungere più persone al tuo studio lo riduce.
Cosa dice effettivamente il documento (e cosa non dice)
- Cosa hanno scoperto: I dati mancanti rendono il tuo modello meno stabile e meno accurato. Per risolvere questo problema, devi aumentare la dimensione del tuo campione, a volte di un fattore 2.
- Cosa raccomandano: Non usare semplicemente le vecchie, semplici formule matematiche. Usa il loro nuovo metodo di simulazione per pianificare il tuo studio. Questo comporta fare ipotesi su come i dati vanno persi (ad esempio, è casuale, o accade a causa di altri fattori?) e testare queste ipotesi in una simulazione al computer.
- Cosa non hanno fatto: Non hanno testato questo su un ospedale reale specifico in questo momento. Hanno utilizzato simulazioni al computer e due esempi ipotetici (uno in cui avevano dati vecchi per aiutarli a indovinare e uno in cui dovevano indovinare alla cieca).
- L'alternativa alla "regola empirica": Se non puoi fare la simulazione complessa, suggeriscono una soluzione approssimativa: prendi il tuo numero standard di dimensione del campione e dividilo per
(1 - percentuale di dati mancanti). Ad esempio, se ti aspetti il 50% di dati mancanti, hai bisogno del doppio della dimensione del campione. Tuttavia, ammettono che questo è solo un indovinello approssimativo e che la simulazione è migliore.
La conclusione
Se stai pianificando uno studio per costruire un modello di predizione medica e sai che alcuni dati saranno mancanti (il che è quasi sempre il caso), non fidarti dei calcolatori standard della dimensione del campione. Ti daranno un numero troppo piccolo.
Invece, usa questo nuovo approccio della "cucina di simulazione". Ti permette di testare diversi scenari e trovare il vero numero di persone di cui hai bisogno da reclutare per garantire che il tuo modello sia stabile, accurato e pronto per il mondo reale.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.