Valid inference for regression with best subset selection
Questo articolo propone procedure di inferenza computazionalmente efficienti e valide per campioni finiti per la selezione del miglior sottoinsieme, caratterizzando la geometria dell'evento di selezione AIC come un'unione di intervalli, consentendo così un condizionamento esatto per produrre p-value e intervalli di confidenza affidabili che correggano i fallimenti frequentisti dei metodi post-selezione convenzionali.
Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
Nel mondo della scienza dei dati, i ricercatori spesso si trovano di fronte a un puzzle con troppi pezzi. Hanno una collezione di fatti — numeri che misurano il reddito, la temperatura o i punteggi dei test — e vogliono trovare la combinazione specifica di questi fatti che spieghi meglio un particolare risultato, come quanto una persona spende o quanto velocemente cresce una pianta. Per risolvere questo problema, utilizzano un metodo chiamato selezione delle variabili, che è essenzialmente un processo di filtraggio dei dati per conservare solo gli indizi più utili e scartare il resto. Uno degli strumenti più popolari per questo compito è una regola nota come Criterio di Informazione di Akaike, o AIC. Pensatelo come un giudice severo che pesa quanto bene un modello si adatta ai dati rispetto alla sua complessità, scegliendo la versione che offre il miglior equilibrio. Gli scienziati si affidano a questo giudice per dire loro quali variabili contano e, successivamente, utilizzano strumenti statistici standard per dichiarare se quelle variabili sono veramente significative o solo fortuiti colpi di fortuna.
Tuttavia, esiste una trappola nascosta in questo flusso di lavoro comune. Gli strumenti standard utilizzati per misurare la significatività sono stati progettati per un mondo in cui il modello veniva scelto prima che qualsiasi dato venisse mai visto. Quando un ricercatore usa i dati stessi per scegliere prima il modello, e poi applica a tale risultato gli strumenti standard, la matematica si rompe. Gli strumenti standard assumono che il modello fosse fissato in anticipo, ma poiché il modello è stato in realtà scelto in base ai dati, gli strumenti standard diventano eccessivamente ottimisti. Tendono a dichiarare le cose significative quando non lo sono, portando a false scoperte e intervalli di confidenza troppo stretti per essere affidabili. Questo è un problema che influenza tutto, dalla ricerca medica alla previsione economica, poiché può portare gli scienziati a trarre conclusioni certe da basi fragili.
Un team di statistici della Rice University ha sviluppato un nuovo modo per correggere questa matematica interrotta. Si sono concentrati specificamente sullo scenario in cui il Criterio di Informazione di Akaike viene utilizzato per scegliere il miglior sottoinsieme di variabili da una lunga lista. Invece di ignorare il fatto che il modello sia stato scelto dai dati, il loro nuovo metodo integra l'incertezza direttamente nel calcolo. Hanno scoperto che l'atto di selezionare un modello crea una forma specifica e misurabile nel comportamento dei dati. Immaginate i possibili valori per un risultato come una lunga linea; il processo di selezione effettivamente taglia alcune sezioni di quella linea, lasciando solo segmenti specifici dove il risultato potrebbe essere approdato. Comprendendo esattamente quali segmenti sono stati tagliati, i ricercatori possono ricostruire la corretta distribuzione di probabilità per il risultato. Ciò consente loro di calcolare p-value e intervalli di confidenza che sono matematicamente validi, anche dopo che il modello è stato scelto.
I ricercatori hanno dimostrato che questo nuovo approccio funziona eseguendo migliaia di simulazioni al computer. In questi test, hanno generato dati in cui conoscevano la verità in anticipo. Quando hanno utilizzato i vecchi metodi standard, gli intervalli di confidenza non riuscivano a catturare la risposta vera molto più spesso di quanto dovrebbero, e i test dichiaravano falsi segnali come vere scoperte a un tasso di quasi il quaranta per cento invece del cinque per cento previsto. Al contrario, il loro nuovo metodo corretto ha riportato i tassi di errore ai livelli corretti. Gli intervalli di confidenza che producevano erano più ampi e onesti, riflettendo accuratamente l'incertezza introdotta dal processo di selezione. Questa correzione è particolarmente importante quando il modello selezionato si rivela essere l'intero set di variabili, una situazione in cui i vecchi metodi sono sorprendentemente inclini all'errore.
Per dimostrare che questo funziona nel mondo reale, il team ha applicato il loro metodo a un classico dataset riguardante il consumo personale negli Stati Uniti, che spazia dal 1970 al 2016. Questo dato includeva quattro potenziali predittori: reddito personale disponibile, produzione industriale, risparmi e il tasso di disoccupazione. Quando il software standard ha eseguito l'analisi, ha selezionato il modello completo contenente tutte e quattro le variabili. Il test statistico convenzionale ha poi dichiarato che la produzione industriale era un predittore significativo della spesa, con un intervallo di confidenza che non includeva lo zero. Tuttavia, quando i ricercatori hanno applicato la loro nuova correzione, il quadro è cambiato. L'analisi corretta ha mostrato che l'evidenza per la produzione industriale non era abbastanza forte da escludere il caso; il suo intervallo di confidenza ora includeva lo zero, il che significa che non era più statisticamente significativa. I risultati corretti si allineavano perfettamente con i punteggi di selezione originali, che avevano già suggerito che il reddito e i risparmi fossero i fattori dominanti mentre la produzione era meno importante.
Il team ha affrontato anche una seconda sfida, più difficile: cosa succede quando il livello di rumore o errore nei dati è sconosciuto, il che accade quasi sempre nella vita reale. La pratica standard consiste nel indovinare il livello di rumore e inserire tale ipotesi nella formula, ma i ricercatori hanno scoperto che questa scorciatoia può ancora portare a tassi di errore gonfiati in dataset più piccoli. Per risolvere questo, hanno sviluppato una tecnica intensiva dal punto di vista computazionale che simula il processo di selezione migliaia di volte per costruire una mappa personalizzata delle probabilità. Sebbene ciò richieda più potenza di calcolo, assicura che le conclusioni rimangano valide anche quando il livello di rumore è sconosciuto. Il loro lavoro dimostra che, riconoscendo la realtà di come i modelli vengono scelti, gli scienziati possono evitare la trappola della falsa fiducia e arrivare a scoperte che sono statisticamente solide e coerenti con l'evidenza.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.