← Ultimi articoli
📄 health informatics

Sense and Sensibility: Sensible Quality Control and Data Decision-Making in Passive Sensing Data for Adolescent Substance Use Risk Prediction

Questo articolo fornisce raccomandazioni fondate per il pre-processing dei dati di sensing passivo provenienti da smartphone e dispositivi indossabili al fine di migliorare la previsione del rischio di uso di sostanze negli adolescenti, utilizzando lo studio ABCD per illustrare come un rigoroso controllo della qualità dei dati e una trasparente ingegneria delle caratteristiche possano affrontare sfide quali la gestione degli outlier, le differenze tra piattaforme e le deviazioni dal protocollo.

Autori originali: Hong, A., Diaz, J. L., Kennedy, T. M., Wang, F. L.

Pubblicato 2026-10-08
📖 7 min di lettura🧠 Approfondimento

Autori originali: Hong, A., Diaz, J. L., Kennedy, T. M., Wang, F. L.

Articolo originale sotto licenza CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ⚕️ Questa è una spiegazione generata dall'IA di un preprint non sottoposto a revisione paritaria. Non è un consiglio medico. Non prendere decisioni sulla salute basandoti su questo contenuto. Leggi il disclaimer completo

Immagina di cercare di comprendere le abitudini quotidiane degli adolescenti osservandoli attraverso una finestra. Potresti vederli dormire, camminare o fissare i loro telefoni, ma non puoi vedere l'immagine completa a meno che tu non sia dentro la stanza con loro. Per decenni, gli scienziati si sono affidati agli adolescenti affinché compilassero sondaggi sulla loro vita, chiedendo loro di ricordare quante ore hanno dormito o quanto si sono mossi. Ma la memoria è fallibile, e le persone spesso dimenticano o riportano in modo errato le proprie abitudini. Un approccio più recente prevede di fornire ai giovani smartphone e dispositivi indossabili per il monitoraggio dell'attività fisica che registrano silenziosamente i loro movimenti, i modelli di sonno e l'uso del telefono nel mondo reale. Questo metodo, noto come rilevamento passivo (passive sensing), offre una finestra sul comportamento che è continua e oggettiva. Tuttavia, il solo fatto che un dispositivo registri dei dati non significa che tali dati siano sempre accurati o facili da utilizzare. I dispositivi possono guastarsi, il software può avere dei problemi e il modo in cui gli adolescenti interagiscono con la tecnologia varia enormemente. Prima che gli scienziati possano usare questo flusso di informazioni per prevedere i rischi per la salute, come la probabilità che un adolescente inizi a usare droghe o alcol, devono prima imparare come pulire i dati, decidendo quali numeri siano reali e quali siano errori.

Un team di ricercatori si è messo in viaggio per risolvere questi problemi disordinati utilizzando i dati provenienti da uno studio massiccio e a lungo termine sulla gioventù americana chiamato Adolescent Brain Cognitive Development Study. Si sono concentrati su un gruppo di quasi 5.000 adolescenti che avevano circa 13 o 14 anni e che avevano accettato di indossare un tracker per l'attività fisica e di utilizzare un'app speciale sui loro telefoni per tre settimane. L'obiettivo era vedere se i modelli in questi dati digitali potessero aiutare a identificare quali giovani fossero ad alto rischio di uso di sostanze. Ma quando hanno iniziato a esaminare i numeri, i ricercatori hanno scoperto che i dati erano tutt'altro che perfetti. Alcuni adolescenti avevano registrato solo pochi giorni di attività, mentre altri avevano settimane di dati. Alcuni avevano letture strane, come dormire per 24 ore consecutive o non muoversi affatto. Il team ha dovuto capire come gestire queste stranezze senza scartare proprio quei comportamenti che potrebbero segnalare un problema.

I ricercatori hanno scoperto che i numeri più estremi e improbabili provenivano solitamente dagli adolescenti che avevano indossato i loro dispositivi meno spesso. Se una persona ha indossato il proprio tracker solo per un giorno e quel giorno è risultata molto inattiva, il computer potrebbe calcolare che quella persona è inattiva tutto il tempo. Ciò suggeriva che i numeri strani non erano necessariamente segni di uno stile di vita pericoloso, ma piuttosto segni che i dati erano incompleti. Invece di eliminare ogni singolo dato che sembrava strano, il team ha deciso di guardare prima la persona. Hanno stabilito una regola secondo la quale un adolescente doveva avere almeno cinque giorni feriali e due giorni nel fine settimana di dati per essere incluso nello studio. Questo approccio ha permesso loro di mantenere gli adolescenti che avevano modelli di sonno o di attività irregolari, purché avessero abbastanza dati per dimostrare che tali modelli fossero reali e non solo un colpo di fortuna di un singolo giorno sfortunato. Facendo così, hanno preservato la realtà disordinata e irregolare della vita adolescenziale, che è spesso dove si nascondono gli indizi più importanti riguardanti i rischi per la salute.

Il team ha anche scoperto che il tipo di telefono utilizzato da un adolescente cambiava i dati in modi sorprendenti. Lo studio utilizzava un sistema per registrare quanto tempo gli adolescenti passassero a digitare sui loro telefoni. Tuttavia, il sistema funzionava diversamente sugli iPhone rispetto ai telefoni Android. Sull'iPhone, il sistema non poteva registrare la digitazione a meno che l'utente non passasse a una tastiera speciale fornita dallo studio. I ricercatori sospettavano che molti utenti di iPhone trovassero questo passaggio fastidioso e tornassero alla loro tastiera normale, il che significava che lo studio perdeva gran parte della loro attività di digitazione. Quando hanno confrontato i dati registrati con ciò che gli adolescenti dicevano di fare, hanno scoperto che gli utenti di iPhone sembravano digitare molto meno di quanto facessero realmente, specialmente quando il loro utilizzo era basso. Questo significava che i dati non erano solo diversi; erano sistematicamente distorti contro un gruppo di persone. I ricercatori hanno concluso che non potevano semplicemente mescolare i dati di entrambi i tipi di telefono senza tenere conto di questa differenza, e che dovevano trattare il sistema operativo del telefono come un fattore determinante nella loro analisi.

Un'altra sfida è stata decidere quali giorni contare. Lo studio aveva una specifica finestra di tre settimane in cui i ricercatori monitoravano attivamente i partecipanti. Tuttavia, i dispositivi continuavano a registrare dati prima dell'inizio dello studio e dopo la sua conclusione. I ricercatori hanno confrontato il comportamento durante le settimane ufficiali dello studio con il comportamento durante i giorni extra. Hanno scoperto che gli adolescenti si comportavano diversamente quando sapevano di essere osservati rispetto a quando non lo sapevano. Durante le settimane ufficiali, i loro modelli di sonno e di attività erano coerenti tra loro. Ma nei giorni al di fuori della finestra dello studio, i modelli diventavano erratici e imprevedibili. Ciò ha portato il team a decidere che solo i dati raccolti durante il periodo ufficiale di tre settimane erano abbastanza affidabili da essere utilizzati. Hanno scartato i giorni extra, rendendosi conto che più dati non sono sempre meglio se tali dati provengono da un contesto diverso.

Infine, i ricercatori hanno dovuto costruire gli strumenti per trasformare questi numeri grezzi in qualcosa che un computer possa comprendere. Dovevano creare caratteristiche che descrivessero non solo quanto dormisse un adolescente, ma quanto fosse costante il suo sonno. Dovevano capire come misurare la differenza tra un'ora di andare a letto delle 23:00 e delle 01:00 senza confondersi con il modo in cui gli orologi ricominciano dopo la mezzanotte. Anche dovevano correggere gli errori nei dati che gli organizzatori dello studio avevano tralasciato, come i valori mancanti che erano stati accidentalmente contrassegnati come zero, il che avrebbe fatto apparire un adolescente come se non si fosse mai mosso, quando invece si era mosso. Dopo tutto questo attento lavoro di pulizia e organizzazione, al team è rimasto un gruppo più piccolo di 428 adolescenti, ma erano fiduciosi che i dati di questo gruppo fossero affidabili.

L'articolo non sostiene di aver trovato un modo perfetto per prevedere l'uso di sostanze, né dice che i problemi con i dati digitali siano risolti. Invece, offre un insieme di regole pratiche per altri scienziati che vogliono utilizzare questo tipo di dati. La lezione principale è che i ricercatori devono essere cauti su come gestiscono gli outlier e le informazioni mancanti. Non dovrebbero limitarsi a eliminare i numeri strani, perché quei numeri potrebbero essere proprio quelli più importanti. Dovrebbero anche controllare se i dati cambiano a seconda del dispositivo utilizzato o del momento in cui sono stati raccolti. Seguendo questi passaggi, gli scienziati possono garantire che i loro risultati riflettano le vere vite degli adolescenti che stanno studiando, piuttosto che gli errori delle macchine che stanno utilizzando. Questo lavoro fornisce una tabella di marcia per trasformare un flusso caotico di segnali digitali in un'immagine chiara del comportamento adolescenziale, aprendo la strada a strumenti migliori per aiutare i giovani a rimanere in salute.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →