← Últimos artigos
📄 health informatics

Sense and Sensibility: Sensible Quality Control and Data Decision-Making in Passive Sensing Data for Adolescent Substance Use Risk Prediction

Este artigo fornece recomendações fundamentadas para o pré-processamento de dados de sensoriamento passivo de smartphones e dispositivos vestíveis para melhorar a predição do risco de uso de substâncias por adolescentes, utilizando o Estudo ABCD para ilustrar como o controle rigoroso da qualidade dos dados e a engenharia de atributos transparente podem enfrentar desafios como o tratamento de valores atípicos, diferenças de plataforma e desvios de protocolo.

Autores originais: Hong, A., Diaz, J. L., Kennedy, T. M., Wang, F. L.

Publicado 2026-10-08
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Hong, A., Diaz, J. L., Kennedy, T. M., Wang, F. L.

Artigo original sob licença CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ⚕️ Esta é uma explicação gerada por IA de um preprint que não foi revisado por pares. Não é aconselhamento médico. Não tome decisões de saúde com base neste conteúdo. Ler aviso legal completo

Imagine tentar compreender os hábitos diários dos adolescentes observando-os através de uma janela. Você poderia vê-los dormindo, caminhando ou encarando seus telefones, mas não consegue ver o quadro completo a menos que esteja dentro do quarto com eles. Durante décadas, cientistas confiaram em adolescentes para preencherem questionários sobre suas vidas, perguntando-lhes quanto tempo dormiram ou o quanto se movimentaram. Mas a memória é falível, e as pessoas frequentemente esquecem ou relatam incorretamente seus hábitos. Uma abordagem mais recente envolve dar aos jovens smartphones e rastreadores de atividade física vestíveis que registram silenciosamente seus movimentos, padrões de sono e uso do telefone no mundo real. Este método, conhecido como sensoriamento passivo, oferece uma janela para o comportamento que é contínuo e objetivo. No entanto, só porque um dispositivo registra dados, não significa que esses dados sejam sempre precisos ou fáceis de usar. Os dispositivos podem apresentar falhas, o software pode sofrer erros e a maneira como os adolescentes interagem com a tecnologia varia enormemente. Antes que os cientistas possam usar esse fluxo de informações para prever riscos à saúde, como a probabilidade de um adolescente começar a usar drogas ou álcool, eles devem primeiro aprender como limpar os dados, decidindo quais números são reais e quais são erros.

Uma equipe de pesquisadores partiu para resolver esses problemas complexos usando dados de um estudo massivo e de longo prazo sobre a juventude americana chamado Adolescent Brain Cognitive Development Study. Eles se concentraram em um grupo de quase 5.000 adolescentes que tinham cerca de 13 ou 14 anos e que concordaram em usar um rastreador de atividade e um aplicativo especial em seus telefones durante três semanas. O objetivo era ver se os padrões nesses dados digitais poderiam ajudar a identificar quais jovens estavam em maior risco para o uso de substâncias. Mas, ao começarem a analisar os números, os pesquisadores descobriram que os dados estavam longe de serem perfeitos. Alguns adolescentes haviam registrado apenas alguns dias de atividade, enquanto outros tinham semanas de dados. Alguns apresentavam leituras estranhas, como dormir 24 horas seguidas ou não se mover nada. A equipe teve que descobrir como lidar com essas estranhezas sem descartar justamente os comportamentos que poderiam sinalizar um problema.

Os pesquisadores descobriram que os números mais extremos e improváveis geralmente vinham dos adolescentes que usaram menos seus dispositivos. Se uma pessoa usou seu rastreador por apenas um dia e aconteceu de ser muito inativa nesse dia, o computador poderia calcular que ela era inativa o tempo todo. Isso sugeriu que os números estranhos não eram necessariamente sinais de um estilo de vida perigoso, mas sim sinais de que os dados estavam incompletos. Em vez de deletar cada ponto de dado que parecesse estranho, a equipe decidiu olhar primeiro para a pessoa. Eles estabeleceram uma regra de que um adolescente deveria ter pelo menos cinco dias úteis e dois dias de fim de semana de dados para ser incluído no estudo. Essa abordagem permitiu que mantivessem adolescentes com padrões irregulares de sono ou atividade, desde que tivessem dados suficientes para mostrar que esses padrões eram reais e não apenas um acaso de um único dia ruim. Ao fazer isso, preservaram a realidade desordenada e irregular da vida adolescente, que é frequentemente onde as pistas mais importantes sobre riscos à saúde estão escondidas.

A equipe também descobriu que o tipo de telefone que um adolescente usava mudava os dados de maneiras surpreendentes. O estudo utilizou um sistema para registrar quanto tempo os adolescentes passavam digitando em seus telefones. No entanto, o sistema funcionava de forma diferente em iPhones comparado a telefones Android. Nos iPhones, o sistema não conseguia registrar a digitação a menos que o usuário alternasse para um teclado especial fornecido pelo estudo. Os pesquisadores suspeitaram que muitos usuários de iPhone acharam essa mudança irritante e voltaram para o seu teclado normal, o que significava que o estudo perdia muita da atividade de digitação deles. Quando compararam os dados registrados com o que os adolescentes diziam fazer, descobriram que os usuários de iPhone pareciam digitar muito menos do que realmente digitavam, especialmente quando seu uso era baixo. Isso significou que os dados não eram apenas diferentes; eles eram sistematicamente enviesados contra um grupo de pessoas. Os pesquisadores concluíram que não poderiam simplesmente misturar os dados de ambos os tipos de telefone sem considerar essa diferença, e que precisavam tratar o sistema operacional do telefone como um fator importante em sua análise.

Outro desafio foi decidir quais dias contar. O estudo tinha uma janela específica de três semanas onde os pesquisadores estavam monitorando ativamente os participantes. No entanto, os dispositivos continuaram registrando dados antes do início do estudo e após o seu término. Os pesquisadores compararam o comportamento durante as semanas oficiais do estudo com o comportamento durante os dias extras. Eles descobriram que os adolescentes agiam de forma diferente quando sabiam que estavam sendo observados versus quando não estavam. Durante as semanas oficiais, seus padrões de sono e atividade eram consistentes entre si. Mas nos dias fora da janela do estudo, os padrões tornavam-se erráticos e imprevisíveis. Isso levou a equipe a decidir que apenas os dados coletados durante o período oficial de três semanas eram confiáveis o suficiente para serem usados. Eles descartaram os dias extras, percebendo que mais dados nem sempre eram melhores se esses dados viessem de um contexto diferente.

Finalmente, os pesquisadores tiveram que construir as ferramentas para transformar esses números brutos em algo que um computador pudesse entender. Eles tiveram que criar características que descrevessem não apenas o quanto um adolescente dormia, mas o quão consistente era o seu sono. Tiveram que descobrir como medir a diferença entre um horário de dormir às 23:00 e às 01:00 sem se confundirem com a maneira como os relógios reiniciam à meia-noite. Também tiveram que limpar erros nos dados que os organizadores do estudo haviam perdido, como valores ausentes que foram acidentalmente marcados como zero, o que faria um adolescente parecer que nunca se moveu quando, na verdade, ele se moveu. Após todo esse cuidadoso processo de limpeza e organização, a equipe restou com um grupo menor de 428 adolescentes, mas estavam confiantes de que os dados deste grupo eram dignos de confiança.

O artigo não afirma ter encontrado uma maneira perfeita de prever o uso de substâncias, nem diz que os problemas com dados digitais estão resolvidos. Em vez disso, oferece um conjunto de regras práticas para outros cientistas que desejam usar esse tipo de dado. A principal lição é que os pesquisadores precisam ser cuidadosos sobre como lidam com valores discrepantes (outliers) e informações ausentes. Eles não devem apenas deletar números estranhos, pois esses números podem ser os mais importantes. Eles também devem verificar se os dados mudam dependendo do dispositivo usado ou do tempo em que foram coletados. Ao seguir esses passos, os cientistas podem garantir que suas descobertas reflitam as vidas reais dos adolescentes que estão estudando, em vez dos erros das máquinas que estão utilizando. Este trabalho fornece um roteiro para transformar um fluxo caótico de sinais digitais em uma imagem clara do comportamento adolescente, pavimentando o caminho para melhores ferramentas para ajudar os jovens a manterem-se saudáveis.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →