← Últimos artículos
📄 health informatics

Sense and Sensibility: Sensible Quality Control and Data Decision-Making in Passive Sensing Data for Adolescent Substance Use Risk Prediction

Este artículo proporciona recomendaciones fundamentadas para el preprocesamiento de datos de detección pasiva provenientes de teléfonos inteligentes y dispositivos portátiles para mejorar la predicción del riesgo de consumo de sustancias en adolescentes, utilizando el Estudio ABCD para ilustrar cómo el control riguroso de la calidad de los datos y la ingeniería de características transparente pueden abordar desafíos como el manejo de valores atípicos, las diferencias entre plataformas y las desviaciones del protocolo.

Autores originales: Hong, A., Diaz, J. L., Kennedy, T. M., Wang, F. L.

Publicado 2026-10-08
📖 7 min de lectura🧠 Análisis profundo

Autores originales: Hong, A., Diaz, J. L., Kennedy, T. M., Wang, F. L.

Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ⚕️ Esta es una explicación generada por IA de un preprint que no ha sido revisado por pares. No es consejo médico. No tome decisiones de salud basándose en este contenido. Leer descargo de responsabilidad completo

Imagina intentar comprender los hábitos diarios de los adolescentes observándolos a través de una ventana. Podrías verlos dormir, caminar o mirar fijamente sus teléfonos, pero no puedes ver la imagen completa a menos que estés dentro de la habitación con ellos. Durante décadas, los científicos han dependido de que los adolescentes completen encuestas sobre sus vidas, preguntándoles cuánto tiempo durmieron o cuánto se movieron. Pero la memoria es falible, y las personas a menudo olvidan o informan erróneamente sobre sus hábitos. Un enfoque más nuevo consiste en entregar a los jóvenes teléfonos inteligentes y rastreadores de actividad física portátiles que registran silenciosamente sus movimientos, patrones de sueño y uso del teléfono en el mundo real. Este método, conocido como detección pasiva, ofrece una ventana al comportamiento que es continua y objetiva. Sin embargo, el hecho de que un dispositivo registre datos no significa que esos datos sean siempre precisos o fáciles de usar. Los dispositivos pueden fallar, el software puede tener errores y la forma en que los adolescentes interactúan con la tecnología varía enormemente. Antes de que los científicos puedan usar este flujo de información para predecir riesgos de salud, como la probabilidad de que un adolescente comience a usar drogas o alcohol, primero deben aprender cómo limpiar los datos, decidiendo qué números son reales y cuáles son errores.

Un equipo de investigadores se propuso resolver estos problemas complicados utilizando datos de un estudio masivo y a largo plazo sobre la juventud estadounidense llamado el Estudio del Desarrollo Cognitivo y Cerebral del Adolescente. Se centraron en un grupo de casi 5,000 adolescentes que tenían alrededor de 13 o 14 años y que habían aceptado usar un rastreador de actividad y una aplicación especial en sus teléfonos durante tres semanas. El objetivo era ver si los patrones en estos datos digitales podían ayudar a identificar qué jóvenes estaban en mayor riesgo de consumo de sustancias. Pero al comenzar a observar los números, los investigadores descubrieron que los datos distaban mucho de ser perfectos. Algunos adolescentes habían registrado solo unos pocos días de actividad, mientras que otros tenían semanas de datos. Algunos tenían lecturas extrañas, como dormir 24 horas seguidas o no moverse en absoluto. El equipo tuvo que averiguar cómo manejar estas anomalías sin desechar los mismos comportamientos que podrían señalar un problema.

Los investigadores descubrieron que los números más extremos e improbables solían provenir de los adolescentes que habían usado sus dispositivos con menos frecuencia. Si una persona solo usó su rastreador durante un día y resultó ser muy inactiva ese día, la computadora podría calcular que esa persona era inactiva todo el tiempo. Esto sugirió que los números extraños no eran necesariamente signos de un estilo de vida peligroso, sino signos de que los datos estaban incompletos. En lugar de eliminar cada punto de datos que pareciera extraño, el equipo decidió observar primero a la persona. Establecieron una regla de que un adolescente debía tener al menos cinco días laborables y dos días de fin de semana de datos para ser incluido en el estudio. Este enfoque les permitió mantener a los adolescentes que tenían patrones de sueño o actividad irregulares, siempre y cuando tuvieran suficientes datos para demostrar que esos patrones eran reales y no solo un error de un mal día. Al hacer esto, preservaron la realidad desordenada e irregular de la vida adolescente, que es donde a menudo se esconden las pistas más importantes sobre los riesgos de salud.

El equipo también descubrió que el tipo de teléfono que utilizaba un adolescente cambiaba los datos de formas sorprendentes. El estudio utilizó un sistema para registrar cuánto tiempo pasaban los adolescentes escribiendo en sus teléfonos. Sin embargo, el sistema funcionaba de manera diferente en los iPhone en comparación con los teléfonos Android. En los iPhone, el sistema no podía registrar la escritura a menos que el usuario cambiara a un teclado especial proporcionado por el estudio. Los investigadores sospechaban que a muchos usuarios de iPhone les resultaba molesto este cambio y volvían a su teclado normal, lo que significaba que el estudio perdía mucha de su actividad de escritura. Cuando compararon los datos registrados con lo que los adolescentes decían que hacían, encontraron que los usuarios de iPhone parecían escribir mucho menos de lo que realmente hacían, especialmente cuando su uso era bajo. Esto significaba que los datos no eran solo diferentes; estaban sistemáticamente sesgados contra un grupo de personas. Los investigadores concluyeron que no podían simplemente mezclar los datos de ambos tipos de teléfonos sin tener en cuenta esta diferencia, y que debían tratar el sistema operativo del teléfono como un factor importante en su análisis.

Otro desafío fue decidir qué días contar. El estudio tenía una ventana específica de tres semanas donde los investigadores monitoreaban activamente a los participantes. Sin embargo, los dispositivos seguían registrando datos antes de que comenzara el estudio y después de que terminara. Los investigadores compararon el comportamiento durante las semanas oficiales del estudio con el comportamiento durante los días adicionales. Encontraron que los adolescentes actuaban de manera diferente cuando sabían que los estaban observando frente a cuando no lo sabían. Durante las semanas oficiales, sus patrones de sueño y actividad eran consistentes entre sí. Pero en los días fuera de la ventana del estudio, los patrones se volvían erráticos e impredecibles. Esto llevó al equipo a decidir que solo los datos recopilados durante el período oficial de tres semanas eran lo suficientemente confiables como para ser utilizados. Descartaron los días adicionales, dándose cuenta de que tener más datos no siempre era mejor si esos datos provenían de un contexto diferente.

Finalmente, los investigadores tuvieron que construir las herramientas para convertir estos números brutos en algo que una computadora pudiera entender. Tuvieron que crear características que describieran no solo cuánto dormía un adolescente, sino qué tan constante era su sueño. Tuvieron que averiguar cómo medir la diferencia entre una hora de acostarse a las 11:00 PM y la 1:00 AM sin confundirse con la forma en que los relojes dan la vuelta a la medianoche. También tuvieron que limpiar los errores en los datos que los organizadores del estudio habían pasado por alto, como valores faltantes que fueron marcados accidentalmente como cero, lo que haría que un adolescente pareciera que nunca se movió cuando en realidad sí lo hizo. Después de toda esta cuidadosa limpieza y organización, el equipo se quedó con un grupo más pequeño de 428 adolescentes, pero estaban seguros de que los datos de este grupo eran dignos de confianza.

El artículo no pretende haber encontrado una forma perfecta de predecir el consumo de sustancias, ni dice que los problemas con los datos digitales estén resueltos. En cambio, ofrece un conjunto de reglas prácticas para otros científicos que quieran utilizar este tipo de datos. La lección principal es que los investigadores deben ser cuidadosos en cómo manejan los valores atípicos y la información faltante. No deben limitarse a eliminar los números extraños, porque esos números podrían ser los más importantes. También deben verificar si los datos cambian dependiendo del dispositivo utilizado o del momento en que se recolectaron. Al seguir estos pasos, los científicos pueden asegurar que sus hallazgos reflejen las vidas reales de los adolescentes que están estudiando, en lugar de los errores de las máquinas que utilizan. Este trabajo proporciona una hoja de ruta para transformar un flujo caótico de señales digitales en una imagen clara del comportamiento adolescente, allanando el camino para mejores herramientas que ayuden a los jóvenes a mantenerse saludables.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →