← 最新论文
📄 health informatics

Sense and Sensibility: Sensible Quality Control and Data Decision-Making in Passive Sensing Data for Adolescent Substance Use Risk Prediction

本文通过利用 ABCD 研究来阐释如何通过严格的数据质量控制和透明的特征工程来解决诸如异常值处理、平台差异和方案偏差等挑战,为智能手机和可穿戴设备被动感知数据的预处理提供了原则性的建议,旨在提高青少年物质使用风险的预测能力。

原作者: Hong, A., Diaz, J. L., Kennedy, T. M., Wang, F. L.

发布于 2026-10-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Hong, A., Diaz, J. L., Kennedy, T. M., Wang, F. L.

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

想象一下,试图通过窗户观察青少年日常习惯的情景。你可能会看到他们在睡觉、走路或盯着手机,但除非你进入房间与他们在一起,否则你无法看到全貌。几十年来,科学家一直依赖青少年填写关于他们生活的调查问卷,询问他们记得睡了多少小时或活动了多少。但记忆是会出错的,人们经常会忘记或误报自己的习惯。一种更新的方法是给年轻人配备智能手机和可穿戴健身追踪器,让它们在现实世界中悄悄记录他们的运动、睡眠模式和手机使用情况。这种被称为“被动感知”的方法,为观察行为提供了一个连续且客观的窗口。然而,仅仅因为设备记录了数据,并不意味着这些数据总是准确或易于使用的。设备可能会发生故障,软件可能会出现错误,而且青少年使用技术的方式也大相径庭。在科学家利用这些信息来预测健康风险(例如青少年开始使用药物或酒精的可能性)之前,他们必须首先学会如何清洗数据,决定哪些数字是真实的,哪些是错误。

一个研究小组致力于利用一项名为“美国青少年大脑认知发展研究”的大规模长期研究中的数据,来解决这些混乱的问题。他们关注的是一组大约 13 或 14 岁的近 5,000 名青少年,这些青少年已同意佩戴健身追踪器并在其手机上使用一个特殊的应用程序三周。目标是观察这些数字数据中的模式是否可以帮助识别哪些年轻人处于使用物质的使用高风险中。但是,当他们开始查看这些数字时,发现数据远非完美。有些青少年只记录了几天的活动,而另一些人则有数周的数据。有些人出现了奇怪的读数,比如连续睡眠 24 小时或完全不动。团队必须弄清楚如何在不丢弃那些可能预示问题的行为的前提下,处理这些异常情况。

研究人员发现,最极端且最不可能出现的数字通常来自于那些佩戴设备时间最短的青少年。如果一个人只戴了一天追踪器,并且恰好在那天非常不活跃,计算机可能会计算出他们一直处于不活跃状态。这表明,这些奇怪的数字并不一定是危险生活方式的迹象,而是数据不完整的迹象。研究人员并没有决定删除每一个看起来很奇怪的数据点,而是决定先看这个人。他们设定了一条规则:一名青少年必须至少有五个工作日和两个周末的数据才能被纳入研究。这种方法让他们能够保留那些睡眠或活动模式不规律的青少年,只要他们有足够的数据来证明这些模式是真实的,而不仅仅是某一天偶然出现的偏差。通过这样做,他们保留了青少年生活中混乱且不规则的现实,而这往往是隐藏着有关健康风险最重要的线索的地方。

团队还发现,青少年使用的手机类型以令人惊讶的方式改变了数据。该研究使用了一个系统来记录青少年在手机上打字的时间。然而,该系统在 iPhone 和安卓手机上的运行方式不同。在 iPhone 上,除非用户切换到研究提供的特殊键盘,否则系统无法记录打字情况。研究人员怀疑许多 iPhone 用户觉得这种切换很麻烦,于是换回了原来的键盘,这意味着研究遗漏了大量的打字活动。当他们将记录的数据与青少年自述的行为进行对比时,他们发现 iPhone 用户看起来打字比实际要少得多,尤其是在使用量较低的时候。这意味着数据不仅存在差异,而且对其中一类人群存在系统性的偏差。研究人员得出结论,他们不能简单地将两种手机类型的数据混合在一起而不考虑这种差异,必须将手机操作系统作为一个主要因素纳入分析。

另一个挑战是决定统计哪些天。该研究有一个特定的三周窗口期,研究人员在此期间进行积极监测。然而,设备在研究开始前和结束后也会持续记录数据。研究人员对比了官方研究周期间的行为与研究期间之外的行为。他们发现,当青少年知道自己正在被观察时,其行为与不知道时有所不同。在官方研究期间,他们的睡眠和活动模式是相互一致的。但在研究窗口之外的日子里,模式变得不稳定且难以预测。这导致团队决定,只有在官方三周期间收集的数据才足够可靠。他们丢弃了额外的日子,意识到如果数据来自不同的背景,那么更多的信息并不一定更好。

最后,研究人员必须构建工具,将这些原始数字转化为计算机可以理解的形式。他们必须创建不仅能描述青少年睡眠时长,还能描述其睡眠一致性的特征。他们必须弄清楚如何测量晚上 11:00 到凌晨 1:00 之间的差异,而不至于被时钟跨越午夜的方式所困扰。他们还必须清理研究组织者遗漏的数据错误,例如被误标为零的缺失值,这会导致一名青少年看起来从未活动过,而实际上他们是有活动的。经过所有这些细致的清洗和整理后,团队最终剩下了 428 名青少年,但他们确信这组数据是值得信赖的。

本文并不声称已经找到了一种完美的预测物质使用的办法,也不认为数字数据的问题已经得到解决。相反,它为想要使用这类数据的其他科学家提供了一套实用的规则。主要的教训是,研究人员需要谨慎处理离群值和缺失信息。他们不应该仅仅删除奇怪的数字,因为那些数字可能正是最重要的。他们还应该检查数据是否会根据使用的设备或收集的时间而发生变化。通过遵循这些步骤,科学家可以确保他们的发现反映了他们正在研究的青少年的真实生活,而不是他们所使用的机器的错误。这项工作为将混乱的数字信号转化为清晰的青少年行为图景提供了路线图,为开发更好的工具来帮助年轻人保持健康铺平了道路。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →