想象一下,你的手机和智能手表就像是一对观察力极强、沉默寡言的室友。它们不仅仅是在报时;它们还在观察你的动作方式、心跳频率、睡眠时长,甚至是你解锁屏幕的频率。在心理健康领域,科学家们称之为“数字表型”(digital phenotyping)。这是一个高级的说法,意指我们可以将这些数字习惯转化为一张反映一个人内心感受的地图。多年来,研究人员一直试图利用这些地图来发现抑郁或焦虑的早期迹象,希望能赶在问题变得严重之前将其捕捉。但问题在于:每个研究团队使用的地图、工具和规则都不尽相同。这就像是在比较一份用法语写的蛋糕食谱、一份用日语写的食谱和一份随手涂鸦在餐巾纸上的食谱。你无法真正判断哪一个更好,因为原料和指令全都乱套了。此外,大多数这些地图都是利用西方国家的人群数据绘制的,这让我们不禁怀疑,同样的规则是否也适用于越南或其他世界各地的民众。
这篇题为“NEURAI-VN BENCHMARK”的论文,正是为了解决这个混乱的“厨房”而生的。作者们利用一个名为 NEURAI-VN 的全新数据集创建了一个标准化的“测试厨房”,该数据集收集自 100 名越南成年人在两周内的信息。他们收集了海量的数据,包括来自可穿戴设备和手机的 17 种不同类型的信号,以及自我报告的情绪日志。研究人员并没有仅仅靠猜测哪种计算机程序效果最好,而是设立了一场严格且公平的竞赛。他们测试了四种不同类型的机器学习模型(把它们想象成不同种类的侦探:一种是简单的逻辑专家,一种是树叶分析师,一种是强大的提升引擎,还有一种是深度神经网络)来应对四项特定的心理健康挑战。其目标并非发明一种新的神奇疗法,而是建立一把可靠的尺子,以便未来的科学家能够公平地衡量自己的进展。
这场竞赛的结果清晰明了,尽管并不完美。研究人员发现,当他们结合来自不同来源的数据时——比如将心率数据与睡眠日志和每日情绪调查混合在一起——这些“侦探”的工作效率就会提高。具体而言,该系统在区分健康人群与抑郁症患者方面表现相当出色(在以 1 为完美的量表中得分为 0.71),在区分健康人群与患有任何临床心理健康状况的人群方面也表现出色(同样为 0.71)。在区分健康人群与焦虑症患者时,它的确定性略有下降(0.69);而最困难的任务是区分抑郁症患者与焦虑症患者,在这种情况下,得分降至 0.56。
论文指出,虽然增加更多类型的数据通常有助于提高模型的性能,但“最佳”的数据组合完全取决于所提出的具体问题。例如,用于识别抑郁症的最佳设置与用于识别焦虑症的最佳设置并不相同。作者明确排除了“只要向模型投喂任何数据就能保证获胜”的想法;他们表明,如何组织和组合数据,与数据本身一样重要。他们还强调,他们的结果是基于特定的 100 名越南成年人,因此这些数字是一个坚实的起点,但它们还不是适用于全世界所有人的普遍法则。
最后,这篇论文并不声称已经解决了心理健康诊断问题。相反,它提供了一个可重复的“计分板”。通过建立一种测试这些数字工具的标准方法,作者希望未来的研究人员不必每次都重新发明轮子。他们建立了一种共同的语言和一个公平的竞技场,让科学界在通过数字足迹理解心理健康的探索过程中,终于能够实现“苹果比苹果”的公平比较,而不是“苹果比橘子”。
技术摘要:用于心理健康多模态数字表型的 NEURAI-VN 基准测试
问题陈述
利用智能手机和可穿戴设备进行数字表型(Digital Phenotyping, DP)研究,在通过捕捉日常行为变化来监测心理健康方面具有巨大潜力,而这些变化往往是周期性临床评估所遗漏的。然而,该领域的发展面临三个关键障碍:
- 异质性: 数据集在人群、感知模态和采样机制方面存在巨大差异,导致模型难以在不同队列之间迁移。
- 可复现性: 特征提取和预处理流水线通常是针对特定任务的,且缺乏充分的文档说明。
- 评估失配: 许多研究使用记录级交叉验证(允许来自同一参与者的数据同时出现在训练集和测试集中),这会导致与受试者级验证相比,性能估计过于乐观。此外,现有资源主要源自西方、英语背景的大学附属人群,这使得在理解这些关联在其他文化和社会经济背景下如何保持方面存在空白。
方法论
本文通过 NEURAI-VN 数据集建立了一个可复现的基准测试,该数据集是一个高分辨率、多模态的数据集,收集自 100 名越南成年人,持续时间为两周。数据集包含 17 种模态(13 种被动感知,4 种主动评估)以及由精神科医生提供的临床诊断注释。
数据表示与特征工程
该基准测试根据来源和时间分辨率将数据组织为六个模态组:
- 可穿戴设备 (Wm, Ws): 每分钟信号(活动、心率)和每日摘要(睡眠、HRV、SpO2、呼吸、皮肤温度)。
- 自我报告 (Sd, Sw): 每日日志/情绪和每周临床量表(PHQ-9, GAD-7)。
- 智能手机 (Pe, Pc): 基于事件的应用状态和连续传感器数据(加速度计、陀螺仪、网络、电池)。
特征提取:
- 连续/每分钟信号: 提取每日通道级的统计描述符(均值、最小值、最大值、偏度、标准差)。
- 基于事件: 每日事件计数。
- 自我报告: 保留最后一次每日响应;得分归一化至 [0, 1]。
- 预处理: 特征经过均值填补、最小-最大缩放以及单变量特征选择(ANOVA F 统计量),以保留前 K 个特征。
基准测试设计
研究通过穷举组合四种特征组,定义了 15 种基准配置:可穿戴分钟级 (Wm)、可穿戴每日级 (Ws)、自我报告每日级 (Sd) 和智能手机 (P)。注意,为了对齐时间分辨率,每周自我报告 (Sw) 被排除在外。
分类任务:
定义了四个具有临床相关性的二分类任务:
- B1: 健康对照组 (HC) vs. 抑郁症 (Dep)
- B2: HC vs. 焦虑症 (Anx)
- B3: 抑郁症 (Dep) vs. 焦虑症 (Anx)
- B4: HC vs. 临床病例 (Dep + Anx + 其他精神疾病状况)
实验方案:
- 模型: 评估了四种基线模型:逻辑回归 (LR)、随机森林 (RF)、XGBoost (XGB) 和多层感知器 (MLP)。
- 验证: 使用严格的 5 折受试者级组 K 折交叉验证 (5-fold subject-wise Group K-Fold cross-validation),以防止训练集和测试集之间的信息泄露。
- 指标: 以受试者级宏平均 F1 分数 (mF1) 作为主要评估指标,以应对类别不平衡问题。
关键结果
基准测试结果为未来的研究提供了可复现的基线。性能随任务和特征配置的变化而变化:
最优性能:
- HC vs. 抑郁症 (B1): 使用 Wm+Ws+Sd 配置结合 MLP 模型,达到了 0.71 ± 0.17 mF1。
- HC vs. 临床病例 (B4): 使用 Wm+Ws+Sd 配置结合 LR 模型,达到了 0.71 ± 0.06 mF1。
- HC vs. 焦虑症 (B2): 使用全多模态配置 (Wm+Ws+Sd+P) 结合 LR 模型,达到了 0.69 ± 0.17 mF1。
- 抑郁症 vs. 焦虑症 (B3): 仅使用 Wm (可穿戴分钟级) 配置结合 XGB 模型,达到了 0.56 ± 0.22 mF1。
多模态集成:
- 通常,整合多个特征组的配置优于单模态设置。
- 平均 mF1 从单模态 (0.48) 随着所有组组合 (0.60) 逐步提升。
- 然而,最优配置取决于具体任务;例如,最困难的任务 (Dep vs. Anx) 在使用单一模态 (Wm) 时表现最好,而 HC vs. 焦虑症则从全集成中获益最多。
意义与贡献
作者将这项工作定位为标准化数字心理健康评估的基础性步骤。该论文的主要贡献包括:
- 一个可复现的基准测试: 它建立了一个统一的评估框架,具有标准化的特征配置和严格的受试者级交叉验证协议,解决了现有文献中缺乏可比性的问题。
- 人口统计学多样性: 通过利用越南队列,本研究解决了现有资源中的人口统计学缺口,测试了行为-症状关联在非西方、非英语环境下的适用性。
- 基线性能: 报告的 F1 分数为未来的方法论开发提供了参考点,使研究人员能够将新的算法与已建立的线性、树状和神经基线进行定量比较。
- 开放资源: 数据集以及用于预处理和评估的代码均已公开,以促进进一步研究。数据集可通过 Zenodo 获取,基准测试代码可通过 GitHub 获取。
论文总结指出,虽然多模态集成通常能提高性能,但不同模态的具体效用在不同诊断任务之间存在显著差异,这强调了未来研究中进行任务特定特征工程的重要性。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。