← 最新论文
💻 computer science

Evidence-Grounded Mapping of Multimodal Human Sensing Psychological Transdiagnostic Dimensions

本文通过使用 GLOBEM 数据集引入了一个包含临床医生在环(clinician-in-the-loop)的基准测试,旨在评估大语言模型利用多模态感知数据生成基于证据的 B-HiTOP 剖面的能力,并发现虽然语义抽象能有效地组织自评证据,但它对于间接的被动行为信号而言却充当了信息瓶颈。

原作者: Xiyun Hu, Xiangyuan Xue, Yuting Lyu, Hanya Shao, Jingping Nie

发布于 2026-08-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiyun Hu, Xiangyuan Xue, Yuting Lyu, Hanya Shao, Jingping Nie

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象这样一个世界:你的手机和手表能够静静地追踪你的日常生活——你的睡眠模式、你走了多远、你与谁交谈,以及你在那一刻的感觉。多年来,研究人员一直希望将这些数据流转化为一个人心理健康的清晰图景,超越简单的清单,去理解人们体验痛苦时那些复杂且重叠的方式。与其询问某人是否患有抑郁或焦虑等特定疾病,一种被称为“精神病理学层级分类法”(Hierarchical Taxonomy of Psychopathology)的新方法建议,应该观察人类经验的广泛维度,例如情绪不稳定或社交退缩,这些维度通常在不同的症状中共同出现。挑战在于,如何将设备中原始、无声的信号转化为这些具有意义的心理学概念,而无需医生坐在那里进行解读。

在这项研究中,研究人员试图测试现代人工智能是否可以充当那个解读者。他们构建了一个系统,旨在测试大型语言模型(经过海量文本训练的高级计算机程序)是否能够观察一个人的日常数字足迹,并生成一份人类临床医生认为合理的心理状态概况。团队使用了一个名为 GLOBEM 的庞大数据集,该数据集包含了数千人多年的数据,包括来自设备的被动传感器读数、关于情绪的简短每日调查,以及关于整体福祉的较长问卷。由于原始数据集并不包含研究人员想要预测的特定心理健康评分,因此他们无法简单地检查计算机在传统意义上是否“正确”。相反,他们提出了一个更实际的问题:基于现有证据,计算机对一个人心理状态的猜测是否逻辑严密且站得住脚?

为了回答这个问题,研究人员创建了一个严谨的测试场,涉及近 15,000 个参与者生活的每日快照。他们要求人工智能预测 29 种不同的心理健康指标,范围从悲伤感到冲动控制问题。他们测试了计算机进行此操作的两种不同方式。在第一种方法中,计算机直接查看所有原始数据——传感器数值、调查答案和问卷结果——并尝试一次性为每个心理健康指标分配一个分数。在第二种方法中,计算机首先将数据总结成一段广泛的心理学描述,例如一段描述该人一般状态的短文,然后利用该摘要来分配具体的评分,而不再重新查看原始数字。

结果揭示了一个关于机器如何处理信息的令人惊讶的事实。当计算机依赖于自我报告数据(例如人们明确描述自己感受的每日调查和问卷)时,两步法效果显著更好。通过首先将零散的调查答案组织成一个连贯的故事,计算机能够对特定的心理健康症状做出更为合理的预测。然而,当计算机依赖于被动感知数据(例如某人的活动量或使用手机的频率)时,情况则完全不同。在这种情况下,两步法反而让计算机的表现变差了。当人工智能试图先将原始传感器数据总结成一段通用的描述时,它似乎丢失了进行准确判断所必需的微妙且具体的细节。计算机变得过于谨慎,经常为几乎所有指标分配最低的分数,实际上是在表达“一切正常”,即便数据可能暗示了其他情况。

这一发现表明,在使用人工智能进行心理健康监测时,并不存在单一的最佳方法。最有效的方法完全取决于所使用信息的类型。如果数据来自于人们向计算机讲述他们的感受,那么先对信息进行总结有助于计算机理解大局。但如果数据来自于追踪行为的静默传感器,先进行总结则会剥离掉那些至关重要的细节,成为阻碍计算机观察完整现实的瓶颈。研究结论指出,为了使这些系统真正发挥作用,必须根据它们所分析的数据的具体性质来进行设计,而不是采用“一刀切”的策略。这种精细的匹配对于我们将日常生活的无声信号转化为一种能真正帮助我们理解自身心理健康状态的工具而言,至关重要。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →