← 最新论文
🤖 machine learning

Neurai-VN Benchmark: Standardized Machine Learning Models for Multimodal Digital Phenotyping in Mental Health Classification

本文介绍了 Neurai-VN 基准测试,这是一个利用来自 100 名越南成年人的高分辨率多模态数据集,旨在评估用于分类抑郁、焦虑和临床障碍等心理健康状况的可复现机器学习模型的标准化框架。

原作者: Quoc-Cuong Pham, Hoang-Thuy-Duong Vu, Thi-Thanh-Huong Ha, Huy-Hieu Pham

发布于 2026-07-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Quoc-Cuong Pham, Hoang-Thuy-Duong Vu, Thi-Thanh-Huong Ha, Huy-Hieu Pham

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你的手机和智能手表就像是一对观察力极强、沉默寡言的室友。它们不仅仅是在报时;它们还在观察你的动作方式、心跳频率、睡眠时长,甚至是你解锁屏幕的频率。在心理健康领域,科学家们称之为“数字表型”(digital phenotyping)。这是一个高级的说法,意指我们可以将这些数字习惯转化为一张反映一个人内心感受的地图。多年来,研究人员一直试图利用这些地图来发现抑郁或焦虑的早期迹象,希望能赶在问题变得严重之前将其捕捉。但问题在于:每个研究团队使用的地图、工具和规则都不尽相同。这就像是在比较一份用法语写的蛋糕食谱、一份用日语写的食谱和一份随手涂鸦在餐巾纸上的食谱。你无法真正判断哪一个更好,因为原料和指令全都乱套了。此外,大多数这些地图都是利用西方国家的人群数据绘制的,这让我们不禁怀疑,同样的规则是否也适用于越南或其他世界各地的民众。

这篇题为“NEURAI-VN BENCHMARK”的论文,正是为了解决这个混乱的“厨房”而生的。作者们利用一个名为 NEURAI-VN 的全新数据集创建了一个标准化的“测试厨房”,该数据集收集自 100 名越南成年人在两周内的信息。他们收集了海量的数据,包括来自可穿戴设备和手机的 17 种不同类型的信号,以及自我报告的情绪日志。研究人员并没有仅仅靠猜测哪种计算机程序效果最好,而是设立了一场严格且公平的竞赛。他们测试了四种不同类型的机器学习模型(把它们想象成不同种类的侦探:一种是简单的逻辑专家,一种是树叶分析师,一种是强大的提升引擎,还有一种是深度神经网络)来应对四项特定的心理健康挑战。其目标并非发明一种新的神奇疗法,而是建立一把可靠的尺子,以便未来的科学家能够公平地衡量自己的进展。

这场竞赛的结果清晰明了,尽管并不完美。研究人员发现,当他们结合来自不同来源的数据时——比如将心率数据与睡眠日志和每日情绪调查混合在一起——这些“侦探”的工作效率就会提高。具体而言,该系统在区分健康人群与抑郁症患者方面表现相当出色(在以 1 为完美的量表中得分为 0.71),在区分健康人群与患有任何临床心理健康状况的人群方面也表现出色(同样为 0.71)。在区分健康人群与焦虑症患者时,它的确定性略有下降(0.69);而最困难的任务是区分抑郁症患者与焦虑症患者,在这种情况下,得分降至 0.56。

论文指出,虽然增加更多类型的数据通常有助于提高模型的性能,但“最佳”的数据组合完全取决于所提出的具体问题。例如,用于识别抑郁症的最佳设置与用于识别焦虑症的最佳设置并不相同。作者明确排除了“只要向模型投喂任何数据就能保证获胜”的想法;他们表明,如何组织和组合数据,与数据本身一样重要。他们还强调,他们的结果是基于特定的 100 名越南成年人,因此这些数字是一个坚实的起点,但它们还不是适用于全世界所有人的普遍法则。

最后,这篇论文并不声称已经解决了心理健康诊断问题。相反,它提供了一个可重复的“计分板”。通过建立一种测试这些数字工具的标准方法,作者希望未来的研究人员不必每次都重新发明轮子。他们建立了一种共同的语言和一个公平的竞技场,让科学界在通过数字足迹理解心理健康的探索过程中,终于能够实现“苹果比苹果”的公平比较,而不是“苹果比橘子”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →