← 最新论文
🤖 machine learning

OpenMHC: Accelerating the Science of Wearable Foundation Models

本文介绍了 OpenMHC,这是一个包含来自近 12,000 名参与者的超过 6,000 万小时可穿戴健康数据的全面开放获取数据集,以及基础模型的开源实现和统一的基准测试,旨在使可穿戴健康人工智能的研究民主化并加速其发展。

原作者: Narayan Schuetz, Yuze Bai, Lianggang Pan, Edgar Eggert, Favour Nerrise, Juan Delgado-SanMartin, Max Rosenblattl, Milana Gurbanova, Mohammad Asadi, Anders Johnson, Paul Schmiedmayer, Dennis Wang, Allan
发布于 2026-07-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Narayan Schuetz, Yuze Bai, Lianggang Pan, Edgar Eggert, Favour Nerrise, Juan Delgado-SanMartin, Max Rosenblattl, Milana Gurbanova, Mohammad Asadi, Anders Johnson, Paul Schmiedmayer, Dennis Wang, Allan Lawrie, Daniel Seung Kim, Xin Liu, Akshay Paruchuri, Ehsan Adeli, Euan Ashley, Kelly W. Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你的智能手表是一个永不疲倦、从不睡觉的微型侦探。它在每一分钟里都向你的手机低声诉说着秘密:你走了多少步、心跳有多快、睡眠有多深,甚至你征服了多少层楼梯。多年来,科学家们一直想教会计算机倾听这些低语,从而更好地了解我们的健康。他们称这些超级聪明的计算机为“基础模型”(foundation models)。把它们想象成一位品尝过世界上所有菜肴的大厨;一旦他们掌握了各种风味,就能瞬间发明新食谱或识别出不好的食材。但问题在于:要成为一名大厨,你需要一个装满食材的巨大厨房。在健康数据的世界里,最大的厨房都被锁在了紧闭的大门后,由大型科技公司掌控,导致研究人员手里只有些微小且空荡荡的橱柜。没有足够的数据,这些 AI 大厨就无法学习人体运动和感受的完整故事。

正是在这里,来自斯坦福大学、伦敦帝国理工学院等机构的研究团队带着一把巨大的钥匙登场了。他们开启了“My Heart Counts”研究的大门,这是一项已经运行了十多年的数字健康实验。他们正在发布一个被称为 OpenMHC 的宝库。这不仅仅是一份小零食;它是来自近 12,000 人、超过 6,700 万小时 可穿戴数据的盛宴。它包含了从步数、心率到睡眠模式和运动日志的一切内容,数据收集自 iPhone 和 Apple Watch。除了这个庞大的数据集,他们还分享了用于测试它的“食谱”(代码)和“训练好的大厨”(AI 模型)。他们的目标是让世界各地的任何人都能尝试通过这些工具,创造出预测健康问题、填补缺失数据或预测我们身体行为的新方法。

关于食材的重要提示: 在你开始烹饪之前,需要知道这个厨房有一些特殊的特性。贡献数据的参与者主要来自美国,且群体向 30 多岁的白人男性倾斜。这意味着 AI 学习到的“风味”可能并不完全适合世界上的其他人。此外,由于这是一项数字研究,所有的健康信息(例如是否患有糖尿病或心情如何)都是由用户自我报告的。这为标签引入了一些“噪音”或不确定性,使得 AI 更难学习到完美的模式。最后,该 AI 旨在根据收集数据时的健康特征进行检测,而不是为了预测未来的医疗事件(如明年是否会发生心脏病发作)。

重磅揭晓:他们的发现

研究人员不仅仅是倾倒数据;他们建立了一个巨大的游乐场,以观察哪些 AI 模型实际上能够理解这些数据。他们设置了三个主要挑战:

  1. 预测: AI 能否仅通过观察你的手表数据,就猜出你的健康特征(如是否患有糖尿病或是否快乐)?
  2. 填补(补全缺失值): 由于人们在洗澡或充电时会摘下手表,数据会出现空缺。AI 能否猜出那些缺失的分钟里发生了什么?
  3. 预测(预报): AI 能否预测你未来 24 小时的活动情况?

以下是他们的发现:

1. “专业大厨”胜出,但“简单厨师”依然强劲
当他们测试不同的 AI 模型时,一个名为 LSM-2 的模型(一种专门针对可穿戴数据训练的基础模型)被证明是整体表现最好的大厨。它在预测健康结果和填补缺失数据方面表现得最为稳定。然而,研究人员发现了一个令人惊讶的事实:一个更简单、更传统的模型——XGBoost(一种非常有序、基于规则的计算器)紧随其后,表现非常接近。事实上,对于某些任务,这个简单的模型与那些花哨、复杂的 AI 一样出色。这表明,虽然大型 AI 功能强大,但我们不应假设“越复杂”就一定意味着“越好”。有时,一个经过良好调优的简单工具也能发挥奇效。

2. 大型语言模型(如聊天机器人)表现挣扎
团队还尝试使用大型语言模型(即那些写文章和与你聊天的模型)来解决这些健康难题。他们将数据作为文本或图表图像输入模型。结果如何?这些庞大的聊天机器人通常比专门的健康模型甚至简单的计算器表现得更差。看来,对于阅读心跳和步数这种特定的“语言”,专门的工具比通用型的工具要好得多。

3. 长期记忆大有裨益
在处理缺失数据(填补)时,那些能够观察用户数天历史记录的模型,比那些只看单日数据的模型表现要好得多。这就像是在猜测某人现在正在做什么:如果你只看他一分钟,你可能会猜错;但如果你知道他通常在下午 6 点去跑步,你就能做出更明智的判断。论文指出,利用用户的长期历史记录是让这些模型变得更聪明的关键。

4. 公平性至关重要
研究人员还检查了模型是否公平地对待每个人。他们发现,虽然那些高级 AI 模型很准确,但与简单的模型相比,它们在针对某些群体(如不同年龄组或性别)时有时会犯更大的错误。这是一个至回的提醒:在我们构建这些健康工具时,必须确保它们对每个人都公平,而不仅仅是对大多数人公平。

为什么这改变了游戏规则

在这篇论文发表之前,如果你想构建一个理解可穿戴健康数据的 AI,你会陷入困境。你拿不到数据,也看不到大公司是如何训练他们的模型的。这就像是在从未见过驾驶舱的情况下尝试学习驾驶飞机。

OpenMHC 通过提供驾驶舱、飞行手册和模拟训练器改变了这一点。通过发布跨越 13 年、涵盖 11,894 名参与者 的数据以及运行模型的代码,作者们使这一领域实现了民主化。他们并不声称已经解决了所有的健康谜团;事实上,他们承认对于某些疾病,由于自我报告数据的性质,AI 仍然难以超越简单的基准线。但他们为整个科学界提供了基础,让他们可以开始烹饪、实验,并有望发现保持健康的新方法。厨房现在已经向所有人开放,食材也已准备就绪,等待着任何人来使用。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →