← 最新论文
⚡ electrical engineering

CardioState-JEPA: Delay-Aware Cross-Modal Learning of a Shared Cardiac Representation

CardioState-JEPA 是一种新型心脏基础模型,它通过采用一种具有学习延迟对齐器的联合嵌入预测架构来克服时间偏移,从而在 ECG、PPG 和 PCG 信号之间学习统一的、具备生理感知能力的表示,进而实现在不依赖特权临床文本或大量监督标签的情况下,在多种下游任务上达到最先进的性能。

原作者: Hamza Shafiq, Hung Manh Pham, Bin Zhu, Pan Zhou, Jun Hu, Aaqib Saeed

发布于 2026-08-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Hamza Shafiq, Hung Manh Pham, Bin Zhu, Pan Zhou, Jun Hu, Aaqib Saeed

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图理解一座繁忙城市中一天的故事。你可以听广播(电信号),观察高速公路上的车流(血流),或者站在街角聆听鸣笛声和喧闹声(活动的声响)。每种方式都提供了拼图的一块,但它们发生的时间略有不同,呈现出的形态也大相径庭。在心脏健康领域,医生主要通过三种方式来倾听心脏:ECG(捕捉心脏的电火花)、PPG(观察脉搏波如何在血管中传播,就像池塘里的涟漪)以及 PCG(聆听心脏瓣膜关闭时实际发出的“砰-哒”声)。长期以来,科学家们为每种线索都构建了独立的“AI侦探”,将它们视为互不相关的谜团。但心脏是一个整体机器,而这些线索只是同一事件的不同视角。一个大问题是:我们能否构建一个超级聪明的AI,通过同时结合这三种视角,来学习心脏真实的生命故事,即便它们到达的时间各不相同?

这正是 CardioState-JEPA 背后的研究人员致力于解决的问题。他们意识到,虽然心脏的电火花最先发生,但瓣膜产生的机械“撞击声”会在一瞬间后到来,而血液脉冲传导至你的手腕则会更晚到达。如果你试图通过仅仅在时间轴上对齐这些信号来教计算机理解它们,它会感到困惑,因为它在比较错误的时刻。相反,该团队构建了一种新型AI模型,它扮演着“大师级翻译官”的角色。它不仅仅是死记硬背ECG波形的形状,而是学习心脏本身的“隐藏状态”。这就像是学习电影的剧情,而不是仅仅死记硬背一种语言的字幕。该模型使用了一种被称为“延迟感知学习”(delay-aware learning)的高明技巧,这就像拥有一个聪明的助手,他知道门被撞击的声音(心音)总是发生在人推门(电信号)之后的一小段时间内。通过教AI在考虑这些微小延迟的情况下去预测心脏故事中缺失的部分,该模型学习到了一种单一且共享的语言。

结果非常令人印象深刻。研究人员在25项不同的任务上测试了他们的新型“CardioState-JEPA”模型,从识别心律失常到测量血压以及检测心杂音。当他们冻结模型的“大脑”,仅添加简单的工具来解决特定问题时,它的表现优于以往任何只观察单一信号类型的AI。例如,它将检测心杂音(异常心音)的能力在标准评分量表上大幅提升了 18.8分,并将血压和脉搏检测能力提升了 8.2分。更令人惊讶的是,它在仅使用原始信号的情况下,就达到了甚至超过了那些使用昂贵的、具有特权地位的医学笔记和标签进行训练的模型。这项研究表明,通过让这些不同的信号相互“监督”——让心脏的声音帮助模型理解电火花,反之亦然——我们可以建立对人类生理学更深层次的理解。这是从为每个传感器构建单独工具,向构建一个真正理解生命节奏的统一、智能的基础模型的跨越。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →