← 最新论文
🤖 machine learning

Learning Individual Dynamics from Sparse Cross-Sectional Snapshots

本文介绍了 CADENCE,这是一种概率框架,它通过将潜在动态锚定于静态情境,从稀疏的横截面快照中唯一地恢复连续个体轨迹,从而在不依赖序列数据的情况下,实现了与密集纵向模型相当的识别能力和性能。

原作者: Christian Lagemann, Kai Lagemann, Steven L. Brunton, Sach Mukherjee

发布于 2026-05-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Christian Lagemann, Kai Lagemann, Steven L. Brunton, Sach Mukherjee

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你想要预测一个特定的人将如何衰老、一个特定的病毒将如何传播,或者一台特定的机器将如何磨损。通常,要做到这一点,你需要该人或物体的“电影”:你需要连续多年每天观察他们,才能看到完整的故事。

但在现实世界中,我们往往没有“电影”。我们只有快照。也许你只在医院见过一位病人一次,在工厂见过一台机器一次,或在实验室见过一个病毒样本一次。我们拥有来自不同人在不同时间的成千上万张这样的快照,但我们不知道其中任何一个个体的随时间变化的过程。

试图仅凭一张照片来猜测一个人的未来,就像试图通过查看单帧画面来猜测电影的剧情。从数学上讲,这是一个破碎的谜题;连接这些点的方式有无数种,而大多数方法都会失败。

论文的核心思想:CADENCE
作者介绍了一种名为CADENCE的新方法。它通过认识到虽然我们没有个体的“电影”,但我们确实拥有一个庞大的、来自彼此相似人群的快照库,从而解决了这个谜题。

以下是 CADENCE 的工作原理,使用一个简单的类比:

1. “背景”是关键

想象你正在预测一位 20 岁运动员的未来。你只有他们的一张照片。

  • 旧方法: 看着照片并猜测。(不可能)。
  • CADENCE 方法: 看着照片并问:“还有谁像这样?”你找到了一个包含数千名其他 20 岁运动员的数据库。即使你没有这位运动员的“电影”,你可能拥有另一位 20 岁运动员的“电影”,他们同时开始且拥有相同的统计数据。

CADENCE 利用“静态背景”(如人的年龄、基因或机器规格)在数据库中找到这些“双胞胎”。它假设,如果两个人在开始时看起来相同,那么随着他们的衰老,他们将遵循相同的“剧本”或“轨迹”。

2. “剧本”(原型)

论文认为,尽管每个人都是独特的,但他们都遵循少数几个基本的“剧本”或模式。

  • 类比: 想象一个剧团。只有少数几个主要角色(英雄、反派、喜剧角色)。即使有 1000 名演员,他们都扮演这些角色中的一个。
  • CADENCE 如何使用这一点: 它不为每个个体发明一个独特的剧本。相反,它根据一个人的背景确定其属于哪个“角色”(或原型)。一旦确定了角色,它就可以预测该角色的未来。如果你的病人符合“快速康复”原型,模型就会根据其他属于该组的人的康复情况,预测他们将快速康复。

3. 两步流程

该方法分两个明确的阶段进行,以避免混淆:

  • 阶段 1:翻译器(空间编码)
    原始数据(如复杂的医学扫描或高分辨率照片)杂乱无章且难以比较。CADENCE 首先将所有这些杂乱的图像翻译成一种干净、标准化的“语言”(潜在空间)。这就像将成千上万种不同的方言转换为一种完美的英语,以便每个人都能被公平地比较。这一步去除了“噪声”,并确保在原始数据中看起来相似的两个人在这里也被识别为相似。

  • 阶段 2:导演(时间动态)
    现在每个人都在说同一种语言,模型充当导演。它查看“背景”(演员的简历)并说:“好的,你正在扮演‘快速康复’的角色。”然后它调出该角色的“剧本”,并预测该演员未来的表现。

    • 神奇之处: 即使它从未见过这位特定演员的完整“电影”,它也能做到这一点。它只需要知道你正在扮演的角色的剧本。

为什么这是一个突破?

以前的方法不得不在两个糟糕的选项之间做出选择:

  1. “电影”方法: 需要每个人的密集长期数据。如果你只有一张照片,它就会失败。
  2. “人群”方法: 可以处理一张照片,但它只预测整个群体的平均行为。它丢失了个体细节。

CADENCE 打破了这一规则。 它利用“人群”来学习“剧本”(原型),然后利用背景将这些剧本应用于“个体”。

结果

作者在从简单的物理模拟到现实世界的生物数据(如血细胞如何转化为不同类型的细胞)等各种领域测试了这种方法。

  • 他们使用稀疏快照(每人一张照片)训练了 CADENCE。
  • 他们将其与使用完整电影(密集数据)训练的其他模型进行了比较。
  • 结果: CADENCE 的表现与那些有幸看到完整电影的模型一样好,有时甚至更好。

局限(注意事项)

论文诚实地指出了其局限性。该方法仅在“背景”(你拥有的静态信息)实际上能告诉你某人遵循哪个“剧本”时才有效。

  • 类比: 如果你试图根据身高预测一个人的未来,但他们的未来实际上取决于你未测量的秘密基因突变,模型就会失败。它只会猜测平均值。
  • 论文将此称为“背景可观测性假设”。如果静态数据缺少关键线索,模型就无法创造奇迹。

总结

CADENCE 是一个工具,即使我们只有个体的单张快照,也能让我们预测个体的未来。它通过认识到个体就像遵循少数几个标准剧本的演员来实现这一点。通过将个人与其背景相匹配以找到其剧本,模型可以在从未看过完整影片的情况下“填补缺失的电影”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →