Ordered Diffusion Kernels
本文引入了有序扩散核(Ordered Diffusion Kernels, ODKs),这是一类新型局部核,通过推断数据排序而非速度场来逼近任意伊藤随机微分方程的无穷小生成元,从而实现在先验信息有限的动力系统中对漂移系数和扩散系数进行准确且解耦的恢复。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,试图通过一张河流的水流照片来理解河流的流动。你看到了波纹、泡沫和大致的方向,但你无法看到水流的速度、水面下的隐藏岩石,或是从侧面推动水的风。在数据科学的世界里,研究人员经常面临这个完全相同的问题。他们拥有大量的快照——细胞、恒星或天气模式的测量值——这些是在随机时刻拍摄的,但他们缺乏关于这些系统如何随时间实际移动和变化的连续视频。几十年来,科学家们一直试图使用被称为“核函数”(kernels)的数学工具来重建这些隐藏的运动,这些工具就像是一个透镜,用以聚焦于数据点之间的局部关系。然而,这些传统的透镜有一个盲点:它们难以将推动系统向特定方向移动的力量与过程中发生的随机抖动区分开来。如果不知道两者之间的区别,重建的系统未来图像将会是模糊且往往不正确的。
来自伦敦帝国理工学院和法国的研究团队开发了一种观察这些快照的新方法,这种方法成功地将定向运动从随机噪声中解构出来。他们将这种方法称为“有序扩散核”(Ordered Diffusion Kernels)。与其从一开始就尝试猜测数据集中每个点的确切速度和方向——这在没有先验知识的情况下通常是不可能的任务——他们首先提出了一个简单得多的问题:事物的顺序是什么?他们观察数据并确定哪些点在系统的旅程中处于“较早”阶段,哪些处于“较晚”阶段,从而创建一个简单的演进图谱。通过首先关注这个序列,他们可以构建一个数学模型,准确地恢复系统的稳定漂移和其随机波动的强度,即使在数据稀疏、多噪或来自复杂的、高维世界的情况下也是如此。
这种新方法的核心在于它如何处理“排序”的概念。在许多自然系统中,例如细胞的生长和分裂,存在一个从起始状态到结束状态的清晰路径,但确切的时间或速度可能是未知的。传统方法通常尝试拟合一个势能景观,假设系统像一个球沿着山坡滚动。这对于简单的、稳定的系统效果很好,但当景观复杂或数据不完全符合稳态假设时,这种方法就会失效。新方法放宽了这一要求。它不要求有一张完美的“山坡图”;它只需要一个能告诉它路径中哪边是“向上”的函数。这种排序函数充当了一个向导,允许研究人员构建一个核函数——一种数学权重工具——该工具能够尊重流动的方向,而不会被随机噪声所迷惑。
一旦建立了这种排序,研究人员就会利用它来构建一个近似系统“无穷小生成元”(infinitesimal generator)的模型。通俗地说,这是描述系统如何从一个微小时刻变化到下一个时刻的数学引擎。他们构建过程的美妙之处在于,它将这种变化的两个主要组成部分分离开来:漂移(drift),即可预测的、定向的运动;以及扩散(diffusion),即随机的、扩散的运动。以前的方法通常强行将这两个元素联系在一起,这意味着如果你改变了漂移的速度,你也会无意中改变随机噪声的大小,反之亦然。这种耦合使得研究那些噪声本身会随位置而变化的系统变得非常困难。新的有序扩散核打破了这种联系,允许研究人员独立地估计漂移和扩散。这是一个重大的进步,因为这意味着他们现在可以模拟那些随机性并非恒定、而是随位置变化的系统,而这在生物和物理过程中是非常普遍的特征。
为了测试他们的理论,研究人员将该方法应用于多个合成数据集,通过创建具有已知规则的人造世界来观察其工具是否能找到这些规则。在一个实验中,他们在环面(torus,一种像甜甜圈一样的形状)上模拟了数据,这提出了一个独特的挑战,因为路径会绕回到自身。传统的排序方法在这里很难处理,因为你无法在循环上定义一个单一的“起点”和“终点”而不破坏逻辑。研究人员通过使用“局部排序函数”克服了这一点,该函数只比较附近的点,而不是试图一次性对整个循环进行排序。结果令人瞩目:他们的模型成功重建了支配运动和随机扩散的确切数学规则,并以极高的精度匹配了已知的地面真值(ground truth)。他们还证明了该方法可以处理各向异性扩散(anisotropic diffusion),即随机扩散在不同方向上的速率不同,这在标准工具中是一个极其困难的情景。
研究人员还探索了在已知系统快照时间与未知时间的情况下如何使用此方法。在不知道每个测量时间的情况下,他们开发了一种通过观察数据点的整体分布来推断排序和扩散强度的方法。他们发现,即使不知道每个点被捕获的确切时间,数据的几何结构也包含了足够的信息来恢复底层的动力学过程。当时间已知时,他们可以使用更直接的方法,将模型拟合到特定的事件序列中。在两种场景下,该方法都表现出了鲁棒性,能够恢复其他技术所遗漏的复杂非线性模式。
这项工作的最引人入胜之处之一在于其在单细胞生物学领域的应用潜力,在这一领域,由于测量的破坏性,追踪单个细胞随时间的变化是不可能的。研究人员只能捕捉细胞状态的一个快照,然后将其销毁,从而留下的是一系列独立的瞬间而非连续的电影。新方法提供了一种从这些静态帧中重建“电影”的方式。通过将细胞生命的演进视为一个排序问题,研究人员展示了他们的工具如何推断驱动细胞命运的基因调节网络,将细胞的确定性指令与生物变异的随机噪声区分开来。虽然论文重点在于使用合成数据来证明概念,但该框架在设计上明确旨在处理现实世界中杂乱、高维且稀疏的生物数据。
研究人员并未声称已经解决了动力系统中的所有问题。他们承认,其方法依赖于数据位于高维空间中的低维曲面这一假设,即所谓的“流形假设”(manifold hypothesis)。他们还指出,在数据的边界附近,由于可对比的邻居较少,重建的准确性可能会下降。然而,他们展示了即使在这些困难区域,该方法也比现有的替代方案表现更好,特别是在数据包含某种程度的模糊边界噪声时。他们还讨论了识别一个系统的行为是由确定性力量驱动,还是由随机噪声的梯度驱动的挑战,这仍然是一个难题,但现在通过他们的新工具已变得更加可行。
最后,这项工作代表了我们如何处理从静态数据中重建隐藏动力学的一种转变。通过将简单的、直觉性的“排序”概念置于猜测确切力量的复杂任务之上,研究人员创造了一个既灵活又强大的工具。它允许科学家观察散落的点,并看到其下方流动的河流,清晰地分辨出当前流向与漩涡,这种清晰度是以前无法企及的。这不仅仅是一种数学上的精进;这是一种看待世界的新方式,它将一堆混乱的快照转化为了一个关于运动与变化的连贯故事。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。