RTS Smoother-Guided Learning of Physics-Based Neural Differential Models
本文提出了一种两阶段混合神经-物理框架,该框架在基于 Rauch–Tung–Striebel (RTS) 平滑器的状态估计与神经网络参数优化之间交替进行,旨在从部分状态观测中学习常微分方程的缺失组成部分,同时保持可解释的机制结构。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你是一名正在试图破解谜团的侦探,但你手里只有几张模糊的嫌疑人行动快照,故事的其他部分都缺失了。在科学世界中,这是一个常见的问题,当我们研究事物随时间变化的方式时(例如心脏的跳动、化学反应的起伏或神经元的放电),就会遇到这种情况。科学家使用被称为“常微分方程”(ODEs)的数学配方来描述这些变化。你可以把 ODE 想象成一套指令,它在说:“如果系统现在处于这种状态,那么在下一瞬间它会精确地处于哪里。”通常,这些配方是完美的,但在现实世界中,我们并不了解完整的配方。有些成分缺失了,我们也无法看到系统的每一个部分;我们可能只看到了温度,却没看到压力;或者只看到了电压,却没看到细胞内部隐藏的开关。这使得预测未来或理解过去变得极其困难,因为那些缺失的部分可能正是最重要的部分。
这篇论文解决的正是一个令人头疼的问题。作者提出了一种聪明的填补空白的新方法。他们没有使用可能会被噪声搞糊涂的“黑盒”计算机程序来猜测缺失的部分,而是使用了一个名为“Rauch–Tung–Striebel (RTS) 平滑器”的“时空旅行”数学工具。想象一下你在看电影,但投影仪在闪烁并跳帧。一个普通的观众(或标准的计算机滤波器)仅根据刚刚看到的画面来猜测接下来会发生什么。但 RTS 平滑器就像一名侦探,他会从头到尾看完整部电影,然后通过同时观察来自未来和过去的线索来进行倒带,从而填补缺失的帧。通过使用这种“全知视角”来推测隐藏状态,他们训练了一个混合模型——一部分是已知的物理学,一部分是人工智能——来学习游戏缺失的规则。他们发现,与那些依赖于一步步猜测隐藏状态的其他流行方法相比,这种方法在重建系统的隐藏部分以及预测未来方面表现得更好,即使是在数据充满噪声或不完整的情况下也是如此。
侦探的困境:缺失的碎片与嘈杂的线索
在从生物学到工程学的许多领域,科学家们使用数学来模拟系统的演化。但通常,数学是不完整的。我们可能知道汽车在向前行驶,但不知道引擎是如何响应油门踏板的。或者我们可能看到了神经元的电脉冲,却错过了导致其产生的微小内部开关。更糟糕的是,我们的传感器并不完美。我们得到的测量数据带有噪声,就像试图在风暴中听清一声低语,而且我们往往无法同时测量所有变量。
这篇论文建议采用一种混合方法:保留我们确切知道的数学部分(“机械式”部分),并使用神经网络(一种人工智能)来学习我们不知道的部分。训练这个 AI 是最棘手的部分。通常,要教导 AI,你需要知道“地面真值”(ground truth)——即系统实际经历的隐藏路径。但如果我们无法测量隐藏部分,我们就没有那个真相。其他方法尝试使用“循环”神经网络来猜测隐藏路径,这就像一个学生试图通过逐句阅读来背诵一个故事。如果故事很混乱,或者学生累了(数据有噪声),他们可能会迷失方向。
时空旅行式的解决方案
这篇论文的作者决定采取一条不同的路线。他们没有尝试一步步去猜测隐藏路径,而是使用了一个叫做 RST 平滑器 的工具。把 RTS 平滑器想象成一位超级聪明的编辑,他在写下“隐藏”故事的任何一个字之前,都会从头到尾读完整个测量数据的完整故事。因为它观察了整个时间线,所以它可以平滑掉噪声,并推断出隐藏变量最可能的运行路径,即使这些变量从未被直接测量过。
这个过程通过两个交替进行的步骤运作,就像一场舞蹈:
- 猜测: 首先,他们冻结 AI 的大脑,并利用 RTS 平滑器,根据有噪声的测量数据和已知的物理部分来猜测隐藏状态(“潜变量”状态)。这给了他们一条看起来像是“地面真值”的“平滑”轨迹。
- 教学: 接着,他们将这条平滑后的轨迹视为真实的真相。他们利用它来教导神经网络如何填补缺失的物理方程。
- 重复: 他们在猜测路径和教导 AI 之间来回切换,直到模型变得非常擅长此道。
为什么这很重要:长远眼光
其他方法的一个大问题是,它们擅长预测下一秒,但对预测下一小时却表现糟糕。如果你在第一步犯了一个微小的错误,这个错误会不断扩大,就像滚下山坡的雪球一样,直到预测完全错误。作者意识到,仅仅训练 AI 观察下一步是不够的。
因此,他们增加了一个“长时程”测试。他们不仅仅问 AI,“你能预测下一秒吗?”他们还问,“你能预测接下来的 50 秒吗?”如果 AI 的预测随着时间的推移偏离了真相,他们就会对其进行惩罚。这迫使 AI 去学习系统的真实底层规则,而不仅仅是一个只在瞬间有效的捷径。
结果:更清晰的图像
作者在五个不同的系统上测试了他们的方法,范围从简单的摆钟到复杂的生物模型,如酵母细胞的能量循环和神经元的电放电。在每种情况下,他们都将自己的方法与其他的流行 AI 技术进行了对比。
- 摆钟: 当只测量摆动重物的位移(但未测量速度)时,他们的方法完美地重建了隐藏的速度,并保持了摆动的正确性。
- 神经元: 对于一个大脑细胞的模型,他们成功重建了一个控制细胞何时放电的隐藏“门控”变量,尽管该变量从未被测量。
- 化学反应: 在一个复杂的化学系统中,他们恢复了隐藏的化学浓度,并保持了振荡模式的稳定。
结果令人印象深刻。在模拟实验中,他们的方法在猜测隐藏状态方面的误差比其他方法降低了巨大幅度。例如,在酵母模型中,误差从其他方法的约 0.19 降至仅为 0.0004。他们还发现,他们的模型在长时间内保持准确,而其他方法则会偏离航向。
鲁棒性:处理噪声
或许最令人兴奋的发现是该方法处理糟糕数据的能力。作者测试了他们的系统在测量数据噪声不断增加的情况下的表现,模拟了“风暴”越来越大的情况。即使在信号非常微弱(信噪比仅为 5)的情况下,RTS 平滑器仍然能够重建出隐藏变量的连贯路径。这表明该方法非常鲁棒,不会轻易因为数据混乱而崩溃,而这恰恰是现实世界中经常发生的情况。
核心结论
这篇论文并不声称已经解决了科学中的每一个谜团。它承认,如果数据极其稀疏,或者噪声不符合我们的预期,该方法仍可能产生困惑。然而,它为那些试图理解带有缺失部分的复杂系统的科学家提供了一个强大的新工具。通过使用“时空旅行”式的平滑器来引导学习过程,他们可以构建出不仅准确而且具有可解释性的混合模型——我们知道哪些部分是基于已知物理学的,哪些部分是由 AI 学习到的。
关键的启示是,有时为了理解未来,你需要观察全局,而不仅仅是下一步。通过将经典数学的可靠性与人工智能的灵活性相结合,并使用一种聪明的“全知视角”训练技巧,这种方法帮助我们构建更完善的现实世界数字孪生体,即使我们无法看到一切。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。