想象一下,你试图理解一场风暴的混乱舞步。狂风旋转,暴雨抽打,能量以不可预测的方式流动。科学家将这种现象称为湍流。试图写出一个单一方程来完美预测每一阵阵风几乎是不可能的,因为该系统充满了随机的“噪声”和复杂的相互作用。
本文提出了一种巧妙的两步策略来解决这一难题,就像侦探与通灵者联手破解谜案一样。
问题:“嘈杂”的风暴
湍流系统(如天气或洋流)主要包含两个部分:
- 确定性部分:可预测的规则,例如重力或水流绕过岩石时的旋转方式。
- 随机部分:随机的混乱,例如突发的阵风或不可预测的温度变化。
旧的方法试图一次性猜测整体,但它们常常在噪声中迷失,或忽略了复杂的规则。这就像试图在摇滚音乐会上听清耳语。
解决方案:双阶段侦探团队
作者创建了一个名为FEX(有限表达式方法)并结合生成模型的框架。这就像一次两阶段的调查。
第一阶段:“规则发现者”(FEX)
首先,团队使用一种名为FEX的方法来寻找“游戏规则”。
- 工作原理:想象你有一个巨大的乐高积木盒(包含加、减、乘、正弦等数学算子)。FEX 是一个智能机器人,它尝试以不同的方式将这些积木拼接在一起,构建出与数据相匹配的结构。
- 目标:它暂时忽略随机噪声,专注于寻找能够解释主要运动的简洁、闭式方程。这就像观察混乱的人群,然后意识到:“啊,实际上每个人都在遵循特定的舞蹈模式,即使他们彼此碰撞。”
- 结果:FEX 成功发现了系统相互作用的精确数学公式,包括能量守恒(就像银行账户,资金只是在账户间转移,从未被创造或销毁)。它无需预先编写可能的公式列表,而是从零开始构建它们。
第二阶段:“混乱驯服者”(生成模型)
一旦“规则发现者”完成了工作,仍然存在一个问题:现实世界是混乱的。“规则发现者”的方程很棒,但并非完美。它遗漏了微小的误差和随机波动。
- 目标:这时,第二支团队登场。他们使用生成模型(就像一位“混乱驯服者”)来研究剩余的误差。
- 工作原理:他们观察“规则发现者”的预测与实际发生情况之间的差异。他们会问:“这些剩余的随机性看起来像什么?”是微小的抖动?还是巨大的尖峰?
- 结果:生成模型学会了这种随机性的“个性”。它不仅仅猜测一个数字,而是学会了混乱的形态。在预测未来时,它将这种学到的混乱重新添加到“规则发现者”的预测中。
为何这很重要
通过拆分任务,团队获得了两者的最佳优势:
- 可解释性:我们知道系统为何运动,因为第一阶段提供了一个清晰、可读的方程(如 $F = ma$)。
- 准确性:我们捕捉到了简单平均值所遗漏的复杂、高阶统计特征(混乱的“深层”细节)。
证明:“三叉”测试
为了证明这行之有效,作者在名为随机三叉的简化模型上进行了测试。
- 类比:想象三个舞者手拉手。如果其中一个旋转,就会拉动其他人。有时他们推,有时他们拉。作者在五种不同的“情绪”下测试了这个系统:
- 能量均分:所有人均匀地跳舞。
- 正向级联:能量从领舞者流向跟随者。
- 双向级联:能量来回流动。
- 周期性/随机性:舞者被有节奏的节拍或随机、不可预测的手推动。
结果:
- “规则发现者”(FEX)在所有五种情绪下都正确识别了舞步(方程),即使音乐非常响亮且混乱。
- “混乱驯服者”(生成模型)成功重现了舞蹈的复杂、高层统计特征,不仅预测了平均运动,还预测了湍流系统中发生的罕见、剧烈的摆动。
核心结论
本文表明,你不必在简单、可理解的模型与复杂、准确的模型之间做出选择。通过使用“规则发现者”来确保物理规律正确,并利用“混乱驯服者”来处理随机性,你可以准确预测湍流系统的行为,捕捉高达第五阶复杂度(矩)的细节,而这是以往方法难以做到的。
技术摘要:基于有限表达式方法的高阶矩恢复湍流动力学
问题陈述
湍流动力学系统以强烈的非线性相互作用、内在不稳定性及随机效应为特征,这些效应生成了耦合的统计量,特别是非零的高阶矩。由于模型误差的不完美、未解析尺度以及观测数据的有限性,对这些系统进行建模极具挑战性。尽管近期数据驱动方法在学习局部或短期动力学方面已展现出成效,但它们往往依赖于低阶统计表示(例如均值和方差),这不足以捕捉湍流动力学的本质行为。此外,现有的符号发现方法,如非线性动力学系统的稀疏识别(SINDy)及其变体,依赖于预定义的函数库。这一局限性限制了它们表示超出所选基底的复杂强迫表达式的能力,并且在高度随机环境中估计系数时,往往导致违反底层守恒定律(例如能量守恒交换)。本文解决的核心问题是准确恢复确定性控制动力学(包括非线性相互作用和外部强迫)以及随机分量,以复现高达五阶的高阶统计矩。
方法论
作者提出了一种两阶段数据驱动建模框架,将符号回归与生成模型相结合,以联合识别控制动力学并预测关键统计量。
第一阶段:通过有限表达式方法(FEX)发现确定性动力学
第一阶段采用有限表达式方法(FEX)来发现动力学确定性分量的闭式表达式,记为 C(u,t)。与基于库的方法不同,FEX 将候选表达式表示为从有限集的基本一元和二元算子(例如 sin,exp,+,×)构建的二叉树。这使得层次化组合成为可能,从而捕捉超越预定义基函数线性张成的嵌套函数形式。
- 搜索机制:该方法利用混合离散 - 连续优化框架。神经网络控制器生成候选算子序列(离散搜索),而基于梯度的优化器则针对固定序列优化连续参数(缩放和偏置)。
- 目标:目标是使预测的时间增量与观测数据之间的经验损失最小化,从而在不依赖预定义库的情况下有效恢复非线性相互作用项和外部强迫。
- 分量级学习:为了提高可扩展性,该框架先分别学习每个状态分量的符号表示,然后组装成完整的向量值模型。
第二阶段:通过生成模型进行随机误差修正
由于 FEX 仅对确定性分量进行建模,因此引入第二阶段来对残差随机分量进行建模,这些分量包括未建模的随机增量以及由系数估计引起的模型误差。
- 残差定义:残差 Rn 定义为观测状态演化与第一阶段 FEX 模型预测值之间的差值:Rn=u(tn+1)−u(tn)−hC∗(u(tn))。
- 生成模型:采用三种具有代表性的生成模型来学习这些残差的分布:
- 免训练扩散模型(TFDM):通过前向和反向随机微分方程(SDE)构建随机过程,在数值上近似得分函数,无需传统意义上显式训练得分网络,尽管会训练一个网络将高斯噪声映射到残差分布。
- 随机残差激活网络(SRAN):一个轻量级网络,将高斯噪声映射到随机残差,并经过正则化处理以匹配残差的二阶统计量(协方差)。
- 变分自编码器(VAE):利用带有概率编码和解码的潜在变量框架来捕捉随机结构。
- 推理:在推理过程中,将学习到的符号动力学(第一阶段)与生成模型(第二阶段)相结合,以生成完整的估计轨迹,从而实现对涉及高度非高斯分布的高阶矩的忠实恢复。
主要贡献
- 有限数据下的准确符号发现:该框架在从确定性到强随机性的各种机制中,均表现出均匀的高技能水平,能够恢复正确的确定性表达式公式并识别非线性相互作用系数。通过 FEX 微调过程,学习到的系数尊重内在物理约束,例如能量守恒传递。
- 高阶矩恢复:通过将确定性发现与随机建模解耦,该框架成功预测了高达五阶的统计矩,捕捉了低阶方法所遗漏的湍流本质行为。
- 训练域外泛化:在恒定噪声假设下,第二阶段的生成模型学习了残差的分布,使得能够在训练机制之外进行轨迹重采样,并改善高阶矩的长期估计。
- 理论一致性:本文提供了理论分析,确立了符号估计量的一致性,并基于遍历性假设和 Itô–Taylor 展开,以数据规模和数值离散化形式量化了估计误差。
数值结果
该框架在随机三叉模型(一个代表非线性系统 Galerkin 截断的三维系统)上进行了评估,涵盖了五个不同的机制:
- 测试机制:能量均分(近高斯)、正向能量级联、双重能量级联、周期强迫和随机强迫。
- 符号发现:FEX 在所有机制中均准确恢复了控制方程,包括非线性相互作用项和复杂强迫表达式(例如正弦和指数形式)。相比之下,弱 SINDy 通常将强迫项近似为多项式,并且在强随机影响下未能正确识别相互作用项。
- 噪声容限:即使噪声水平从确定性增加到强随机机制,FEX 仍保持了准确的系数恢复(误差在 10−6 到 10−2 之间)。
- 数据效率:增加样本量改善了系数估计,在 1,000 到 4,000 个样本之间观察到显著增益,但由于固有的随机变异性,超过此阈值后收益递减。
- 矩预测:所有三种生成模型(TFDM、SRAN、VAE)均捕捉到了定性行为。SRAN 在低阶矩方面与真实值表现出最接近的一致性,而 TFDM 仅显示出微小偏差。该框架成功预测了四阶和五阶矩,尽管在随机级联机制中,由于强时间依赖性随机强迫使得恢复更具挑战性,精度有所下降。
- 时间依赖性:对 TFDM 的时间独立与时间依赖建模策略的比较揭示了权衡:时间依赖建模更好地捕捉了短期振荡协方差,但在长期范围(T>10)变得不稳定;而时间独立建模提供了更平滑、更稳定的长期轨迹,但代价是存在系统性偏差。
意义与主张
本文主张,将可解释的符号发现(FEX)与数据驱动的随机建模(生成模型)相结合,为复杂湍流系统提供了一种稳健的解决方案。其意义在于能够:
- 在不依赖预定义库的情况下恢复非线性相互作用和外部强迫的闭式表达式,同时保留物理守恒定律。
- 准确表征高阶统计量(高达五阶),这些量对于理解湍流行为至关重要,但难以用标准数据驱动方法捕捉。
- 提供一个一致的理论框架,其中符号估计量在遍历性假设下被证明是一致性的。
- 证明这种两阶段方法即使在具有多种随机源(如随机级联机制)的挑战性环境中仍然有效,突显了其在传统方法无法捕捉本质高阶动力学的复杂随机系统中的潜在适用性。
作者指出,尽管该框架行之有效,但 TFDM 的计算成本随时间步长和数据量增加而扩展,未来的工作需要开发更具可扩展性的实现,并将该方法扩展到多尺度耦合随机效应和随机偏微分方程。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。