在现代科学与工程领域,计算机不断被要求去理解杂乱、不完整的信息。无论是预测天气、诊断疾病,还是引导机器人,其目标都是在不确定性下进行推理。为了实现这一目标,研究人员使用了一种称为贝叶斯推断(Bayesian inference)的框架,该框架将知识视为一组随着新证据到达而不断更新的信念。想象一下你正在尝试猜测一个隐藏物体的方位;你先有一个大致的想法,然后每当你得到一个新的线索,你就会调整这个想法。当线索变得复杂且隐藏物体拥有许多运动部件时,挑战便随之而来。在这些情况下,计算精确答案所需的数学运算量变得如此巨大,以至于即使是最快的超级计算机也无法在合理的时间内解决。因此,科学家们开发了被称为“近似方法”的捷径,通过牺牲完美的准确性来换取速度。这些捷径通过简化问题来运作,通常假设系统的不同部分是相互独立的,或者遵循简单的、可预测的模式。然而,这些简化有时会丢弃关于系统真实不确定性的关键细节,导致产生过度自信且可能具有危险性的预测。
一个研究团队开发了一种新的方式来应对这种权衡,提供了一种既能保持这些捷径的速度,又能恢复丢失的不确定性细节的方法。他们的工作聚焦于一种特定类型的数学图谱——因子图(factor graph),这种图谱将一个复杂问题分解为可以单独求解的小型局部组成部分。传统上,当这些部分被求解时,它们之间传递的信息要么是精确但杂乱的真相(这太慢了无法使用),要么是简化后的平均版本(这很快但往往不准确)。研究人员发现了第三条中间道路。他们找到了一种方法,将精确且杂乱的信息投影到计算机可以处理的简化形状上,但这样做的方式能够保留原始信息中最重要的部分。他们将这种方法称为自然梯度消息传递(natural-gradient message passing)。该方法不再是抹平复杂性或忽略复杂性,而是仔细提取出符合简化模型的特定不确定性成分,从而确保最终答案能够诚实地反映其所知与所不知。
研究人员在几个不确定性作为常客的现实世界问题上测试了这种新方法。在一项实验中,他们观察了一个数据点链,类似于追踪多年的太阳黑子活动。当数据出现巨大的空白时,旧方法会变得危险地自信,即使在数据缺失的情况下也会预测出一条平滑的路径。然而,新方法正确地扩大了其不确定性区间,承认了它在空白期并不了解发生了什么。在另一个涉及以批次形式到达的数据流(例如传感器向计算机实时传输信息)的测试中,旧方法会累积微小的误差,最终导致系统变得过度自信并丢失真实的信号。新方法避免了这种崩溃,即使在分块处理信息时,也能保持对数据的稳定且准确的观察。这些结果表明,当系统处理非标准、复杂的关联关系时,该方法尤其具有价值,因为在这些情况下,常规的捷径无法捕捉到全貌。
这项发现的核心在于研究人员如何处理模型不同部分之间传递的“消息”。在旧方法中,当一个复杂的数据片段被发送到系统的较简单部分时,系统通常会为了使数学运算可行而将细节平均化,这实际上模糊了图像。新方法通过观察接收端的特定不确定性形状改变了这一点。它获取复杂的的消息,并在更简单的形状内寻找最佳拟合,保留重要的部分,仅丢弃那些无法被表示的部分。这不是一种猜测或平均,而是一种精确的数学调整,确保简化模型保留关于系统真实不确定性的本质信息。研究人员发现,当数据清晰且不确定性较低时,新方法表现得与旧方法一样好。但当数据存在噪声、不完整,或者以误差可能不断累积的流式方式到达时,新方法则脱颖而出,提供了对真实状态更可靠的估计。
这项工作并不声称解决了人工智能或统计学中的每一个问题,也不暗示对于所有复杂系统而言,完美的答案现在已唾手可得。相反,它为一类特定的、常见的问题提供了实际的改进,在这些问题中,不确定性是持久存在且难以管理的。研究人员证明,通过改变信息从模型的一个部分投影到另一个部分的方式,他们可以防止系统产生虚假的自信。对于天气预报、金融市场监测或自动驾驶车辆引导等应用场景,这是一种显著的进步,因为在这些领域,了解自身知识的极限与做出预测本身同样重要。该方法具有计算效率,这意味着它不需要大量的额外时间或动力来运行,使其成为需要兼顾速度与对不确定性保持诚实的现实世界系统的可行选择。通过弥合精确计算与实际近似之间的差距,这种新方法为机器在不确定的世界中进行推理提供了一种更清晰、更可靠的方式。
技术摘要:消息传递的信息几何学
问题陈述
贝叶斯推断需要评估后验分布 p(z∣y),这涉及到一个通常难以计算的高维归一化常数。虽然变分推断 (VI) 通过在可行的分布族上进行优化来取代积分来解决这一问题,但标准方法在全局与局部表述之间面临权衡:
- 全局 VI: 优化单个全局分布 qλ(z)。虽然这允许清晰的自然梯度平稳性表征 (Khan, 2025),但其近似是一个单体对象。对于大型图形模型,全局族所需的充分统计量和费舍尔矩阵(Fisher matrices)可能在计算上难以承受,或者与模型的因子分解不匹配。
- 局部 VI(消息传递): 将问题分解为因子图上的局部计算(例如,置信传播 BP、变分消息传递 VMP)。这保留了模块化特性,但在**闭合性(closure)**方面存在困难。精确的 BP 消息通过非共轭因子时,其函数形式(例如非高斯、非 Gamma 分布)无法由周围图中使用的有限维指数族来表示。
- 差距: 现有的局部方法如变分消息传递 (VMP),通过对相邻信念进行平均(倾斜/tilting)来恢复闭合性,但这丢弃了关于输入消息不确定性的特定信息。本文探讨的问题是:能否将 VI 的全局自然梯度平稳条件局部化为因子图上的消息规则,从而在不需要全局联合近似的情况下,保留更多精确 BP 信息。
方法论:自然梯度消息传递 (NGMP)
作者提出了一种 自然梯度消息传递 (NGly NGMP) 方案,该方案通过将选定的边边缘分布约束在指数族内,从 Bethe 自由能框架中推导而来。
理论推导
- 边局部约束: 从 Bethe 自由能出发,作者在特定的边边缘分布上施加指数族形式约束 qi∈Ei。
- 平稳条件: 通过对受约束的 Bethe 拉格朗日函数求导,他们推导出了一个局部平稳条件(定理 1)。在平稳点处,边的自然参数 λi 等于两个入射因子产生的两个投影消息之和。
- 投影规则:
- 令 ℓa→i 为因子 a 到边 i 的精确 BP 对数消息。
- 因子发送的消息并非精确的 ℓa→i(后者可能落在边族之外),而是其在接收边当前边缘分布 qi 处的切空间上的自然梯度投影。
- 数学表达式为:
ηa→i=∇μiEqi[ℓa→i]
其中 μi 是接收边的均值参数。
- 随后,输出消息为 μ^a→i∝exp(ηa→i⊤Ti(zi))。
与现有方法的区别
- 对比 VMP: VMP 通过在其他变量的边缘分布下对对数似然进行平均,用“倾斜”的替代分布来替换因子。这种平均过程丢弃了变量间耦合产生的行列式修正项。相反,NGMP 投影的是精确的 BP 对数消息(使用精确的空腔分布计算)到接收族上。它保留了精确更新中可表示的部分,仅丢弃了正交残差。
- 对比期望传播 (EP): EP 构建一个空腔,恢复因子以创建一个倾斜分布,并将边缘分布投影到族上。NGMP 则直接将对数消息(因子到边的更新)进行投影。
- 对比非共轭 VMP (NCVMP): NCVMP 仅执行一次倾斜 VMP 消息的投影步骤。NGMP 投影的是精确的 BP 消息。
- 替代模型解释: 作者展示了 NGMP 可以通过在辅助图上用共轭替代叶子(伪观测)替换非共轭因子来实现。这些替代参数由投影后的自然参数决定。这使得可以在替代图上运行标准 BP,同时在外层循环中更新投影点。
核心贡献
- 自然梯度的局部化: 本文确立了 VI 的全局自然梯度平稳条件(Khan, 2025)在 Forney 式因子图上具有边局部的形式。
- NGMP 规则: 推导证明了最优消息是精确 BP 对数消息在接收边缘分布切空间上的 Fisher 度量投影。
- 替代模型等价性: 证明了 NGMP 更新等价于在带有共轭叶子的替代图上运行 BP,这提供了一条实际的实现路径。
- 理论统一: 将 BP、VMP、EP 和 NGMP 置于统一的局部变分语言中,并通过它们的信息流和投影点进行区分。
实验结果
作者通过消融研究和大规模实验验证了 NGMP,重点关注不确定性持续存在且被重复组合的情景。
1. 消融研究 (第 7 节)
- 消失的不确定性: 在具有大量观测值的正态-精度模型中,边不确定性消失。在这种情况下,NGMP 和 VMP 收敛,因为行列式修正变得微不足道。
- 泊松平滑 (太阳黑子数据): 在具有非共轭泊松观测的状态空间模型中,长期的缺失数据产生了持续的不确定性。
- 结果: VMP(及其投影变体 PVMP)无法正确传播不确定性,导致后验方差人为偏低(≈σ2/2),无论距离数据多远。NGMP 能正确传播空腔不确定性,从而产生更宽的置信区间,并在留出数据上显著降低了负对数似然 (NLL)(例如,50% 掩码下:PVMP NLL ≈ 5.4,而 NGMP ≈ 4.9)。
- 异方差滤波: 在包含 10 个批次的在线回归设置中,VMP 会累积局部欠离散误差,导致噪声权重的后验分布发生坍缩(过度自信)。
- 结果: NGMP 几乎不受批次化的影响,保持后验方差接近全量数据的拟合结果。对于 NGMP 而言,“批次化惩罚”(由于顺序处理导致的 NLL 增加)几乎可以忽略不计($0.009$ nats),而对于 VMP 而言则非常显著($0.235$ nats)。
2. 大规模实验 (第 8 节)
- UCI 回归: 在使用深度为三层的异方差层次结构的六个数据集上,NGMP 在四个数据集(Concrete, Energy, Power, Yacht)上达到了最低 NLL,并在其他数据集上表现出竞争力,优于 Bayes by Backprop、确定性 VI 和 IVON。
- ETTh 预测: 在冻结预测器的概率集成中,NGMP 提高了校准度。虽然在点预测(RMSE)方面与其他方法竞争相当,但 NGMP 显著降低了相对于 PVMP 和神经门控基准的 NLL,防止了其他方法中观察到的预测尺度坍缩现象。
意义与主张
本文认为,在边缘不确定性无法降低且近似更新被重复组合(例如通过潜链进行平滑或在线滤波)的情景下,NGMP 提供了一种原则性的改进。
- 校准优于点准确度: NGMP 的主要收益在于不确定性校准。虽然点估计(RMSE)可能相似,但 NGMP 保留了 VMP 所平均掉的“行列式修正”项。这防止了模型在处理序列数据或通过非共轭因子时出现过度自信。
- 模块化: 与全局 VI 不同,NGMP 不需要单一的全局指数族。它允许每条边携带自己的指数族,从而保留了因子图的模块化特性。
- 实用性: 该方法计算高效,每步边更新仅需一次自然梯度步骤(相比之下,投影式 VMP 需要内部优化循环)。
- 未来方向: 作者指出,该框架支持将因子图编译为替代程序(例如用于 RxInfer.jl),并为在规划问题中通过投影消息来实现连续状态的主动推理(Active Inference)提供了路径。
总之,本文论证了通过尊重接收边缘的信息几何学,NGMP 保留了其他局部方法所丢弃的精确 BP 更新中的“局部相关”部分,从而在复杂的非共轭和序列推理任务中实现了更优的校准。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。