← 最新论文
💻 computer science

Revisiting Neural Processes via Fourier Transform and Volterra Series

本文提出了一类新的平移等变神经常规过程(Neural Processes),该类方法利用 Volterra 级数来实现分析透明度,并引入了集合傅里叶卷积(Set Fourier Convolutions),以高效地建模具有全局感受野且具备线性扩展性的非规则采样数据。

原作者: Peiman Mohseni, Nick Duffield, Raymond K. W. Wong

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Peiman Mohseni, Nick Duffield, Raymond K. W. Wong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是使用简单语言和日常类比对论文《通过傅里叶变换与 Volterra 级数重新审视神经过程》(Revisiting Neural Processes via Fourier Transform and Volterra Series)进行的解释。

大局观:预测不可见之物

想象你是一名天气预报员。你拥有一些零散的气象站(有些在城市,有些在荒郊野外)正在报告温度和风速。你的目标是预测地图上每一个其他点的天气,即使那里没有任何传感器。

在机器学习的世界里,这被称为神经过程(Neural Processes, NPs)。这些是智能模型,它们通过学习少量凌乱、不规则的数据点,来推测生成这些数据的整个隐性曲线(即“隐函数”)的形状。

然而,现有的模型有两个大问题:

  1. “网格”问题: 一些模型试图将所有数据强行放入一个完美的、整齐的网格中(就像坐标纸)。如果你的数据是分散的或者地图非常巨大,这个网格会变得难以处理,或者你会丢失细节。
  2. “全对全”问题: 其他模型(如 Transformer)会观察每一个数据点并将其与每一个其他点进行比较以寻找模式。这虽然极其精确,但随着数据量的增加,速度会变得非常慢且成本高昂(就像试图让派对上的每一个人都去认识其他每一个人一样)。

这篇论文提出了一种同时解决这两个问题的新方法。


两个核心思想

作者引入了两个数学工具来解决这些问题:Volterra 级数傅里叶变换

1. Volterra 级数:复杂性的“配方”

问题: 现有的模型就像黑匣子。它们堆叠一层又一层的数学运算,我们并不真正了解它们为什么有效,或者它们到底在学习什么样的模式。这很难解释。

解决方案: 作者使用了被称为 Volterra 级数 的工具。

  • 类比: 想象你正在烤蛋糕。一个简单的模型可能只会说:“混合面粉和糖。”一个复杂的模型可能会说:“混合面粉、糖、鸡蛋、黄油、香草,并在 350 度下烘烤 30 分钟,但如果正在下雨,就多加一个鸡蛋。”
  • Volterra 级数就像一本大师级的食谱书,它将任何复杂的“混合”过程分解为一系列简单的步骤之和:
    • 第一步:仅仅是原材料(线性)。
    • 第二步:原材料如何相互作用(二次项)。
    • 第三步:三种原材料如何相互作用(三次项),依此类推。

通过使用这种方法,作者可以清晰地描述模型的行为(它是“解析透明的”),而不是仅仅进行猜测。他们可以精确地证明模型是如何组合数据点的。

2. 集频率卷积(SFConvs): “收音机调谐器”

问题:

  • 网格模型(如 ConvCNPs)很快,但需要数据位于完美的网格上。如果你的数据来自锯齿状的海岸线或 3D 云团,你必须将其强行塞入一个方框,这会浪费内存并丢失细节。
  • 注意力模型(如 Transformer)可以处理杂乱的数据,但因为要将每个点与所有其他点进行比较,所以速度很慢。

解决方案: 作者使用了傅里叶变换(SFConvs)。

  • 类比: 想象你正在听收音机。
    • 空间域(旧方法): 你观察随时间移动的声波。要理解整首歌,你必须分析波形中的每一次细微波动。如果波形很乱,这会非常困难。
    • 频率域(新方法): 你将收音机调到特定的频率(音符)。与其观察整个混乱的波形,不如直接看“低音”、“中音”和“高音”的旋钮。
  • 为什么有效: 大多数自然信号(如天气、图像或流体流动)的大部分重要信息都集中在“低音”(低频)中。
  • 神奇之处: 通过直接处理这些“音符”(频率)而不是混乱的“波形”(空间点),该模型实现了:
    1. 跳过网格: 它不需要将数据强行放入网格。它可以直接处理分散的点。
    2. 全局视野: 在频率世界中,一个“音符”连接着整个信号。这给了模型一种“全局视角”(它可以看到伦敦的一场风暴如何影响巴黎的天气),而无需逐一比较每个点。
    3. 保持高效: 它的扩展是线性的(增加数据只会增加少量的计算量),不像注意力模型那样具有缓慢的平方级扩展特性。

新模型:SFConvCNPs 与 SFVConvCNPs

作者基于这些想法构建了两种新模型:

  1. SFConvCNPs: 这些模型使用“收音机调谐器”(傅里叶)方法。它们堆叠了这些基于频率的操作层。它们速度快,能处理杂乱数据,并且具备全局视野。
  2. SFVConvCNPs: 这些模型将“收音机调谐器”与“食谱书”(Volterra)结合在一起。它们使用傅里叶方法高效处理数据,但使用 Volterra 级数来构建数学结构,以确保模型的可解释性并捕捉复杂的非线性相互作用。

研究发现(结果)

作者在多个挑战任务中,将这些新模型与现有的最佳模型(如标准神经过程、Transformer 和卷积神经过程)进行了对比测试:

  • 合成数学任务: 他们尝试预测锯齿波和光滑曲线。新模型在预测那些其他模型表现失败的尖锐、锯齿状部分方面做得更好。
  • 捕食者-猎物动力学: 他们模拟了狐狸和兔子的关系。新模型准确地预测了种群周期,甚至在从模拟数据迁移到真实历史数据(哈德逊湾海狸-猞猁记录)时也表现出色。
  • 图像补全: 他们尝试“填补空白”,即补全缺失部分的图像(如 CIFAR-10)。新模型在重建缺失像素方面表现优异。
  • 流体动力学与气候: 他们模拟了复杂的旋转流体(Kolmogorov 流)和真实的全球气候数据(ERA5 温度)。
    • 关键优势: 当他们在训练期间未曾见过的欧洲区域(“偏移”后的地图)进行测试时,由于新模型遵循平移对称性,其表现近乎完美。而依赖于绝对位置的旧模型则完全失效。

总结

可以将这篇论文看作是对汽车引擎的一次升级。

  • 旧款汽车要么拥有优秀的悬挂系统(适合平坦道路/网格),但无法应对越野地形;要么拥有优秀的越野轮胎(注意力机制),但过于沉重且耗油。
  • 这篇论文引入了一种新的悬挂系统(Volterra),它能解释汽车如何应对颠簸;以及新的轮胎(傅里叶),它可以在任何地形(分散的数据)上行驶而不会被卡住,同时保持快速且高效。

其结果是一个快速准确可解释(我们知道它是如何工作的)且鲁棒(即使数据移动到新位置也能正常工作)的模型。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →