← 最新论文
🤖 machine learning

Learning Energy-Based Models from Stochastic Interpolants using Spatiotemporal Differences

本文指出了现有仅依赖空间或时间差异的能量基模型训练方法中的失效模式,并提出了一种统一框架——时空噪声对比估计(stNCE),该框架利用联合时空差异,在图像和分子密度估计任务上实现了最先进的性能。

原作者: Hanlin Yu, RuiKang OuYang, Partha Kaushik, Arto Klami, Michael U. Gutmann, Omar Chehab

发布于 2026-05-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Hanlin Yu, RuiKang OuYang, Partha Kaushik, Arto Klami, Michael U. Gutmann, Omar Chehab

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试教计算机理解一个复杂世界的“形状”,比如一张拥挤的城市地图或一个分子结构。在机器学习中,这被称为学习概率密度。计算机需要知道事物可能发生的地点(高密度)和不太可能发生的地点(低密度)。

本文提出了一种新方法,利用称为**基于能量的模型(Energy-Based Models, EBMs)**的技术来教计算机理解这种形状。将 EBM 想象成一片由山丘和山谷组成的景观。计算机需要学会:“山谷”是安全、常见的地方(数据),而“山丘”则是罕见、不太可能的地方。

问题:两张破碎的地图

作者认为,以往教计算机理解这种景观的方法依赖于两种不同的策略,但两者都存在致命缺陷:

  1. “时间旅行者”方法(时间维度方法):

    • 核心思路: 想象你有一张清晰的猫的照片(数据)和一张模糊、充满噪点的猫的照片(参考)。你通过询问“清晰照片与模糊照片有何不同?”来教导计算机。你是通过随时间逐步添加噪点来实现这一点的。
    • 缺陷: 如果清晰照片和模糊照片看起来有些相似,这种方法效果很好。但如果“模糊”照片只是随机噪点(像旧电视上的雪花),而“清晰”照片是一只特定的猫,它们之间完全没有重叠。计算机在试图连接两个毫无共同点的事物时会迷失方向。本文将此称为**“支持不匹配”(support mismatch)**。
  2. “邻居”方法(空间维度方法):

    • 核心思路: 不依赖时间,而是观察邻居。你询问“这张猫的照片与紧邻的猫的照片有何不同?”你通过比较景观上的微小步长来教导计算机。
    • 缺陷: 如果景观是平滑的,这种方法效果很好。但想象一下,景观中有两个被大片空旷海洋隔开的猫岛。如果你只观察直接邻居,你永远无法跨越海洋去意识到存在两个岛屿。你会被困在一个岛上而错过另一个。本文将此称为**“多模态”(multimodal)**问题。

解决方案:时空桥梁

作者提出了一种名为**stNCE(时空噪声对比估计)**的新方法。

stNCE 不选择要么时间要么空间,而是同时使用两者

类比:
想象你正在绘制一个隐藏宝藏岛屿的地图,该岛屿有两个分离的海滩(多模态问题),并被一片雾海环绕(支持不匹配问题)。

  • 时间旅行者试图从雾海走到海滩,但因雾气太浓而受阻。
  • 邻居试图从一个海滩走到另一个海滩,但因无法看穿水面而受阻。
  • stNCE方法就像一架直升机。它可以同时向前移动(时间)和横向移动(空间)。它可以飞越雾气找到第一个海滩,然后飞越水面找到第二个海滩。通过采取“对角线”步骤(同时改变时间和位置),它始终保持在安全、高密度的区域(海滩及其附近水域),永远不会迷失在空旷的危险区域中。

工作原理

该方法将学习过程转化为一个简单的**“找不同”**游戏。

  1. 计算机生成两对数据点:一对是“真实”数据点及其轻微修改版本;另一对则是交换后的组合。
  2. 计算机必须猜测哪一对是“真实”的,哪一对是“交换”的。
  3. 为了赢得这个游戏,计算机必须学习正确的能量景观(山丘和山谷),以便区分它们。

为何更优

本文表明,这种“直升机”方法解决了导致其他方法失败的问题:

  • 它能处理多模态数据(多个岛屿),因为它可以利用时间步长在它们之间跳跃。
  • 它能处理支持不匹配(雾海),因为它不依赖于从噪点到数据的单次巨大跳跃,而是采取相互连接的小步长。

结果

作者在三种类型的数据上测试了该方法:

  1. 合成数据: 简单的数学问题,已知答案。stNCE 几乎零误差地得出了正确答案,而其他方法则失败了。
  2. 图像(MNIST 和 ImageNet): 识别手写数字和通用图像。stNCE 产生的结果与当前最佳方法(State-of-the-Art)一样好,但对为何有效有了更清晰的理解。
  3. 分子: 模拟蛋白质中原子的折叠方式。stNCE 能够高效地学习分子的正确形状,在与专门的基于物理的方法竞争的同时,训练速度快得多。

总结

简而言之,本文指出:“不要只关注数据随时间的变化,也不要只关注其在空间中的变化。要同时观察两者。通过结合这两种视角,我们可以构建一幅世界地图,它既不会在雾中迷失,也不会被困在一个岛屿上。”

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →