← 最新论文
📊 statistics

Don't Stop Me Yet: Sampling Loss Minima via Dissipative Riemannian Mechanics

本文介绍了 DiMS,这是一种基于耗散黎曼力学的采样器,它利用动能、引力以及摩擦力,在损失函数极小值等高面上精确采样重参数化不变的解,从而相较于现有方法改进了贝叶斯推断中的不确定性量化。

原作者: Albert Kjøller Jacobsen, Leo Uhre Jakobsen, Johanna Marie Gegenfurtner, Georgios Arvanitidis

发布于 2026-05-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Albert Kjøller Jacobsen, Leo Uhre Jakobsen, Johanna Marie Gegenfurtner, Georgios Arvanitidis

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用通俗语言和创意类比对论文《Don't Stop Me Yet: Sampling Loss Minima via Dissipative Riemannian Mechanics》(别让我停下:通过耗散黎曼力学采样损失极小值)的解释。

宏观图景:寻找“谷底平地”

想象你正在训练一个神经网络(一种人工智能)来解决某个问题。你可以将训练过程视为试图在一片广阔的山地景观中找到最低点。地面的高度代表模型的“误差”或“损失”。你位置越低,模型的表现就越好。

在过去,我们通常一旦找到一个低点(单一解)就停止训练。然而,这篇论文的作者指出了一个关键细节:在现代复杂的 AI 模型中,山谷的“底部”不仅仅是一个点。它是一个巨大、平坦且相连的平地。有数百万种不同的方式来排列模型的内部设置(参数),它们都能在训练数据上产生完全相同的完美分数。

问题在于,大多数方法要么:

  1. 随机搜寻低洼区域,但可能会错过完美的平地。
  2. 被困在一个微小的点上,无法探索平地的其余部分。

这篇论文介绍了一种名为DIMS(耗散极小值采样器)的新方法,以高效地探索整个“完美平地”。

类比:摩擦小球

要理解 DIMS 如何工作,想象一颗大理石球在这片景观上滚动。

1. 旧方法(测地线):
想象一颗大理石球在完全无摩擦的表面上滚动。如果你推它一下,它会永远滚动,在山谷中来回弹跳。它永远不会停止。它虽然探索了该区域,但从未停下来给你一个具体的“答案”供你查看。它太混乱了,无法用于采样特定的解决方案。

2. 新方法(DIMS):
作者提出了一种更聪明的滚球方式。他们引入了两种新的力:

  • 重力: 这将大理石球拉向尽可能低的点(最小损失)。
  • 摩擦力(秘密武器): 这是关键。随着大理石球滚动,摩擦力会缓慢地消耗其能量。

这里的魔力在于:摩擦力不是恒定的。它是速度依赖的。

  • 如果大理石球滚动得很快(高能量),摩擦力就很强,迅速使其减速。
  • 如果大理石球滚动得很慢,摩擦力就很温和。

结果:
你将大理石球从一个已知的良好位置开始。你给它一个随机的“踢”(初始速度)。它四处滚动,探索这片景观。由于摩擦力的作用,它最终会耗尽所有能量并完全停止。关键在于,由于系统的物理特性,它总是恰好停在最小损失的平坦“平地”上

它不会停在斜坡的中间;它恰好停在模型表现完美的地方。通过改变初始“踢”的方向,你可以让大理石球停在那个完美平地的不同位置,从而为你提供一组多样化的完美解决方案。

这为什么重要?(不确定性)

为什么我们需要许多具有相同完美分数的不同解决方案?

想象你正在教一个学生(AI)用 10 张图片来识别猫。

  • 方案 A 学到了:“猫有尖耳朵。”
  • 方案 B 学到了:“猫有胡须。”
  • 方案 C 学到了:“猫有尾巴。”

这三个学生在用这 10 张图片进行测试时都得了 100 分。但如果你给他们看一张狗的照片,他们可能会产生分歧。

  • 学生 A 可能会因为狗有尖耳朵而认为那是猫。
  • 学生 B 可能会因为狗没有胡须而正确地说那不是猫。

如果你只挑选一个学生(旧方法),你就不知道你的 AI 是真正自信还是仅仅运气好。但如果你使用DIMS生成许多不同的“完美”学生,你就可以看到他们在哪里达成一致,在哪里产生分歧。

  • 如果他们对一张新图片都达成一致,那么 AI 就是自信的
  • 如果他们产生巨大分歧,那么 AI 就是不确定的

这对安全性至关重要。如果一辆 AI 驾驶的汽车,你希望它在不确定时知道减速,而不是自信地开下悬崖。

魔法背后的“物理学”

这篇论文使用了一些花哨的数学术语,但它们直接对应我们的 Marble 类比:

  • 黎曼力学(Riemannian Mechanics): 这只是描述大理石球如何在弯曲表面(AI 误差的景观)上移动,而不是在平坦地板上的数学。
  • 耗散(Dissipative): 这意味着“失去能量”。摩擦力项确保大理石球不会永远弹跳,而是会安定下来。
  • 重参数化不变性(Reparameterization Invariant): 这是一种 fancy 的说法,意思是尽管大理石球停在了不同的坐标(不同的内部设置),但函数(AI 的实际行为)同样好。

论文的实际主张

作者在几个数据集(如识别手写数字或识别玻璃类型)上测试了这种“摩擦球”方法。他们发现:

  1. 它有效: 大理石球总是停在完美的平地上,绝不会卡在斜坡的一半。
  2. 它很稳健: 你不需要过多调整摩擦设置;使用标准设置即可很好地工作。
  3. 它在猜测未知方面更出色: 当 AI 遇到未见过的数据(分布外数据)时,与其他方法相比,DIMS 方法更能说出“我不知道”。它提供了更诚实的不确定性衡量。

总结

将训练 AI 想象成寻找山谷底部。大多数方法找到一个点就停止了。这篇论文给了我们一个“摩擦球”,它在整个山谷底部滚动,在轻轻停下之前探索每一个可能的完美解决方案。这使我们能够看到 AI 知道的全貌,更重要的是,看到它不知道什么。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →