← 最新论文
🤖 machine learning

Adynamical systems view of training generativemodels and the memorization phenomenon

本文采用动力系统视角,利用随机梯度下降中的双时标动力学以及关于模型崩溃的最新成果,为生成模型中输出在训练期间长时间保持静态的记忆现象提供一种系统理论解释。

原作者: Siva Athreya, Chiranjib Bhattacharya, Vivek S. Borkar

发布于 2026-05-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Siva Athreya, Chiranjib Bhattacharya, Vivek S. Borkar

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用简单语言和创意类比对这篇论文的解读。

宏观图景:为何 AI 会“卡”在相同的想法上

想象你在教一个机器人画画。你希望它学会风景画的通用风格,从而创作出新的美丽风景。然而,你发现了一个奇怪的故障:过了一段时间,机器人不再创作新作品,而是连续数小时反复画同一棵树,或同一朵云。它“死记硬背”了某个特定输出,而不是学会了通用概念。

这篇论文解释了为什么会发生这种情况。作者认为,这不仅仅是代码中的漏洞,而是机器人学习方式的自然结果,特别是因为它学习时的步长速度

他们将训练过程视为一个动态系统,而不是静态的数学问题——就像一颗球在崎岖的山坡上滚动。


核心概念:两种学习速度

作者提出,机器人的大脑(模型)包含两个以截然不同速度学习的部分。这就像一个背着沉重背包的徒步者

  1. 快徒步者(“快”变量): 这部分大脑学习迅速。就像徒步者的双腿,不断根据地形进行调整。
  2. 慢徒步者(“慢”变量): 这部分学习非常缓慢。就像徒步者的背包,仅偶尔才会发生重量转移。

在现实世界中,“损失函数”(衡量机器人画作糟糕程度的指标)主要取决于快变量,而仅轻微依赖于慢变量。因此,快变量为了寻找好位置而飞速穿梭,而慢变量几乎纹丝不动。

“崩溃”现象:被困在坑里

首先,作者解释了一个更简单的问题,称为**“崩溃”**。

想象机器人试图找到山谷的最低点(最佳解决方案)。

  • 理想情况: 如果机器人采取微小且不断缩小的步长(像一个谨慎的探险家),它最终会 settle 在山谷的最底部并停留在那里。
  • “崩溃”情况: 如果机器人采取恒定、稳定的步长(像一个以固定速度行走的人),它可能会冲过谷底,反弹回来,然后被困在一个小的局部凹陷中。

用论文的语言来说,如果机器人只是试图生成数据而没有“噪声”将其震松,它最终会崩溃成一个单一的、固定的输出。它不再是一个生成器,而变成了一个特定图像的记录仪。从数学上讲,这就像一颗球滚进一个坑里并永远停留在那里。

“死记硬背”现象:懒惰的振荡器

现在,这里有一个转折。作者解释说,死记硬背是“崩溃”与“漂移”的混合体。

因为机器人拥有两种不同的速度(快变量和慢变量)并且采取恒定步长,会发生一些有趣的事情:

  1. 快部分崩溃: 快变量迅速 settle 在一个局部凹陷中(一种特定的图像风格)。机器人开始反复输出该图像。这看起来像是“死记硬背”。
  2. 慢部分漂移: 然而,慢变量仍在移动,只是非常缓慢。它们正在缓慢地推动问题的“景观”。
  3. 跳跃: 最终,慢漂移将快变量推出当前的凹陷。机器人突然跳跃到另一个凹陷(另一张图像)并在那里停留很长时间。

类比: 想象一个弛豫振荡器(像萤火虫闪烁或心跳)。

  • 机器人长时间在一个地方“睡觉”(死记硬背一张图像)。
  • 然后,压力缓慢积累,直到它“跳跃”到一个新位置。
  • 它停留在那里,再次睡觉,然后重复。

这就是死记硬背:机器人并非永远卡在一张图像上;它会在很长一段时间内卡在一张图像上,然后切换到另一张,再切换到下一张。这是一个间歇性的循环:陷入困境,然后缓慢漂移离开。

为什么步长很重要?

论文强调,这种情况之所以发生, specifically 是因为学习算法使用了恒定步长(固定速度)。

  • 小步长: 如果机器人采取微小步长,它会平稳地 settle 下来,学会通用形状而不会陷入循环。
  • 恒定步长: 如果机器人持续采取相同大小的步长,就会产生一场“拔河”。快变量想要 settle,但恒定的动量不断推动它们。
  • 大步长(噪声): 作者指出,如果你将步长变得非常大,就会引入过多的“噪声”(震动),导致机器人根本无法 settle 进死记硬背的循环中。它跳动得太频繁,无法被困住。这解释了为什么某些使用大步长的训练方法能避免死记硬背。

作者论点总结

  1. 高维产生两种速度: 由于 AI 模型拥有大量参数,有些学习快,有些学习慢。
  2. 恒定步长产生循环: 使用固定的学习率会阻止系统完美 settle。
  3. 崩溃是基础: 如果没有噪声,系统只会冻结在一个输出上。
  4. 死记硬背是“漂移式崩溃”: 因为慢变量持续移动,系统会在某个输出上卡住一段时间,然后缓慢漂移到新的输出,从而形成重复循环。

这篇论文并未立即提供一种修复此问题的新工具,但它提供了一张数学地图,解释了为什么会发生这种情况。它告诉我们,死记硬背并非随机错误;它是一个以固定速度在两种不同速度下移动的系统所表现出的可预测行为。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →