← 最新论文
🤖 machine learning

Optimization as a Dynamical System: Generative Schedules from Latent ODEs

本文介绍了一种将训练动态建模为潜在常微分方程(latent ODE)的元学习方法,旨在生成最优且具有泛化能力的学习率调度策略,该方法不仅优于现有基准方法,而且能使模型在各种架构上都表现出更卓越的泛化性能。

原作者: Matt L. Sampson, Peter Melchior

发布于 2026-08-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Matt L. Sampson, Peter Melchior

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图通过向一个机器人展示数千张照片来教它识别猫、狗和汽车。为了实现这一点,机器人使用了一种被称为“梯度下降”的数学过程,这就像一名登山者试图在雾气缭绕的山谷中寻找最低点。登山者向下迈步,其步伐受到脚下地面坡度感官的引导。控制每一步大小的设置被称为“学习率”。如果步子太小,登山者需要花很长时间才能到达谷底;如果步子太大,登山者可能会越过谷底并产生剧烈的震荡,永远无法稳定下来。

多年来,科学家们一直试图找出改变步长大小的最佳方式。他们通常会选择一个固定的计划,比如“从大步开始并逐渐减小步幅”,或者“先迈大步,然后小步,再变大步”。但这些计划就像是根据另一座山绘制的地图;它们无法对机器人当前正在行走的实际地形做出反应。这个领域的核心问题是:我们能否教会计算机实时观察机器人的进度,并立即决定下一刻的最佳步长,从而确保它能找到最深、最稳定的谷底?这就是寻找“最优学习率调度方案”的挑战。

这时,一种名为“基于潜在常微分方程(Latent ODEs)的生成式调度方案”的新方法出现了,它不将训练过程视为一个静态的清单,而是将其视为一个活生生的、呼吸着的动力系统。你可以把它想象成一位经验丰富的教练,观察着成千上ạch名运动员的训练。教练不会给每位运动员都制定通用的训练计划,而是观察运动员当前的步速和疲劳程度,然后预测如果现在改变节奏,他们在未来会如何表现。研究人员 Matt L. Wiemann 和 Peter Melchior 来自普林斯顿大学,他们构建了一个能够从过去的训练运行中学习,从而创造出“时间机器”式学习率的系统。

以下是他们的系统是如何运作的:首先,他们让计算机使用几种不同的标准步长计划进行模型训练。他们记录下一切:模型的误差(即模型犯下的“错误”)是如何下降的,准确率是如何上升的,以及当时的步长是多少。他们将这些数据输入到一个特殊的神经网络中,称为潜在常微分方程(Latent Ordinary Differential Equation, LODE)。你可以将 LODE 视为一个超级聪明的翻译官,它能将训练过程中杂乱、嘈杂的数据转化为平滑且隐藏的“状态”,从而捕捉到训练过程的本质。这就像是将一整部电影压缩成一个完美的摘要,告诉你正在讲述什么样的故事。

一旦 LODE 经过训练,它就会变成一个水晶球。当新的训练任务开始时,系统会观察模型进展的前几分钟。它会询问 LODE:“如果我们继续执行当前的计划,最终会走向何方?”然后,它会做一件聪明的事:它会创造出一系列“假设场景”。它会稍微调整当前的状态(就像想象运动员采取了略微不同的步幅),并模拟成千上万种可能的未来。对于每种未来,它都会预测最终得分。随后,它会选择那个能带来最佳最终结果的场景,并从中提取出实现该结果的具体步长计划。

结果令人瞩目。在图像识别任务(如识别衣服或复杂场景)甚至是一个预测故事中下一个词的语言模型测试中,这种新的调度器始终优于所有旧有的固定计划。它不仅仅是在微调数字;它创造了全新的、看起来奇特的调度方案,这些方案与研究人员尝试过的标准“阶梯式下降”或“余弦波”计划完全不同。事实上,论文显示,这些新的调度方案往往会将学习率推高到远高于传统安全规则所允许的水平,这实际上是让模型在进入平缓、稳定的谷底之前,先在崎岖的地形中“奔跑”一段。

为什么这很重要?因为使用这种方法训练的模型不仅得分略有提高,而且似乎找到了数学景观中的“平坦”区域。简单来说,平坦区域意味着如果向模型展示一张略有不同的图片或一段略有不同的句子,模型不太容易感到困惑。这就像是登山者发现了一个微小且危险的岩架,与发现一个宽阔平坦的高原之间的区别。论文表明,通过将训练过程理解为一个动力系统并预测长期未来,我们可以引导 AI 模型变得更加稳健和准确,而无需了解模型本身的内部秘密。作者发现,这种方法适用于各种类型的 AI,从简单的图像分类器到复杂的语言 Transformer,并且与其它先进方法相比,它不需要大量的额外计算资源。这是一种通过观察自身学习过程,来教计算机“如何学习”的方法。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →