← 最新论文
🤖 machine learning

Zero-order Parameter-free Optimization for LMO-based Methods: Novel Approach for Efficient Fine-tuning

本文介绍了 AdaNAGED\texttt{AdaNAGED},一种新颖的无参数零阶优化方法,它将自适应调节与基于线性最小化算子的几何感知更新相结合,旨在实现大型语言模型的高效内存微调,且无需昂贵的超参数搜索。

原作者: Dmitriy Bystrov, Daniil Medyakov, Dmitry Bylinkin, Aleksandr Beznosikov

发布于 2026-06-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Dmitriy Bystrov, Daniil Medyakov, Dmitry Bylinkin, Aleksandr Beznosikov

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个巨大的、极其聪明的机器人(一个大型语言模型),它已经通过阅读整个互联网学会了说话和写作。现在,你想教它一项特定的新技能,比如理解电影评论。这个过程被称为“微调”(fine-tuning)。

通常,教导这个机器人涉及一种叫做“反向传播”(backpropagation)的方法。可以把这想象成一位老师站在机器人旁边,观察它的每一个动作,计算出如何修正它的错误,然后写下一本厚厚的笔记(激活值、梯度、优化器状态)来记住下次该怎么做。问题在于,对于一个巨大的机器人来说,这本笔记如此庞大,以至于填满了整个教室的内存,使得过程既缓慢又昂贵。

论文的核心思想:“在黑暗中摸索”

作者提出了一种不同的教导机器人的方式,称为“零阶优化”(Zero-Order Optimization)。与其观察机器人并进行精确的数学计算,不如想象你是在一个黑暗的房间里寻找出口。你没有地图(梯度)。相反,你迈出一小步,感受一下空气是否变凉快了(损失函数是否下降了?),然后再迈出另一步。你只需要知道是“更好”还是“更差”,而不需要知道精确的数学原理是为什么。这节省了大量的内存,因为你不需要写下那本巨大的笔记。

“摸索”带来的问题

然而,这里有一个陷阱。当你通过感觉来摸索时,你需要决定两件事:

  1. 要迈多大的步子?(如果步子迈得太大,你可能会掉下悬崖;迈得太小,你永远也到不了目的地。)
  2. 你的感官应该有多“模糊”?(如果你走得太远去测试空气,你可能会错过小的障碍物;如果你靠得太近,一阵微风就可能让你感到困惑。)

在过去,人们必须为每个新任务完美地猜测这些数字。如果你猜错了,机器人就学不到任何东西。这需要大量的试错,既慢又令人烦恼。

解决方案:一个自动调节的指南针

作者引入了一种新方法,叫做 AdaNAGED(以及它的矩阵版本 AdaMuGED)。把这想象成给机器人一个自动调节的指南针

  • 无参数化(Parameter-Free): 机器人不需要你告诉它步子该迈多大。它会观察自己最近的历史记录。如果它刚刚迈出一步且结果很好,它就知道自己走在正确的轨道上。如果结果不稳定,它就知道要放慢速度。它能实时算出完美的步长和“模糊度”设置,而不需要人类预先进行调整。
  • 几何感知(LMO): 作者还注意到,机器人的大脑不仅仅是一串平坦的数字,它是由不同的形状组成的(有些部分像网格,有些像列表)。标准方法将一切视为平坦的列表。作者的方法使用了一个特殊的工具,叫做线性最小化算子(Linear Minimization Oracle, LMO)。想象你在推一个沉重的箱子。如果你直着推,它可能会卡住。但如果你知道箱子在一个斜坡上,你会斜着推,让它顺着坡滑下去。这种方法能根据机器人大脑的具体形状,计算出推动它的最佳“角度”,使学习过程更平滑、更快速。

实验结果

团队在大型模型(OPT-1.3B)上进行了测试,教它理解电影评论(SST-2 任务)。

  • 他们将这个“自动调节指南针”机器人与经过专家手动调优(专家花费数小时猜测正确的步长)的机器人进行了对比。
  • 结果: 这个自带“自动调节指南针”的机器人表现得几乎与那些经过专家调优的机器人一样好。它不需要人类进行猜谜游戏,却依然有效地学习了这项任务。

总结

这篇论文提出了一种教导巨型 AI 模型的新方法,它:

  1. 节省内存: 它不需要写下那本巨大的笔记(无需反向传播)。
  2. 节省时间: 它能自动计算自己的学习速度和设置,因此人类不必浪费时间去猜测。
  3. 效果更好: 它理解 AI 大脑的特定形状,从而能在最有效的方向上推动它。

这就像是教一个巨大的机器人走路,通过让它感受自己的平衡并自动调整步幅,而不是强迫它遵循一份僵化的、预先写好的手册。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →