← 最新论文
🤖 machine learning

Retraction-Free Optimization over the Stiefel Manifold for the LoRA Fine-Tuning

本文提出了一种针对 Stiefel 流形的无回缩、无惩罚参数优化算法,并具有全局收敛保证,并将其应用于开发 Manifold-LoRA,一种用于大语言模型的几何加速微调方法,该方法实现了高效训练和强大的下游性能。

原作者: Yuan Zhang, Jiang Hu, Zhijian Lai, Lin Lin, Zaiwen Wen

发布于 2026-07-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuan Zhang, Jiang Hu, Zhijian Lai, Lin Lin, Zaiwen Wen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个巨大的、超级聪明的机器人说一种新语言或解决一个特定的谜题。这个机器人已经掌握了很多知识,但它体型庞大,如果从头开始教它一切,将耗费一辈子的时间并花费巨额财富。所以,与其重写整个机器人的大脑,你决定只是微调它一个微小的、特殊的部件。这就是“微调”(fine-tuning)大型语言模型的世界。

但这里有一个棘手的部分:当你微调这些微小的部件时,你必须遵循非常严格的规则。这就像是在跳舞。如果你把双脚迈得太开,你就会失去平衡并摔倒。在数学中,这种“平衡”被称为保持在一个特定的形状上,即“流形”(manifold)。长期以来,计算机保持这种平衡的方式就像是一个笨拙的舞者,不断地通过照镜子来检查自己,精确计算每一步该怎么走,然后强行把脚拉回到完美的位置。这种“照镜子”(称为“收缩”,retraction)的过程很慢且计算成本很高,就像是试图在跑步的同时不断停下来系鞋带。

另一组舞者尝试了另一种方法:他们只是自由地跳舞,并寄希望于自己不会摔得太远,而是使用一种“惩罚”机制,如果他们步子迈错了,就会受到轻微的惩罚。但这需要一名裁判不断调整惩罚的力度,这既麻烦又难以把握。计算机科学领域的这个大问题是:我们能否教会机器人完美地跳舞,既不需要缓慢的照镜子,也不需要一位裁判来不断调整惩罚?

这篇论文说:“是的,我们可以。”作者袁张(Yuan Zhang)及其团队开发了一种训练这些 AI 模型的新方法,它跳过了缓慢的照镜子过程,也不需要裁判来调整惩罚。他们将这种新方法称为 Manifold-LoRA

以下是他们是如何做到的。他们并没有强迫机器人在每一步都保持完美的平衡(这很慢),而是让它可以进行几次可能会导致轻微摇晃的舞步。然后,他们使用了一个巧妙的数学“磁铁”,轻轻地将它拉回完美的舞池。他们发现的奥秘在于,他们弄清楚了这个磁铁需要多强的力量。他们证明了,如果你将磁铁设置为一个特定的、固定的强度(他们发现设为 1/3 时效果很好),机器人自然而然地就会滑回完美的位置,而不需要任何人来调整磁铁的功率。

他们还意识到,我们通常教这些机器人的方式(使用一种称为 LoRA 的方法)存在隐藏的冗余,就像是两个人抬着一个重箱子,而其实一个人就能完成一样。通过将机器人的调整视为在特定几何形状(Stiefel 流形)上的舞蹈,他们去除了这种额外的重量。这意味着机器人可以用一半的可调节部件完成相同的任务,或者以两倍的速度学习相同数量的部件。

在实验中,他们在各种任务上测试了这种新的舞蹈动作,从回答关于阅读理解的问题到生成创意故事。结果令人印象深刻。在多个数据集上,他们的方法比标准方法收敛(学会任务)的速度快了两倍。例如,在名为 SQuAD 2.0 的数据集上,他们的模型用一半的时间就达到了相同的性能水平。更令人惊讶的是,与标准方法相比,他们仅使用一半的可训练参数就获得了更好的结果。

作者并不只是凭直觉猜测这行得通;他们提供了严密的数学证明,表明无论他们是使用较小的固定步长还是逐渐缩小的步长,他们的方法都能保证落在正确的“舞池”上并找到最佳解决方案。他们表明,这种方法不仅更快,而且更稳定,这意味着机器人在学习过程中不会感到困惑或产生剧烈晃动。

简而言之,这篇论文为训练巨型 AI 模型提供了一种更平滑的新方式。通过消除对缓慢、沉重计算和不必要调整的需求,它使这些模型能够学习得更快、更高效。这就像是教一个舞者通过感受地板而不是不断照镜子来寻找平衡,从而实现既快速又优雅的表演。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →