← 最新论文
🤖 machine learning

Low-Rank Ternary Adaptation for Fine-Tuning Transformers

本文提出了“三值乘性自适应”(ternary multiplicative adaptation),这是一种新颖的低秩方法,通过利用小型三值矩阵来表示离散权重更新,从而实现对三值 Transformer 的高效微调,在保持三值域的同时允许无需反量化即可直接合并,并显著恢复了语言和视觉模型的性能。

原作者: Alexandru-Dragos Manolache, Yunqiang Li, Jan van Gemert

发布于 2026-08-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Alexandru-Dragos Manolache, Yunqiang Li, Jan van Gemert

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

现代人工智能依赖于被称为“Transformer”的海量计算机程序,这些程序已成为从写作助手到图像生成器等一切事物的引擎。这些程序功能极其强大,但它们也非常沉重,需要大量的计算机内存和能量来运行。为了使它们能在手机或笔记本电脑等较小的设备上使用,研究人员多年来一直致力于将其缩小。一种流行的策略是压缩程序内部的数字,将它们从复杂的高精度数值转变为更简单的低比特版本。想象一下,将一张高分辨率照片简化为仅有的几种颜色;图像变得更小且处理速度更快,尽管一些细节不可避免地会丢失。这种压缩最激进的形式是将程序的内部数字限制在仅有的三个可能值:负一、零和正一。这种方法被称为三值量化(ternary quantization),它能将所需的内存削减十倍,有可能将曾经需要大型服务器才能运行的模型,转化为可以在标准笔记本电脑上运行的模型。

然而,一个显著的问题阻碍了这些超紧凑模型的进展。虽然这些模型体积小且效率高,但它们很难学习新任务。教导这些程序的标准方法涉及对其数值进行微小的、连续的调整。但当一个模型被限制在仅有的三个值时,它无法进行微调;它只能将一个数字从负数翻转为正数,或者将其完全关闭。现有的教导这些压缩模型的技巧通常需要将数字暂时恢复到完整的、沉重的规模以进行更改,然后再将其重新压缩。这种先扩张再压缩的过程会引入误差,从而降低模型的性能,往往导致最终结果甚至比没有进行过任何教导时还要差。

来自代尔夫特理工大学和亚马逊的一组研究人员开发了一种新的教导这些超紧凑模型的方法,避开了这种扩张与误差的循环。他们并没有尝试向模型添加微小的、连续的数值,而是设计了一个直接在严格的三值系统内工作的系统。他们设计了一个类似于开关的系统,允许模型翻转其内部数字的正负号或将其完全关闭,而无需离开压缩状态。为了提高效率,他们并没有尝试单独调整每一个数字。相反,他们使用了一种数学结构,允许通过少量简单、微小的模式来同时控制模型的庞大区域。这种方法被称为低秩三值适配(low-rank ternary adaptation),它让模型在保持完美压缩的同时学习新技能。

研究人员在几种不同类型的人工智能上测试了这种方法,包括具备推理能力的语言模型和识别图像的视觉模型。他们从已经压缩到三值极限的模型开始,然后应用了这种新的教导技术。结果显示,这些经过适配的模型恢复了在初始压缩过程中损失的大部分准确度。在涉及语言任务的测试中,适配后的模型表现明显优于以往那些试图通过“扩张后重压”方式强行教导模型的尝试。例如,在一个拥有30亿参数的语言模型上,新方法将九个不同任务的平均准确度从大约32%提升到了38%,同时也使模型的预测变得更加自信。

或许最重要的一点是,这一过程的最终产物是一个保持超紧凑形式的单一统一模型。不同于其他方法会留下一个必须与小模型一同加载的、沉重的独立指令集,这种新方法将学习过程直接合并到了微小的权重之中。研究人员发现,对于视觉任务(如识别图像中的物体),他们的方法所产生的模型比通过学习后再进行重压缩得到的模型要准确得多。他们还发现,学习过程是通过重新分配现有数字的正负号来实现的,而不是试图让那些归零的数字“复活”。这意味着模型是通过重新组织已有的内容来进行学习,而不是试图在原本不存在的地方创造新的连接。

这项工作证明,在不牺牲效率或准确性的情况下,教导高度压缩的人工智能模型是可能的。通过尊重三值系统的严格限制并在这些边界内寻找学习方法,研究人员表明,这些微型模型在许多任务上可以与大型模型一样出色。该方法在实际使用时不需要额外的内存或计算能力,因为学习过程已完全集成到模型的结构中。这为在资源非常有限的设备上运行复杂的人工智能打开了大门,将强大的功能带到了此前无法部署的地方。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →