Rank-Gated and Sparse Low-Rank Adaptation for Efficient Fine-Tuning of Vision--Language Models
本文介绍了 Rank-Gated LoRA (RG-LoRA),这是一种通过为 LoRA 秩分量分配可学习的重要性权重,以实现用于内存效率的训练后剪枝的方法,但针对 Qwen3-VL-8B 的初步实验表明,在缺乏显式稀疏正则化的情况下,门控机制无法学习到有意义的稀疏性,尽管验证了所提出的“训练-剪枝-评估”机制,却导致延迟或显存收益微乎其微。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
现代人工智能系统能够识别图像并阅读文本,正变得异常强大,但同时也变得规模庞大。这些视觉语言模型拥有数十亿个参数,即允许机器学习的内部设置。为了教导这些巨头完成一项新任务,例如阅读医疗图表或理解复杂的图表,研究人员传统上必须调整每一个设置。这个过程就像是通过更换每一块砖来改造一座摩天大楼;它需要极高的计算机内存和时间,往往使得大多数研究人员无法负担。为了解决这个问题,科学家们开发了一种被称为“低秩自适应”(Low-Rank Adaptation,简称 LoRA)的捷径。这种方法不再触动整个建筑,而是为模型添加一个轻量级的附件,在保持原始庞大结构不动的情况下学习新任务。它是使这些大型模型在不耗费巨额计算成本的情况下发挥作用的标准工具。
然而,即使是这些轻量级的附件也存在隐藏的低效问题。当研究人员创建它们时,必须在开始训练前预估附件需要多少“容量”。他们选择一个固定的尺寸,而模型会使用该尺寸内的所有部分,即使其中只有一小部分对这项工作是真正必要的。这就像是建造了一个带有二十个隔层的行李箱,但你其实只需要五个隔层,却仍需背负全部二十个隔层的重量。来自德克萨斯大学奥斯汀分校的秦武(Qinwu Xu)的新研究提出了一个简单的问题:如果模型可以自行决定附件中的哪些部分是有用的,哪些是无用的,然后物理性地移除那些无用的部分,情况会怎样?
研究人员引入了一种称为“秩门控 LoRA”(Rank-Gated LoTA)的方法。想象一下,这个小附件就像一叠透明的薄片,每一张薄片代表了模型从数据中学习的一种不同方式。在标准方法中,模型被迫使用堆叠中的所有薄片,无论它们是否有用。在这种新方法中,研究人员在每张薄片上都添加了一个微小的、可学习的开关。在训练过程中,模型学习将有助于学习的薄片的开关调至“开启”,并将无助于学习的薄片的开关调至“关闭”。一旦训练完成,研究人员就可以物理性地剪掉那些被关闭的薄片。其结果是一个更小、更高效的附件,它能完成同样的工作,但占用的空间更少,运行所需的能量也更低。
为了测试这个想法是否可行,团队将其应用于一个名为 Qwen3-VL-8B-Instruct 的大型视觉语言模型。他们在包含图表、图像中的文本和文档问题的三个不同数据集的混合体上训练了该模型。他们将这种新方法与标准的、固定尺寸的版本进行了对比。结果显示,新方法可以像标准版本一样出色地学习,在测试问题上的准确率约为 81.56%,非常接近标准方法实现的 81.95%。这证明了即使在携带了缩减空间的潜力时,模型仍然可以有效地学习。
实验中最有趣的部分发生在训练完成后。研究人员取出训练好的模型,并开始逐一移除那些最不重要的薄片,以观察在模型失效之前,他们可以将附件缩小到多小。他们发现模型具有惊人的鲁棒性。即使在移除了八张原始薄片中的三张,仅留下五张后,模型的性能在特定的验证集上甚至略有提升,达到了 81.26%。这表明原始的、较大的附件确实携带了一些对模型思考没有帮助的额外重量。通过剪掉这些部分,模型在材料更少的情况下,表现得同样好,甚至更好。
尽管取得了成功,研究人员也谨慎地指出,他们的实验并未证明什么。虽然模型可以容忍部分被移除,但开关本身并没有在训练过程中自动学会关闭。它们保持在与起始位置几乎完全相同的位置,这意味着模型并没有自然地发现哪些部分是无用的。研究人员必须在事后手动决定剪掉哪些部分。此外,由于附件本身已经相当小,因此将其削减并不会显著提高模型的运行速度,也不会大幅减少其实时使用的计算机内存。繁重的工作仍然是由主模型中庞大且冻结的骨干网络完成的,因此从小型附件中节省下来的收益在整体速度中微乎其微,难以衡量。
研究结论认为:该机制是有效的——即可以训练一个带有额外容量的模型,然后在不损害其理解图像和文本能力的情况下,进行手术式地移除未使用的部分。然而,要使其成为真正的效率突破,未来的工作需要教会模型在训练期间自行关闭开关,并在更大的附件上测试该方法,因为在更大的附件上,节省下来的收益才会更加显著。目前,这项研究作为一个概念验证,展示了这些数字工具可以在构建完成后进行修剪,为未来更高效、更具适应性的人工智能铺平了道路。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。