想象你拥有一座庞大且细节惊人的图书馆(即大型语言模型),它已经具备了写作、推理和理解世界的能力。你希望教会它一项特定的新技能,比如解决数学问题或理解某种特定方言。
过去的方法是全量微调:你雇佣了一支编辑团队去重写图书馆里的每一本书。这种方法效果很好,但成本高昂、速度缓慢,并且需要巨大的存储空间来追踪所有变更。
随后出现了LoRA(低秩自适应),这是目前流行的方法。LoRA 不再重写每一本书,而是说:“我们只需在便签上写几条摘要笔记,然后贴在书架上。”这种方法便宜得多。然而,论文指出 LoRA 存在一个隐蔽的缺陷:它书写这些笔记的方式是“弯曲”的。这就像试图用直尺和量角器画一个完美的圆;几何形状会发生扭曲。如果你在“写笔记”的垫子上稍微移动一下手,对书籍的实际改变在一个方向上可能巨大,而在另一个方向上却微乎其微。这使得学习过程变得混乱且低效。
另一种方法Uni-LoRA试图通过让笔记变得更小(仅使用一个长长的数字列表)来解决这个问题。但它仍然必须先将这些笔记贴在"LoRA 便签垫”上,这意味着“弯曲几何”的问题依然存在,只是被隐藏到了更深的一层。
引入 GPart:“全局划分”
作者提出了GPart(全局划分微调)。这里有一个简单的类比:
想象图书馆里有数百万本书。与其在便签上写笔记或使用复杂的系统,GPart 给你一个单个、微小的遥控器,上面只有几个按钮(假设有 d 个按钮)。
- 魔法遥控器:你拥有一个秘密代码(随机种子),它告诉图书馆哪些书对应遥控器上的哪个按钮。
- 按钮 1 控制 10,000 本书。
- 按钮 2 控制 12,000 本书。
- 以此类推。
- 更新:当你想要教会图书馆一项新技能时,只需转动你微小遥控器上的旋钮。如果你将按钮 1 稍微调高一点,分配给按钮 1 的每一本书都会按照完全相同的微小幅度进行更新(根据该组中书籍的数量进行轻微调整)。
- 结果:你不需要存储数百万次变更。你只需要保存遥控器上少数按钮的位置以及秘密代码。
为什么这很特别?(“等距”秘密)
论文的主要技术主张关乎距离。
- LoRA 的问题:想象你在一张拉伸不均匀的蹦床上行走。如果你向前迈一步,你可能会在空中飞出 10 英尺。如果你向侧面迈一步,你可能只移动了一英寸。你行走的“距离”与你实际移动的“距离”并不匹配。这会混淆优化器(即学习任务的“大脑”)。
- GPart 的解决方案:GPart 就像在完全平坦、坚硬的地板上行走。如果你在遥控器上迈出一“步”,图书馆在现实世界中的变化量 exactly 就是那个相同的“距离”。论文称之为端到端等距。这意味着学习过程是平滑、可预测的,不会被数学扭曲。
他们发现了什么?
作者在三种不同类型的任务上测试了这种“微小遥控器”方法:
- 语言理解:(如阅读理解测试)。
- 数学推理:(如解答应用题)。
- 计算机视觉:(如在照片中识别猫与狗)。
结果:
- 性能:尽管使用的内存同样微小,GPart 的表现与当前最佳方法(如 LoRA 和 Uni-LoRA)一样好,有时甚至更好。
- 简洁性:它只有一个可以调节的“旋钮”(遥控器上的按钮数量),使其非常易于使用。
- 效率:它消除了“低秩瓶颈”(即迫使更新成为简单摘要的限制)。GPart 允许更新是直接且完整的,只需由一个微小的遥控器引导。
结论
论文认为,我们不需要复杂的、弯曲的数学来教会大模型新把戏。通过使用一种简单的随机映射(即遥控器),它能保持学习过程的“形状”,我们可以用更简洁、更优雅的系统获得相同(甚至更好)的结果。这就像意识到你不需要一张复杂的地图来找到方向;你只需要一条直线。
技术摘要:GPart(全局分区微调)
1. 问题陈述
参数高效微调(PEFT)对于适配大语言模型(LLMs)及其他基础模型至关重要,因为全量微调在计算上已变得不可行。尽管低秩自适应(LoRA)已成为主导的 PEFT 范式,但它引入了一个关键的几何局限性:从可训练参数到权重更新的映射是双线性的(ΔW=BA),而非线性的。
这种双线性结构意味着该映射不是等距映射;可训练参数空间中的欧几里得距离无法在模型的权重空间中得以保持。因此,优化器在可训练坐标中看到的优化景观与诱导的权重更新的几何结构并不一致。最近的方法如 Uni-LoRA 试图通过将低维向量经由等距映射投影到 LoRA 的参数空间来提高效率。然而,由于最后一步仍依赖于双线性 LoRA 映射(ΔW=BA),端到端的等距性被破坏,几何失真问题仍未解决。
2. 方法论:GPart
作者提出了GPart(全局分区微调),该方法完全消除了中间的低秩瓶颈。GPart 不是将向量投影到 LoRA 因子空间,而是将低维可训练向量直接映射到模型的完整权重空间。
核心机制
给定一个预训练模型,其 N 个适配参数被展平为向量 w0∈RN,GPart 引入一个可训练向量 θd∈Rd(其中 d≪N)。权重更新定义为:
Δw=Pθd
其中 P∈RN×d 是一个随机分区矩阵。
分区矩阵的构建
矩阵 P 通过依赖于种子的伪随机过程构建:
- 全局分配:一个随机分配函数 g:{1,…,N}→{1,…,d} 将 N 个模型参数中的每一个分配到 d 个互不相交的组之一。
- 归一化:对于每个组 j,设 nj 为分配给该组的参数数量。条目 Pij 定义为:
Pij={nj10如果 g(i)=j其他情况
- 等距性质:通过构建,P⊤P=Id。这确保了 P 是从 Rd 到 RN 的等距嵌入。
优化与存储
- 前向传播:特定参数 i 的更新为 Δwi=θg(i)/ng(i)。这允许同一个可训练值被广播到不同层中的多个参数。
- 反向传播:关于 θd 的梯度通过在每个组内累积归一化的梯度之和来计算:(∇θdL)j=∑i:g(i)=j(∇wL)i/nj。
- 初始化:θd 初始化为零,确保模型从预训练权重(Δw=0)开始,而无需破坏对称性的随机初始化。
- 存储:整个微调后的模型可以从 d+1 个值中恢复:可训练向量 θd 和用于重新生成 P 的随机种子 s。
3. 主要贡献
- 端到端等距性:GPart 提供了一个从可训练子空间到完整权重空间的单一线性映射,该映射保持欧几里得几何结构。与 LoRA 和 Uni-LoRA 不同,θ 空间中的优化景观与诱导的权重更新空间是等距的。
- 消除低秩瓶颈:该方法移除了低秩分解(ΔW=BA)的结构约束,通过随机低维子空间直接在环境权重空间中操作。
- 简化的超参数化:GPart 仅依赖一个超参数 d(子空间维度)来控制参数效率与表达能力之间的权衡。这与 LoRA(需要秩 r)和 Uni-LoRA(需要 r 和 d)形成对比。
- 理论与实证验证:本文证明了等距性质,并展示了 GPart 在多样化任务中优于或匹配现有的 PEFT 方法。
4. 实验结果
作者在自然语言理解(NLU)、数学推理和计算机视觉基准测试上评估了 GPart,将其与全量微调(FF)、线性探针(LP)、LoRA、BitFit、VeRA、FourierFT 和 Uni-LoRA 进行了比较。
- 自然语言理解(GLUE):使用 RoBERTa-base 和 RoBERTa-large,GPart 在 RoBERTa-base(23K 参数)上实现了 PEFT 方法中的最佳平均性能,优于 Uni-LoRA、LoRA 和 VeRA。在 RoBERTa-large 上,其平均表现优于 Uni-LoRA。
- 数学推理:在 GSM8K 和 MATH 数据集上,使用各种仅解码器模型(Qwen、Gemma、Llama)进行评估。在匹配参数预算下,GPart 与 Uni-LoRA 保持竞争力,并在 GSM8K 和 MATH 上显示出轻微的平均提升。
- 计算机视觉:在八个数据集(如 OxfordPets、CIFAR-100)上使用 ViT-Base 和 ViT-Large,GPart 在 PEFT 方法中实现了最强的平均性能,接近全量微调的结果,并优于 Uni-LoRA。
- 损失景观分析:SST-2 上的损失景观可视化显示,GPart 产生了一个平滑、居中良好的盆地,与其等距参数化一致。相比之下,Uni-LoRA 表现出尖锐的高损失区域,这归因于双线性重建步骤。
- 等距性消融实验:比较等距 GPart(带有 1/nj 归一化)与非等距变体的实验表明,归一化至关重要。非等距变体遭受严重的欠正则化和性能下降,证实了等距性质不仅仅是几何上的便利,而是优化稳定性的关键。
5. 意义与主张
本文声称,GPart 通过消除扭曲优化景观的结构约束,为 PEFT 提供了一条直接而优雅的路径。
- 理论意义:结果支持了这样一个前提:有效的微调可以从完整权重空间的随机低维子空间中产生,而无需施加低秩矩阵结构。GPart 将 PEFT 与内在维度结果(Aghajanyan 等人,2021)重新连接,同时保留了 VeRA 和 Uni-LoRA 等方法的存储效率。
- 实际影响:通过仅用一个超参数和最小的存储开销(d+1 个值)实现最先进的效率和性能,GPart 挑战了现代 PEFT 中低秩瓶颈的必要性。
- 局限性:作者指出,尽管结果在编码器、解码器和视觉领域均表现 promising,但将其推广到更大的语言模型、多模态模型以及特定的指令遵循或长上下文设置仍需进一步研究。该工作被呈现为方法论贡献,而非新的特定应用能力。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。