为了让这场舞蹈课更高效,科学家们使用了一个聪明的技巧,叫做“LoRA”(低秩自适应)。他们不是重新训练整个庞大的大脑,而是给模型安装了两个小巧且灵活的“辅助轮”(我们称之为因子 A 和因子 B)。因子 A 就像是一个翻译官,将输入(舞蹈音乐)转化为一种秘密代码;而因子 B 则是一个舞者,将这种代码转化为实际的动作。研究人员提出的核心问题是:在集体舞蹈中,大家应该共享同一个翻译官(因子 A)并保留各自的舞者(因子 B),还是应该共享相同的舞者并保留各自的翻译官?长期以来,人们只是选择其中一种方式并坚持下去,认为这总是最好的。但这篇文章指出,这种做法有点像仅仅因为大家都是人类,就假设每个人都应该穿同样尺寸的鞋子。
作者徐欣一(Xiny way Xu)及其团队发现,对于如何共享这些“辅助轮”,并没有一种单一的“最佳”方式。事实证明,你应该共享翻译官还是共享舞者,完全取决于这群人正在处理的具体数据以及舞蹈步骤的复杂程度(即适配的“秩”)。他们发现,如果你强迫每个人在需要共享舞者时去共享翻译官(或反之亦然),整个团队最终会演变成一段笨拙且不协调的舞步。为了解决这个问题,他们发明了一种名为 FedAS-LoRA 的新方法。在训练开始之前,这种方法会使用一个特殊的“侦察兵”(他们称为 RSS 的指标)来窥探数据,并做出决定:“好吧,对于这个特定的群体和这项特定的任务,我们应该共享因子 A,”或者“不,对于这一次,我们应该共享因子 B。”
把它想象成一位聪明的舞蹈教练,在音乐响起之前,先观察舞者和歌曲,从而决定谁应该共享鞋子,谁应该共享编舞笔记。如果歌曲对每位舞者的风格来说都非常特殊,教练可能会说:“保留你们各自的笔记,但让我们都使用相同的节奏指南。”如果歌曲很通用,但舞者的动作各不相同,教练可能会说:“让我们都使用相同的编舞,但保留各自的节奏指南。”通过进行这种动态选择,他们的方法始终优于那些僵化的旧方法。在各种语言任务的测试中,他们的自适应方法达到了 90.77% 的平均准确率,比之前的最佳方法高出了近 1 个百分点。他们还从数学上证明了这种灵活的方法是稳定的,即使有些舞者缺席了练习或中途加入,也不会导致团队崩溃。这篇论文表明,“一刀切”的共享模型部件规则已经失效,而高效 AI 学习的未来在于能够根据具体任务灵活选择策略。
技术摘要:重新思考联邦 LoRA 中的因子共享
问题陈述 在联邦学习(FL)中,通过低秩自适应(LoRA)对大语言模型(LLMs)进行微调面临着一个被称为“聚合失配”(aggregation mismatch)的关键挑战。标准的 LoRA 将模型更新表示为两个低秩因子的乘积,即 ΔWi=BiAi。在具有 N 个客户端的联邦设置中,简单地独立平均因子(N1∑Bi⋅N1∑Ai)并不等于更新的平均值(N1∑BiAi)。
现有的缓解方法通常采用“硬编码”的因子共享策略,例如在所有客户端之间固定一个公共因子 A 而保持 B 为本地(Share-A/Local-B),或者反之亦然(Share-B/Local-A)。然而,本文证明了这两种策略并非在所有情况下都是最优的。选择共享哪一个因子取决于特定的数据分布、LoRA 秩以及系统设置。固定的分配方式可能会导致次优性能,因为它未能考虑到不同客户端在输入侧和输出侧表示空间上所需的结构性不对称。