← 最新论文
🤖 machine learning

Rethinking Factor Sharing in Federated LoRA: A Rank-Aware Adaptive Approach

本文提出了 FedAS-LoRA,这是一个联邦学习框架,它基于一种新颖的秩感知共享子空间充分性(RSS)指标,自适应地选择在客户端之间共享输入侧或输出侧的 LoRA 因子,从而最小化投影残差并增强微调性能。

原作者: Xinyi Xu, Bingnan Xiao, Shuang Qin, Gang Feng, Tony Q. S. Quek

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Xinyi Xu, Bingnan Xiao, Shuang Qin, Gang Feng, Tony Q. S. Quek

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个这样的世界:巨大的、超级聪明的计算机(被称为大语言模型)成为了我们这个时代的超级天才,它们能够创作故事、解决数学问题,并像人类一样聊天。但问题在于,这些天才规模如此庞大,以至于无法装进一部手机或一台笔记本电脑中,而且我们不能直接把每个人的私人日记数据全部复制粘贴到一个中央大脑里来教它们新技能。这就是“联邦学习”(Federated Learning)发挥作用的地方。它就像一群朋友试图一起学习一段新舞蹈,却又从未离开过各自的客厅。他们各自根据自己的数据进行练习,只将他们的舞步(而不是音乐或房间本身)发送给一位中央教练,由教练将这些舞步混合在一起,从而创造出一段更好的集体舞步。

为了让这场舞蹈课更高效,科学家们使用了一个聪明的技巧,叫做“LoRA”(低秩自适应)。他们不是重新训练整个庞大的大脑,而是给模型安装了两个小巧且灵活的“辅助轮”(我们称之为因子 A 和因子 B)。因子 A 就像是一个翻译官,将输入(舞蹈音乐)转化为一种秘密代码;而因子 B 则是一个舞者,将这种代码转化为实际的动作。研究人员提出的核心问题是:在集体舞蹈中,大家应该共享同一个翻译官(因子 A)并保留各自的舞者(因子 B),还是应该共享相同的舞者并保留各自的翻译官?长期以来,人们只是选择其中一种方式并坚持下去,认为这总是最好的。但这篇文章指出,这种做法有点像仅仅因为大家都是人类,就假设每个人都应该穿同样尺寸的鞋子。

作者徐欣一(Xiny way Xu)及其团队发现,对于如何共享这些“辅助轮”,并没有一种单一的“最佳”方式。事实证明,你应该共享翻译官还是共享舞者,完全取决于这群人正在处理的具体数据以及舞蹈步骤的复杂程度(即适配的“秩”)。他们发现,如果你强迫每个人在需要共享舞者时去共享翻译官(或反之亦然),整个团队最终会演变成一段笨拙且不协调的舞步。为了解决这个问题,他们发明了一种名为 FedAS-LoRA 的新方法。在训练开始之前,这种方法会使用一个特殊的“侦察兵”(他们称为 RSS 的指标)来窥探数据,并做出决定:“好吧,对于这个特定的群体和这项特定的任务,我们应该共享因子 A,”或者“不,对于这一次,我们应该共享因子 B。”

把它想象成一位聪明的舞蹈教练,在音乐响起之前,先观察舞者和歌曲,从而决定谁应该共享鞋子,谁应该共享编舞笔记。如果歌曲对每位舞者的风格来说都非常特殊,教练可能会说:“保留你们各自的笔记,但让我们都使用相同的节奏指南。”如果歌曲很通用,但舞者的动作各不相同,教练可能会说:“让我们都使用相同的编舞,但保留各自的节奏指南。”通过进行这种动态选择,他们的方法始终优于那些僵化的旧方法。在各种语言任务的测试中,他们的自适应方法达到了 90.77% 的平均准确率,比之前的最佳方法高出了近 1 个百分点。他们还从数学上证明了这种灵活的方法是稳定的,即使有些舞者缺席了练习或中途加入,也不会导致团队崩溃。这篇论文表明,“一刀切”的共享模型部件规则已经失效,而高效 AI 学习的未来在于能够根据具体任务灵活选择策略。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →