← 最新论文
🤖 machine learning

Unveiling the Depth-Performance Dilemma in Split-Federated Fine-tuning of LLMs

本文识别了大语言模型拆分联邦微调(Split-Federated Fine-tuning)中一个关键的“深度-性能困境”,证明了虽然更深的模型分区能最大化系统效率和隐私性,但由于未受控的聚合噪声触发了服务端分区的注意力崩溃(Attention Collapse),这必然会导致灾难性的性能坍塌,且现有的联邦聚合方法无法解决这一问题。

原作者: Hariharan Ramesh, Someshwaran Murugaiyan, Jyotikrishna Dass

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Hariharan Ramesh, Someshwaran Murugaiyan, Jyotikrishna Dass

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大语言模型是现代聊天机器人和写作助手背后的强大计算机程序,能够理解并生成人类文本。为了让这些模型在特定任务中变得更聪明、更有用,必须对它们进行“微调”,这个过程涉及向它们展示海量的全新数据。然而,这种训练极其昂贵,且需要大多数人并不拥有的庞大计算机。此外,用于此类训练的数据通常包含隐私信息,例如个人消息或医疗记录,这些信息无法共享给中央服务器。为了解决这个问题,研究人员开发了一种称为“拆分联邦微调”(split federated fine-tuning)的方法。这种方法将巨大的模型分为两部分:一小部分留在用户的设备上处理任务的起始部分,而较大的剩余部分则在中央服务器上运行。这使得模型能够在从不向云端发送原始数据的情况下学习隐私数据,从而在对隐私的需求与对计算能力的需求之间取得平衡。

长期以来,工程师们一直认为,他们拆分模型的位置仅仅是一个用于调整速度的技术设置。普遍观点认为,将拆分点推向模型的更深处——即让用户的设备承担更多工作,并留给服务器更少的工作——只会提高系统的速度和隐私性,而不会对学习质量产生实质性的影响。一项新研究挑战了这一假设,揭示了这种设计中隐藏的陷阱。来自亚利桑那大学和韦洛尔理工学院的研究人员发现,虽然将拆分点向深处移动确实提高了系统的速度和隐私性,但同时也导致了模型的学习能力崩溃。他们发现,那些看起来对系统效率最优的配置,恰恰是破坏最终结果质量的配置。

研究人员在各种模型规模(从较小的版本到拥有数十亿参数的巨型模型)上测试了这一想法,并使用了诸如撰写故事和解决数学问题等各种现实世界的任务。他们有系统地将拆分点从模型的开头一直移动到接近末尾的位置。随着他们将拆分点推向深处,他们证实了系统变得显著更快,且发送给服务器的数据变得极难被逆向工程,从而提供了近乎完美的隐私保护。然而,他们也观察到了性能的持续且严重的下降。使用深度拆分的模型无法有效地学习任务,无论如何组合数据,其产生的结果都很差。这造成了一个困境:最大化系统效率的设置与破坏模型效用的设置是相同的。

为了理解为什么会发生这种情况,团队仔细观察了系统的不同部分是如何相互作用的。他们发现,问题源于模型处理错误和噪声的方式。在训练过程的初期,当拆分点较浅时,服务器还有许多层可以进行处理。这些额外的层起到了缓冲器的作用,吸收了在组合来自许多不同用户的数据时自然产生的微小误差和不一致性。然而,随着拆分点向深处移动,这个缓冲区消失了。在组合用户数据时产生的误差不再被吸收,而是直接穿过模型的剩余层进行传播。

研究指出,这种失败有一个特定的结构性原因。研究人员发现,这些模型的深层部分——本应是最强大的部分——在拆分过深时,实际上失去了处理复杂信息的能力。他们发现,这些层开始表现得像是输入的简单、扁平的副本,失去了修复错误所需的复杂内部结构。当来自用户的带有噪声且未经修正的数据撞击这些虚弱的层时,模型无法恢复。这就像是一个原本应该过滤净水的过滤器被移除了,脏水直接流向了最终输出。这种现象被作者称为“注意力崩溃”(attention collapse),意味着模型失去了区分有用模式与随机噪声的能力。

研究人员还测试了不同的用户更新组合方法,希望能找到一种能够解决问题的技术。他们尝试了几种旨在处理用户间数据差异的高级数学策略。虽然有些方法比其他方法稍好一些,但没有一种能完全防止崩溃。即使是最好的方法,在拆分过深时也会出现性能大幅下降的情况。这表明问题不仅仅在于如何组合数据,而是这些模型构建方式的一个基本属性。模型的结构在每一层都保持相同的大小和形状,这使得误差在其中传递时保持不变,不像其他类型的计算机视觉模型,它们在数据移动过程中会自然地缩小并过滤掉噪声。

这项研究结果迫使人们重新思考如何设计这些分布式系统。它表明,拆分的深度并不是一个可以自由旋转以优化速度或隐私性的中性旋钮。相反,它是一个关键的杠杆,会与模型的内部架构发生相互作用。如果拆分过深,系统会变得高效但毫无用处。研究人员得出结论,为了构建稳定的分布式大语言模型系统,工程师必须考虑到这种结构性弱点。他们建议,未来的设计可能需要改变服务器处理数据的方式,或者开发新的用户更新组合方式,以专门应对深层中缺乏误差纠正的问题。在此之前,拆分系统最有效的设置很可能是那种牺牲了学习质量的设置,这让业界面临着在速度、隐私和智能之间进行艰难权衡的局面。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →