← 最新论文
🤖 machine learning

How Much Regularization Survives Averaging? Update Masking in Federated Learning

本文表明,虽然通过掩码实现的噪声诱导正则化在集中式训练中能有效促进平坦极小值的形成,但由于平均过程的存在,其益处在联邦学习中被严重削弱,从而使得该方法在非独立同分布(non-IID)数据场景下变得不切实际。

原作者: Wenhao Yan, Fu Kuroda, Yucheng Jin, Zhenke Chen

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Wenhao Yan, Fu Kuroda, Yucheng Jin, Zhenke Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能领域,存在着一个被称为“联邦”问题的持久挑战。想象一下,一群人每人都持有一块独特的拼图碎片,他们想要共同构建出一幅完整的图像,但绝不向任何人展示自己的碎片。这正是现代机器学习的工作方式:一台中央计算机协调许多不同的设备(如手机或传感器)来学习一项共享技能。问题在于,每个设备上的数据很少是相同的;一部手机可能大多是猫的照片,而另一部手机可能只有汽车的照片。当中央计算机试图整合每个人所学到的知识时,生成的模型往往难以理解整体情况,无法很好地泛化到新场景中。为了解决这个问题,研究人员长期以来一直试图寻找一种在学习的数学景观中找到“平坦”解的方法。把这想象成一个陡峭的山峰与一个宽阔平坦的高原。落在陡峭山峰上的模型可能在处理其看到的特定数据时表现完美,但只要数据发生轻微变化,它就会立刻踉跄。而落在宽阔平平坦高原上的模型则更具鲁棒性;它可以处理数据的微小变化而不至于崩溃。

多年来,科学家们一直试图通过在学习过程中添加噪声或制造一些刻意的微小错误,来迫使这些模型找到那些平坦的高原。这种噪声就像是一个温柔的摇晃器,防止模型陷入狭窄、脆弱的境地。最近,一种被称为“更新掩码”(update masking)的特定技术在集中式训练(即由单台计算机完成所有工作)中变得流行。这种方法会随机丢弃学习指令中的某些部分并对剩余部分进行缩放,有效地添加了一种有益的噪声,将模型推向那些稳定的平坦区域。然而,当研究人员试图将这种技术引入联邦设置(即许多不同设备分别学习然后合并其结果)时,它似乎消失了。来自早稻田大学和神电能源有限公司的研究团队旨在回答的简单问题是:那份有益的噪声去哪儿了,能否将其找回?

研究人员发现,噪声并没有消失,它只是在合并结果的过程中被稀释了。在他们的实验设置中,他们拥有一百个不同的设备,即“客户端”,每个客户端都在自己的数据切片上进行学习。在标准方法中,每个设备都会随机决定保留哪些学习指令以及丢弃哪些,并使用自己独特的选择模式。当中央服务器收集这些更新并进行平均时,各个设备的随机选择相互抵消了。这就像十个人试图朝略微不同的随机方向推动一个沉重的物体;最终的结果是,这个物体几乎纹丝不动。通常强制模型保持鲁棒性的数学惩罚项,被设备数量这一因子削弱了。如果有十个设备,有益的效果就会被削减到原来的十分之一,导致模型几乎没有任何防止过拟合的保护。

该团队随后测试了另一种策略:如果每个设备都使用完全相同的选择模式会怎样?如果十个人都朝着同一个随机方向推动物体,效果就会得以保留。研究人员发现,同步这些选择确实恢复了那种保护性噪声,但有一个重大的限制。恢复噪声的强度完全取决于设备之间的共识程度。如果设备学习的数据非常不同,且它们的更新指向冲突的方向,那么同步后的噪声就会变得无效甚至有害。衡量这种共识的指标被称为“梯度多样性”(gradient diversity),这个概念本质上是在计算各个设备的个体努力在多大程度上是重叠的。当设备之间和谐一致时,噪声会全力回归。当它们发生冲突时,噪声就会减弱或完全消失。

为了了解这在实践中为何发生,研究人员使用了一个标准的图像数据集 CIFAR-10 进行了广泛实验,该数据集被划分到了一百个模拟客户端中。他们精确测量了在不同条件下,保护性噪声在平均过程中存活下来的程度。他们发现,在最常见的设置中(即设备以小批量数据进行学习),存活率低得令人震惊。在最高可能的强度为 10 的情况下,最终到达模型的噪声仅约为 1.19。这一极小的比例意味着,该模型的鲁棒性几乎与没有添加任何噪声时没有区别。研究人员将这种失败归因于标准学习中发生的随机采样过程。由于每次只选取一小部分图像进行学习,这种小批量采样引入的随机噪声淹没了更新掩码技术所产生的特定且有益的噪声。

团队还调查了数据本身的差异——即有些设备拥有更多猫,而有些设备拥有更多车——是否是罪魁祸首。他们改变了数据分布,使其变得极其不均匀,例如有些设备拥有的数据量比其他设备多一百倍。令人惊讶的是,这种极端的差异对噪声存活率几乎没有影响。无论数据是近乎相同还是迥然不同,存活率始终维持在 1.17 到 1.50 之间。真正的障碍不是数据的多样性,而是学习的方法。当研究人员关闭小批量采样,让每个设备一次性从其整个集合中学习时,存活率大幅跃升至 8.96。这证明了小批量采样的随机噪声是该技术在联邦设置中失效的主要原因。

然而,这项研究以一个冷峻的现实检查结束。虽然在数学上可以通过使用大规模的全数据批次和同步选择来恢复全部强度的保护性噪声,但这样做会对模型的实际性能造成巨大的代价。那些允许噪声存活的配置,恰恰是产生最差学习结果的配置,其测试准确率显著下降。在实验中,表现最好的模型(使用小批量)几乎没有留下任何保护性噪声,而拥有最多噪声的模型则因准确度太低而无法使用。研究人员没有找到既能保留噪声又不牺牲模型学习能力的中间地带。

最终,这篇论文揭示了更新掩码在联邦学习中失效的原因并非疏忽或漏洞,而是系统运作方式的一个基本后果。这种允许许多设备共同学习的机制——即对更新进行平均——同时也冲刷掉了更新掩码所依赖的特定类型的噪声。研究人员表明,虽然可以通过同步设备来迫使噪声存活,但实现这一目标的条件与训练一个有用模型所需的实际需求是不相容的。在单台计算机上表现良好的保护效应,在网络化的多设备环境中无法直接转化,除非人们愿意接受一个学习能力极差的模型。这项研究为该领域提供了一个清晰的理解,即该技术的局限性,并暗示未来的解决方案必须在其他地方寻找帮助联邦模型找到那些稳定、平坦高原的方法。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →