← 最新论文
💻 computer science

FedLNS: Leverage LayerNorm Signature Modeling to Mitigate Adversarial Manipulation in Federated LLMs

FedLNS 是一个服务端框架,通过对归一化层参数变化的轻量级分析来筛选恶意客户端更新,从而缓解联邦大语言模型训练中的对抗性操纵,在无需额外数据交换或标记攻击样本的情况下,在多种模型架构中实现了卓越的鲁棒性。

原作者: Kai Li, Jong-Ik Park, Carlee Joe-Wong, Wei Ni, Falko Dressler

发布于 2026-08-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Kai Li, Jong-Ik Park, Carlee Joe-Wong, Wei Ni, Falko Dressler

原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大语言模型是驱动我们日常使用的智能助手、搜索工具和写作辅助工具的核心引擎。这些系统通过阅读海量文本进行学习,但其中许多最有价值的信息被锁在私密场所:个人信息、医疗记录或公司的专有文档。为了在不直接接触这些私有数据的情况下利用这些数据来训练模型,研究人员使用了一种称为“联邦学习”的方法。在这种设置中,模型是向数据移动,而不是数据向模型移动。中央计算机将当前模型的副本发送到许多不同的设备上,每个设备都在自己的私有信息上进行训练,然后仅传回它所学到的变化。随后,中央计算机将这些变化进行合并,从而创建一个更聪明、更更新的模型。这个过程保护了隐私,但也创造了一个新的漏洞:中央计算机无法看到本地设备上发生了什么。一个不诚实的设备可能会伪装成正在从私有数据中学习,实际上却是在接收错误的指令,从而误导中央计算机去采纳有害的教训,破坏模型正确说话或写作的能力。

一组研究人员开发了一种新方法,可以在这些不诚实的更新破坏全局模型之前识别出它们。他们将该系统称为 FEDLNS,这种方法就像是流向中央服务器的信息流中的一个安全检查站。研究人员并没有试图检查模型更新中每一个细微的部分——因为这些更新可能包含数十亿个数字,过于复杂而无法彻底检查——而是将注意力集中在模型中一小组特定的数字上。这些数字控制着模型如何缩放和偏移其对语言的内部理解,充当了模型如何被调整的一种“签名”。通过观察这些特定数字的变化,服务器可以建立起关于正常、诚实学习模式的画像。当一个设备发送回更新时,服务器会将该设备的签名与来自其他设备的历史签名进行对比。如果一个设备的变更看起来与大众过于不同,系统就会将其标记为可疑并将其隔离,防止该错误更新被混合进最终的模型中。

研究人员在三种不同类型的语言模型上测试了这种方法,范围涵盖了从预测句子下一个词的模型,到填充缺失词的模型,最后到类似于驱动现代聊天机器人的大型模型。他们模拟了一种场景,即参与设备中有多达 40% 是恶意设备,它们蓄意通过教授错误的词语关联来破坏模型。在这些困难的条件下,这个新系统成功地过滤掉了有害的更新。经过这种保护训练的模型表现明显优于使用现有安全方法的模型。具体而言,受保护的模型在预测下一个词时犯错更少,与次优方法相比,其困惑度降低了高达 18%。它们也表现出更低的不确定性,这意味着它们产生混乱或无意义句子的可能性更小。

这项发现之所以特别有用,是因为它不需要中央服务器拥有一份已知坏人的名单,也不需要一个单独的、预训练的检测器来抓捕骗子。该系统仅仅通过观察设备群随时间的变化,就能学习什么是“正常”。它会等待观察到足够多的不同设备以建立可靠的诚实行为图景后,才开始进行筛选。研究人员发现,系统在开始筛选前观察的设备越多,其表现就越好,尽管它在只有部分群体视图的情况下仍能有效工作。至关重要的是,这种保护完全发生在服务器端;发送更新的设备不需要更改其软件或发送任何额外信息,这使得该方法能够轻松添加到现有系统中,且不会降低运行速度。

这项研究证实,在不牺牲隐私或不需要信任数据的情况下,实现联邦学习的安全化是可能的。通过专注于紧凑的、感知架构的签名而非整个模型,研究人员创建了一个轻量级的护盾,在恶意操纵扩散之前将其拦截。在他们的模拟实验中,这种方法在不同的数据分布和模型类型下,始终优于另外六种常见的安全技术。结果表明,通过监测模型的细微内部变化,即使在很大一部分参与者试图欺骗系统的情况下,我们也能保持协作学习的完整性。这为构建更可靠的人工智能提供了一条切实可行的路径,使人工智能能够在学习私有数据的同时,不易被坏人所误导。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →