← 最新论文
🤖 machine learning

Gradient-Free Privacy Leakage in Federated Language Models through Selective Weight Tampering

本文揭示了联邦语言模型容易受到无梯度隐私泄露的攻击,证明了中间模型快照和恶意参与者的选择性权重篡改可以在无需服务器配合的情况下,显著增强成员推理攻击和私有数据重构的能力。

原作者: Md Rafi Ur Rashid, Vishnu Asutosh Dasu, Kang Gu, Najrin Sultana, Shagufta Mehnaz

发布于 2026-07-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Md Rafi Ur Rashid, Vishnu Asutosh Dasu, Kang Gu, Najrin Sultana, Shagufta Mehnaz

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个这样的世界:你的智能手机学会了预测你的下一个词,你的电子邮件可以自动补全句子,或者医疗应用可以帮助诊断疾病,而这一切都不需要将你的私密信息发送到巨大的中央服务器。这就是**联邦学习(Federated Learning)**的承诺。与其让一家大公司把你的数据囤积在保险库里,不如让你的设备在本地训练一个共享的“大脑”(语言模型)。它只向中央枢纽发送微小的更新——比如它学到了什么的摘要——中央枢纽将这些更新混合在一起,以改进全局大脑。这就像一群学生正在为考试做准备:他们各自阅读自己的书,写下自己的笔记,然后只分享笔记本身,而不是书本本身,这样每个人都能变得更聪明,而不会有人看到别人的私人图书馆。

然而,这里有一个陷阱。尽管原始数据留在你的手机上,但这些“笔记”(模型更新)有时会无意中泄露书中的内容。如果笔记过于详细,一个狡猾的学生就能通过阅读这些笔记来猜出你的秘密学习主题。这就是**隐私泄露(privacy leakage)*的问题。长期以来,研究人员认为,如果你不分享学习背后的原始数学过程(梯度),而只分享一轮学习的最终结果(权重),你就是安全的。但如果来自学习过程中间阶段的“笔记”实际上比最终的考试答案更具揭露性呢?如果一个狡猾的学生可以通过调整自己的笔记,让全班同学都能更清晰地记住你的*秘密呢?这正是这篇论文所调查的谜团。


狡猾的学生与神奇的笔记

在这项研究中,来自宾夕法尼亚州立大学和达特茅斯学院的研究小组决定在联邦学习的课堂中扮演“狡猾的学生”这一角色。他们的目标是什么?是看他们是否可以在没有老师(服务器)帮助或查看原始数学过程的情况下,从其他学生的设备中窃取私密信息——比如电话号码、信用卡详情或秘密密码。

大惊喜:中间阶段才是关键

研究人员发现的第一件事有点违反直觉。通常,我们会认为模型的最终版本是最强大的。但在这种联邦学习游戏中,中间快照(intermediate snapshots)——即在训练过程中间阶段记录的“笔记”——实际上要危险得多。

想象一下,老师要求全班背诵一份包含 1,000 个单词的列表。到学期结束时,全班已经掌握了语言的一般模式,而那些特定的、奇怪的单词(比如一个虚假的信用卡号)在记忆中可能会变得模糊。但如果你在他们专门学习这些奇怪单词的那一周检查全班的记忆,这种记忆是非常清晰的。研究人员发现,一个恶意的学生可以通过观察这些“期中”快照,比观察最终模型更容易找到私密数据。这就像是在寻找昨天刚写的日记中的特定页面,而不是试图从一年后的一份总结中去猜测整个故事。

“选择性篡改”技巧

但研究人员并没有止步于仅仅观察。他们问道:“我们能否让模型把这些秘密记得更清楚?”

他们意识到,大型语言模型(正在被训练的“大脑”)并不都是一样的。大脑的某些部分像是通用知识中心,而另一些部分则像是专门的档案柜。研究人员发现,模型“档案柜”的最后几层(特别是 MLP 子层)是保留那些奇特、异常数据的关键。

因此,他们发明了两种巧妙的方法来“调整”这些特定的档案柜,使模型对私密数据产生痴迷:

  1. 选择性权重优化 (SWO): 这就像是用放大镜观察存储秘密数据的特定页面,并调高音量。攻击者将模型的当前状态与一个“正常”模型进行比较,并放大那些特定层中的差异。这就像是狡猾的学生对着全班低声说:“嘿,记住这个奇怪的数字了吗?我们要确保永远不要忘记它!”
  2. 权重变换学习 (WTL): 这是进阶版本。与其只是调高音量,攻击者训练了一个微型 AI 来学习模型的大脑在看到私密数据时究竟是如何变化的。然后,他们将学到的模式应用到模型中,以强化其对秘密的记忆。这就像是学生弄清楚了老师用来记忆事物的精确公式,然后将该公式应用到了全班同学身上。

结果:令人震惊的泄露

结果令人震惊。通过使用这些“篡改”技巧,恶意学生可以:

  • 重构 71% 的私密数据(例如,将提示词“我的信用卡号是……”还原为完整的号码),当他们在训练期间积极干预模型时。
  • 增加猜测特定数据是否存在于某人训练集中的能力达 29%

即使没有老师的帮助,也无需访问原始数学过程(梯度)——因为系统每轮只分享最终的权重——这种攻击依然非常有效。事实上,它比许多假设老师是邪恶的且在积极协助黑客的以往攻击都要有效。研究人员在 GPT-2、BERT 和 Llama-2 等流行模型上进行了测试,并在所有模型上都取得了成功。

“谁、什么、如何”

这种攻击的过程如下:

  1. 锁定受害者: 攻击者观察每一轮训练的模型更新。他们使用一种特殊的测试来识别哪些轮次有携带私密数据的受害者参与了。这就像是在听班级的闲聊,并注意到:“啊,那个带着信用卡号的学生刚刚发言了。”
  2. 篡改记忆: 一旦获得了这些特定的快照,他们就使用 SWO 或 WTL 来调整模型的“档案柜”,使私密数据变得极其显眼。
  3. 提问: 最后,他们使用标准的模板(如“您的验证码是……”)向模型提问,而此时的模型由于过度关注秘密,会直接吐出私密数据。

我们能阻止它吗?

研究人员还扮演了防御者的角色。他们测试了几种阻止这个狡猾学生的方法:

  • 差分隐私 (Differential Privacy): 这在笔记中加入“噪声”或静电干扰。它有助于隐藏秘密,但也可能让整个班级的声音听起来有些模糊,从而损害模型生成高质量句子的能力。
  • 清洗 (Scrubbing): 这就像是在分享日记之前对其进行编辑。如果你在训练之前从文本中删除信用卡号和电话号码,模型就无法学习它们。这种方法在不影响模型质量的情况下效果很好。
  • Add-DEPN: 这是一种高级方式,通过指令让“档案柜”对秘密保持沉默。它显著降低了泄露,同时不会让模型说话变得难听。

团队建议,最好的防御是结合使用:首先对文本进行**清洗(scrub)以去除私密数据,然后使用温和的正则化(regularization)**技术(如 Add-DEPN),以确保模型不会对任何可能溜进去的秘密过于痴迷。

总结

这篇论文表明,在联邦学习的世界中,隐私不仅仅是隐藏原始数据;它还关乎模型在过程中是如何记忆事物的。一个恶意的参与者不需要成为一个得到老师帮助的超级天才黑客。他们只需要知道何时观察以及如何调整模型的记忆,让秘密脱颖而出。虽然这是一个可怕的发现,但研究人员也提供了修复这些漏洞的路线图,以确保未来私人 AI 的安全。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →