← 最新论文
🤖 machine learning

Reconstructing Training Data from Adapter-based Federated Large Language Models

原作者: Silong Chen, Yuchuan Luo, Guilin Deng, Yi Liu, Min Xu, Shaojing Fu, Xiaohua Jia

发布于 2026-01-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Silong Chen, Yuchuan Luo, Guilin Deng, Yi Liu, Min Xu, Shaojing Fu, Xiaohua Jia

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大局观:一份“秘密食谱”的泄露

想象一下,你和你的朋友们正试图一起烘焙一个特定的蛋糕(大型语言模型),但你不想把你的私人食谱(你的私有数据)分享给任何人。为了解决这个问题,你们使用了一个聪明的技巧,叫做联邦学习(Federated Learning)。你们并没有把整本食谱送到中央厨房,而只是发送了你对蛋糕盘(称为适配器/Adapter)的一个微小可拆卸部分的修改。主蛋糕盘保持冻结且不被触碰。

人们曾认为:“既然我们只发送了蛋糕盘一小部分的微小变化,而且主盘是锁定的,那么没人能破解出你的秘密食谱。”

但这篇论文说:“别高兴得太早。”

研究人员发现,即使是这些微小的、受到严格控制的变化,一个狡猾的烘焙师(攻击者)仍然可以通过观察梯度更新中留下的“面包屑”,完美地重建出你的秘密食谱。他们构建了一个名为 UTR(基于无序词袋的文本重建)的新工具,正是以此来实现这一目标的。


三大障碍(以及他们是如何跨越它们的)

研究人员知道这是一个很难解的谜题,因为存在三个具体问题:

  1. “微弱信号”问题: 发送的变化非常微小(低维),传统的通过“眯着眼看模糊照片”来猜测食谱的方法会完全失效。

    • 解决方法: UTR 不再是眯着眼看,而是像一个金属探测器。它扫描模型的“冻结”部分(这是所有人已知的),以查看词典中哪些特定的单词(Token)很可能被使用了。它并不试图一次性猜出整个句子,而只是构建一个“词袋(Word Bag)”——即那些必须出现在食谱中的原料清单。
  2. “锁定厨房”问题: 模型的主脑(骨干网络)是冻结的。攻击者通常需要观察大脑如何处理信息才能逆向工程输入内容。在这里,那个大脑是无法触及的。

    • 解决方法: UTR 意识到,尽管大脑被锁定了,但这个微小的“适配器”模块就像一个皮影戏偶。通过分析由适配器的微小变化所投射出的影子形状,UTR 可以推断出哪些句子符合数据,即使在看不见完整大脑的情况下也是如此。
  3. “组合爆炸”问题: 如果你有一个包含 10 个单词的袋子,将它们排列成句子的方式有数百万种。尝试每一种组合对计算机来说是不可能的。

    • 解决方法: UTR 使用了一个智能过滤器。它不会尝试每一个随机组合,而是利用语法规则和常识(例如,“a child”是有意义的,但“child the”没有)来剔除错误的选项。然后,它会将剩余的候选方案与适配器留下的数学“指纹”进行比对,从而找到精确的匹配。

结果:完美的重建

研究人员在不同的模型(如 GPT-2、BERT 和 Qwen)以及不同类型的文本(电影评论、语法测试等)上测试了他们的“词袋”工具(UTR)。

  • 神奇数字: 在许多情况下,UTR 以 99% 到 100% 的准确率重建了原始文本。
  • 规模: 以前的方法在“批大小”(一次发送多少个食谱)变大时会表现得极差。即便在一次发送 128 个食谱时,UTR 依然能完美运行。
  • 惊喜之处: 他们发现某些模型(如 GPT-2)由于其逐词读取的方式,在处理长句子时破解难度略高,但较新的模型(如 Qwen)几乎被完美破解。

“防御”检查

论文还测试了常见的安全措施是否能阻止这种攻击:

  • 梯度剪枝(丢弃微小数值): 这就像试图通过撕掉书中的几页来隐藏秘密。这效果不佳。即使丢失了 99% 的页面,攻击者仍然可以读出故事,只要关键单词还在。
  • 差分隐私(添加“噪声”): 这就像是在无线电信号中加入静电。研究人员发现,为了阻止这种攻击,你必须加入如此多的静电,以至于无线电变得无法使用。模型会停止学习任何有用的东西。

核心启示

论文得出结论,在效率与隐私之间存在着一种根本性的张力。仅仅因为你通过冻结大部分模型并只训练一个微小的适配器,使模型变得“轻量化”且“高效”,并不意味着它自动变得安全了。

事实上,研究人员认为,这些高效的适配器创造了新的、隐藏的数据泄露通道,其危险程度不亚于旧有的渠道。如果你正在使用这些系统来保护私密数据,你不能仅仅依靠“我们只更新了模型的一小部分”作为安全的保证。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →