← 最新论文
🤖 machine learning

LightSplit: Practical Privacy-Preserving Split Learning via Orthogonal Projections

LightSplit 是一种实用的隐私保护分割学习框架,它在切割层采用轻量级、固定的正交随机投影,既通过充当信息瓶颈将通信开销降低高达 32 倍并缓解重构攻击,又无需在客户端设备上添加任何可训练组件即可保持超过 95% 的基线准确率。

原作者: Mert Cihangiroglu, Alessandro Pegoraro, Phillip Rieger, Antonino Nocera, Ahmad-Reza Sadeghi

发布于 2026-05-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Mert Cihangiroglu, Alessandro Pegoraro, Phillip Rieger, Antonino Nocera, Ahmad-Reza Sadeghi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你和一群朋友正试图共同拼凑一幅巨大而复杂的拼图。你们每个人都握有一块独特的拼图碎片(即你们的私有数据),但你们不想向他人展示这块碎片,因为它包含敏感的秘密。

拆分学习(Split Learning)的世界里,你们与一个强大的中央“服务器”(一台超级计算机)协同工作。你们在自己的设备上完成拼图的第一部分,生成一幅“打碎”的中间版本图像。你们将这块打碎的碎片发送给服务器,由服务器完成拼图的其余部分,并将结果返回给你们。

问题所在:
发送这块“打碎”的碎片存在两大问题:

  1. 过于沉重:碎片体积庞大,每次发送都会堵塞网络连接。
  2. 过于暴露:尽管它已被“打碎”,但一个好奇的服务器仍可通过观察细节重建你们的原始秘密图像。这就像发送一份被撕碎的文档;如果碎纸片足够大,有人就能将它们重新拼贴复原。

现有解决方案往往试图解决其中一个问题,却忽视了另一个。有些方法让碎片变小,却保留了秘密;另一些方法隐藏了秘密,却让碎片变得过于沉重,拖慢了整个系统。

解决方案:LightSplit
本文作者提出了一种名为LightSplit的新方法。可以将其理解为在发送拼图碎片之前,对碎片施加的一个巧妙的一次性魔术。

以下是其工作原理,借助简单的类比说明:

1. “正交投影”(魔法滤镜)

想象你们的拼图碎片是一件高清的三维雕塑。发送整个雕塑代价高昂。

  • 旧方法:发送整个雕塑。
  • LightSplit 方法:你用一束特定且固定的光照亮雕塑,仅发送它在墙上投射的影子

这个影子要小得多(节省了网络带宽)。但关键在于:这个影子是从随机角度投射的。它保留了整体形状(因此服务器仍能完成拼图),却丢弃了那些足以让人重建原始三维雕塑的具体细节。这就像观察一个人的影子:你能看出他很高、戴着帽子,但无法看清他的脸或穿着什么。

2. “类内压缩”(群体拥抱)

即使影子也可能存在微小的独特褶皱,从而暴露出是谁的影子。

  • 修正措施:LightSplit 添加了一条规则:“所有属于‘猫’类别的个体,其影子必须完全一致;所有属于‘狗’类别的个体,其影子也必须完全一致。”
  • 结果:服务器看到一个完美的“猫影”和一个完美的“狗影”。它能区分猫和狗(因此拼图能正确完成),但无法再分辨出你的那只特定猫与你邻居的那只特定猫之间的差异。它消除了数据的“个体性”,同时保留了“类别”信息。

3. “回抬”(服务器的解码器)

服务器接收到这个微小且通用的影子。为了完成拼图,它需要将这个影子还原成拼图其余部分可理解的形状。

  • LightSplit-F(简单方式):服务器仅使用一个固定的数学规则将影子拉伸回原状。这种方法快速且无需额外计算能力。
  • LightSplit-L(智能方式):服务器使用一个小型可训练的人工智能,以最适合拼图的方式将影子拉伸回原状。这种方式稍显强大,但需要服务器付出更多计算工作。

为何这很重要?

本文将该方法与当前已知的最佳“黑客”攻击进行了测试。

  • 隐私性:当黑客尝试从影子中重建原始图像时,他们彻底失败。重建出的图像变成了无法识别的噪声。论文声称,与其他方法相比,这使黑客窃取数据的能力降低了高达7 倍
  • 速度:由于影子非常小,通过网络发送的数据量减少了高达32 倍
  • 准确性:尽管进行了如此多的隐藏和压缩,最终拼图仍以95% 以上的准确率完成。系统并未混淆,只是更聪明地选择了隐藏什么。

核心结论

LightSplit 是一种实用的方法,使设备能够在不共享私有数据的情况下协同进行 AI 训练。它充当一个隐私保护过滤器,既压缩数据以节省带宽,又打乱细节以阻止黑客,而无需用户的设备承担任何繁重计算。这是一个针对沉重问题的“轻量级”解决方案。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →