← 最新论文
💬 NLP

Privacy-Preserving Text Sanitization for Distributed Agents Collaboration via Disentangled Representations

本文介绍了 DiSan,这是一个用于分布式智能体协作的隐私保护框架,该框架利用解耦表示来有效地去除识别来源的风格特征,同时保留任务语义,在降低文体属性归属和个人可识别信息(PII)暴露方面,显著优于传统的标记掩码方法。

原作者: Xuan Liu, Hefeng Zhou, Sicheng Chen, Chao Yang, Xingcheng Xu, Jingjing Qu, Jiong Lou, Jie LI, Xia Hu

发布于 2026-06-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Xuan Liu, Hefeng Zhou, Sicheng Chen, Chao Yang, Xingcheng Xu, Jingjing Qu, Jiong Lou, Jie LI, Xia Hu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是使用简单语言和创意类比对该论文进行的解释。

问题所在:文本中的“暗号”

想象一下,你是A银行的一名会计,需要向B银行的一位同事询问一些财务数据,以协助处理客户业务。你发送了一条消息:“我们的客户史密斯先生在小摩银行有一笔500万美元的贷款。”

如果你只是把“史密斯先生”和“小摩银行”删掉,你可能认为自己已经安全了。但论文指出,事实并非如此。为什么?因为你的写作风格就像是一个**“秘密握手”**(暗号)。

即使没有名字,你的信息仍可能通过以下方式泄露你的身份:

  • 你的格式习惯: 你是喜欢用项目符号,还是喜欢写长段落?
  • 你的词汇选择: 你是否经常使用“流动性”或“现金流”之类的词汇?
  • 你的句式结构: 你是否总是以“根据我们的记录……”作为句子的开头?

这些被称为**“分布特征”**(Distributional Signatures)。这就像一位厨师在烹饪结束时总会撒上一撮盐。即使隐藏了厨师的名字,菜肴的味道也会暴露他的身份。

解决方案:DiSan(“隐私翻译官”)

上海人工智能实验室的研究人员开发了一个名为 DiSan(解耦净化,Disentangled Sanitization)的工具。你可以将 DiSan 想象成一个超级聪明的翻译官,它不仅仅是隐藏名字,而是重新改写信息,使其听起来像是由一个通用的、匿名的来源生成的,同时保留重要的事实。

以下是它的工作原理,使用果昔(Smoothie)类比

1. 将水果与果汁分离(解耦)

想象每一条文本信息都是由两种东西组成的果昔:

  • 水果(角色/内容): 实际的事实、数字和含义(例如:“贷款金额为500万美元”)。
  • 果汁(风格): 味道、质感以及识别制作者的秘密配方(例如:“A银行特有的写作方式”)。

旧的方法(如简单的掩码处理)只是试图从杯子里把水果捞出来,但它们留下了果汁,而这股果汁尝起来仍然像是在A银行制作的。

DiSan 使用一种特殊的机器(双流编码器)将果昔分离成两个独立的流:

  • 流 A(角色/内容): 只包含纯粹的事实。这是发送给对方的内容。
  • 流 B(风格): 包含“味道”和秘密配方。这被锁在本地计算机中,绝不发送

2. 小组项目(联邦学习)

通常,要教会计算机完成这项任务,你需要将所有私密的银行文档发送到一个中央服务器。这非常危险。

相反,DiSan 使用了联邦学习。想象 7 家不同的银行正试图学习如何编写“通用型”报告:

  • 它们不会向中央老师发送自己的秘密配方。
  • 相反,它们发送的是关于“通用事实”看起来是什么样的微小的、抽象的**“粘土模型”(称为原型**,Prototypes)。
  • 中央服务器将这些粘土模型混合,创造出一个“主模具”,然后将其发回。
  • 每家银行都利用这个模具来更新自己的机器。

通过这种方式,各家银行可以在互不查看彼此原始私密文档的情况下,学会说同一种“通用语言”。

3. “反身份”训练(对抗性正则化)

为了确保粘土模型不会意外泄露它是哪家银行制作的,系统玩了一场“捉迷藏”游戏:

  • 判别器(一个侦探 AI)试图猜出某个粘土模型来自哪家银行。
  • 净化器(那个翻译官)则试图通过让模型看起来尽可能通用来欺骗侦探。
  • 随着时间的推移,净化器变得越来越擅长隐藏来源,以至于侦探只能进行随机猜测。

结果:效果如何?

论文将此方法与简单的“涂黑”(掩码)或要求大型 AI 重写文本等方法进行了对比测试。

  • 旧方法(掩码处理): 如果你隐藏了 19% 的词汇(名字、日期),“侦探”仍有 67% 的概率能猜出是谁写的。其中的“味道”依然存在。
  • DiSan 方法:
    • 隐私性: 它将猜测来源的能力降低了 73%。现在几乎不可能辨别出是谁写的信息。
    • 实用性: 它保留了 83% 的原始含义。事实依然足够准确,可以回答问题。
    • 个人隐私信息(PII)暴露: 与标准方法相比,它将意外泄露个人信息的风险降低了 20 倍

核心结论

DiSan 是不同组织之间安全共享信息的一种新方式。它不仅仅是划掉名字(这会留下组织的“声音”),而是通过完全重写文本,在保留“故事”的同时,剥离掉独特的“声音”。它允许代理进行协作,而无需泄露各自的秘密配方。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →