← 最新论文
💬 NLP

DP-Fusion: Token-Level Differentially Private Inference for Large Language Models

该论文提出了 DP-Fusion,一种针对大语言模型的标记级差分隐私推理机制,通过在理论上限制敏感上下文标记对输出的影响,从而实现高质量的文档隐私化,并与现有方法相比显著提升了隐私与效用的权衡。

原作者: Rushil Thareja, Preslav Nakov, Praneeth Vepakomma, Nils Lukas

发布于 2026-02-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Rushil Thareja, Preslav Nakov, Praneeth Vepakomma, Nils Lukas

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个非常聪明、爱说话的机器人(大语言模型,或称 LLM),它能帮你总结文档。有时,这些文档包含敏感信息,比如患者的姓名、特定的日期或银行账号。你想让机器人总结故事,但又不想让它不小心泄露这些秘密。

问题在于,目前的机器人表现得很糟糕。如果你只是告诉它们“不要说出名字”,它们可能会变得混乱并写出一些不知所云的内容。如果你告诉它们“把它改写得好一点”,它们可能还是会不小心泄露秘密。

走进 DP-FUSION:这款“秘密安全”搅拌机

作者们开发了一种名为 DP-FUSION 的新方法,它被称为一种特殊的文本“搅拌机”。它能保证在隐藏秘密的同时,保持故事的可读性。以下是它的工作原理,我们用一个简单的类比来说明:

场景:两个版本的同一个故事

想象你有一份关于“史密斯夫人(Mrs. Smith)”账单金额为“345.25美元”的医疗报告。

  1. 原始故事: 包含了姓名“史密斯夫人”和精确的账单金额。
  2. 脱敏后的故事: 你用记号笔把“史密斯夫人”和“345.25美元”涂掉,用空白占位符如 [姓名][金额] 来替换。

DP-FUSION 如何工作(搅拌过程)

DP-FUSION 并不只是在两个版本之间做选择,它进行了一场聪明的“舞蹈”:

  1. 运行两次机器人:

    • 首先,它要求机器人使用脱敏后的故事(安全版本)来预测下一个词。这会得到一个“安全”的猜测。
    • 其次,它要求机器人使用原始故事(含有秘密的版本)来预测下一个词。这会得到一个“冒险”的猜测,可能会泄露秘密。
  2. “隐私旋钮”(搅拌器旋钮):

    • 系统有一个被称为 ϵ\epsilon (epsilon) 的旋钮。
    • 旋钮调到最低(低 ϵ\epsilon): 搅拌机会将这两个猜测混合得非常彻底,使得“冒险”的秘密几乎完全被“安全”的猜测所淹没。机器人可能会说“一位患者”而不是“史密斯夫人”。这种方式非常私密,但故事可能会显得有些平淡乏味。
    • 旋钮调高(高 ϵ\epsilon): 搅拌机会让更多的“冒险”猜测通过。如果语境合适,机器人可能会说出“史密斯夫人”。这样故事听起来更好,但泄露秘密的风险也会略微增加。
  3. 保证:

    • DP-FUSION 的神奇之处在于,它在数学上证明了无论黑客如何努力尝试去猜,他们成功的概率都会受到这个旋钮设置的严格限制。即使黑客完全了解这个搅拌器的工作原理,他们也无法通过逆向工程推导出秘密。

为什么它比我们现有的方法更好?

论文将 DP-FUSION 与其他方法进行了对比:

  • “清洗器”(NER): 这就像是用黑色记号笔涂掉秘密。它很安全,但会在文本中留下难看的空洞,导致可读性较低(效用低)。
  • “改写器”(提示词工程/Prompt Engineering): 这就像是要求机器人“把它改写得好一点”。它听起来不错,但由于机器人没有被强制要求必须谨慎,它往往还是会不小心泄露秘密。
  • DP-FUSION: 它是这两者的平衡点。它既能保持文本流畅(高质量),又能从数学上保证秘密被隐藏。

结果

研究人员在真实的法律和医疗文档上测试了该方法。他们发现:

  • 质量: 由 DP-FUSION 生成的文本比其他隐私处理方法更自然、更具可读性。事实上,在“困惑度”(衡量文本是否令人困惑的一个指标)方面,它比次优的隐私处理方法要好 6 倍
  • 安全性: 即使黑客试图猜测隐藏的名字或日期,他们的成功率也几乎和随机猜测一样低。
  • 额外安全性: 该方法还有助于阻止“越狱攻击”(Jailbreak attacks),即黑客试图诱导机器人忽略其规则的行为。通过将可疑的输入视为“敏感标记(sensitive tokens)”,搅拌机可以稀释它们的影响力,从而保持机器人的安全。

总结

DP-FUSION 是一种使用 AI 来总结敏感文档的新方法。它就像一个智能搅拌机,将“安全版”文本与“真实版”文本进行混合,并通过一个隐私旋钮进行控制。这确保了秘密(如姓名或日期)在数学上得到保证,同时生成的文本依然保持高质量且易于阅读。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →