← 最新论文
💻 computer science

Protecting User Prompts Via Character-Level Differential Privacy

该论文提出了一种基于字符级差分隐私的提示保护方法,通过随机扰动字符并在服务端利用上下文恢复非敏感词,从而在无需显式识别敏感信息的前提下,有效平衡了用户提示的隐私保护与下游任务的实用性。

原作者: Shashie Dilhara Batan Arachchige, Hassan Jameel Asghar, Benjamin Zi Hao Zhao, Dinusha Vatsalan, Dali Kaafar

发布于 2026-03-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Shashie Dilhara Batan Arachchige, Hassan Jameel Asghar, Benjamin Zi Hao Zhao, Dinusha Vatsalan, Dali Kaafar

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文提出了一种保护你在向人工智能(AI)提问时隐私的新方法。简单来说,它就像是在把信寄给 AI 之前,先给信上的敏感信息(比如名字、电话、地址)穿上了一层“防弹衣”,让 AI 能读懂信的大意,却猜不出具体的秘密。

为了让你更容易理解,我们可以用几个生动的比喻来拆解这项技术:

1. 核心问题:把秘密告诉“陌生人”

想象一下,你写了一封家书,里面包含了你的家庭住址、孩子的名字和病历号。你想让一个住在国外的“超级翻译官”(也就是大型语言模型,LLM)帮你总结这封信的内容。

  • 风险:这个翻译官是由第三方公司运营的。如果你直接把原信发过去,翻译官(或者黑客)就能直接看到你的所有隐私。
  • 现状:以前的方法通常是先让人工智能或规则去“找”出哪些词是隐私(比如名字),然后把它涂黑(删掉)。但这就像让一个不熟练的保安去抓小偷,他可能会漏掉一些(比如把“王小明”漏了),或者误删了不该删的(把“苹果”当成水果删了,其实那是你爱吃的水果)。

2. 新方案:给每个字母都“撒点胡椒面”

这篇论文提出的方法非常巧妙,它不需要去识别什么是隐私,而是对信里的每一个字都进行“微调”

  • 比喻:打乱拼图
    想象你的信是由一个个字母组成的拼图。
    • 普通词(非隐私):比如“医生”、“医院”、“今天”。这些词很常见,就像拼图里那种形状很标准的块。即使你故意把拼图的边缘稍微磨圆一点(加一点噪音),那个“超级翻译官”也能凭借经验,一眼看出:“哦,这肯定是‘医生’这个词。”
    • 敏感词(隐私):比如“张三”、"13800138000"、"845-41-54-4"。这些词很独特,就像拼图里形状怪异的块。如果你把它们的边缘也磨圆一点,甚至换个颜色,翻译官就彻底懵了。他可能会猜是“李四”,也可能是“王五”,甚至完全猜不出来。

3. 具体是怎么做的?(三步走)

  1. 撒胡椒面(加噪)
    在你的电脑或手机上,在把信发给 AI 之前,程序会随机地把信里每一个字母都稍微改一下。

    • 比如把 "Harlan" 改成 "H_rlan" 或者 "H@rlan"。
    • 这种修改是随机的,就像你在信纸上撒了一层胡椒面,有些字母被盖住了,有些被换掉了。
    • 关键点:不管这个词是隐私还是非隐私,每个字母都有机会被改。这样就不需要先去识别什么是隐私了,避免了“漏网之鱼”。
  2. 寄给翻译官(发送)
    把这封被“撒了胡椒面”的信发给远程的 AI。这时候,信里充满了乱码和错别字。

  3. 翻译官的“脑补”(恢复与总结)
    AI 收到信后,会尝试做两件事:

    • 修复:利用它强大的语言能力,把那些常见的词(如“医生”、“医院”)自动修正回来。因为它见过太多次这些词了,哪怕少几个字母也能猜对。
    • 总结:基于修复后的内容,把信的主要内容总结出来。
    • 结果:对于敏感词(如“张三”),因为太独特且被改得面目全非,AI 很难猜对。它可能会猜成“哈兰”或者完全乱码。这就保护了隐私。

4. 为什么这个方法很厉害?

  • 不用“找”隐私:以前的方法需要教 AI 什么是隐私(比如“名字是隐私”),但这很难教全。新方法不管是不是隐私,一视同仁地给所有字母加噪。就像给整个房间喷了防雾剂,不管你是想藏镜子还是藏画,都看不清了。
  • 聪明地“牺牲”:它利用了 AI 的一个特点——AI 擅长猜常见的东西,但不擅长猜生僻的东西
    • 常见的词(非隐私):AI 能猜对,所以信的意思(实用性)保留了。
    • 生僻的词(隐私):AI 猜不对,所以隐私被保护了。
  • 数学上的保障:作者用数学公式证明,如果 AI 连这些被打乱的敏感词都猜不对,那世界上其他的黑客或方法也猜不对。这就像给锁加了一把只有数学能证明打不开的锁。

5. 实验结果怎么样?

作者在两个数据集上做了测试:

  1. 医疗记录(包含病人名字、病历号)。
  2. 公司邮件(包含员工姓名、电话)。

结果令人惊讶

  • 当 AI 试图恢复那些敏感词(如病人名字)时,它的成功率几乎和瞎蒙一样低(比如 20% 以下)。
  • 但是,对于非敏感词(如“医生”、“检查”),AI 能恢复 70%-80%。
  • 最终生成的总结报告,意思和原信非常接近(相似度很高),但里面的具体隐私信息却像被“抹去”了一样。

总结

这就好比你想让一个聪明的但有点近视的翻译官帮你读信。

  • 你先把信里所有的字都稍微涂花一点(加噪)。
  • 翻译官看到“医院”这种大词,虽然有点模糊,但能认出来。
  • 但看到“张三”这种小字,因为太模糊且独特,翻译官就彻底认不出了,只能瞎猜。
  • 最后,翻译官给你读出了信的大意(保护了实用性),却完全没听清那个人的名字(保护了隐私)。

这项技术让普通用户在使用云端 AI 时,不再需要担心把秘密告诉第三方,而无需复杂的设置或额外的软件。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →