CAMP: Cumulative Agentic Masking and Pruning for Privacy Protection in Multi-Turn LLM Conversations
本文提出了 CAMP 框架,通过维护会话级实体注册表、构建共现图并计算累积隐私暴露(CPE)分数,在跨多轮对话中动态触发历史消息的追溯性掩码与剪枝,从而有效解决了现有单轮检测机制无法防范的 PII 碎片累积导致的重新识别风险。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文提出了一种名为 CAMP 的新系统,旨在解决大型语言模型(LLM)在多轮对话中一个隐蔽但危险的隐私漏洞。
为了让你轻松理解,我们可以把整个场景想象成**“在公共广场上的秘密会议”**。
1. 问题的根源:拼图效应 (The Puzzle Effect)
想象一下,你正在和一个聪明的机器人助手聊天,这个机器人会把你们所有的聊天记录都发给云端的一个“超级大脑”来处理。
传统的防护(像 Presidio 这样的旧系统):
这就好比广场上的保安,他只看你当前说的一句话。- 你说:“我叫张三。” -> 保安立刻把“张三”涂黑,改成“用户 A"。
- 下一句你说:“我住在上海。” -> 保安把“上海”涂黑,改成“城市 B"。
- 再下一句你说:“我在腾讯工作。” -> 保安把“腾讯”涂黑,改成“公司 C"。
- 结果: 每一句话单独看都是安全的,保安觉得任务完成了。
CAMP 发现的漏洞(累积暴露):
但是,那个“超级大脑”(云端模型)拥有所有被涂黑前的记忆。它虽然没看到完整的名字,但它看到了:- 用户 A + 城市 B + 公司 C + 某种罕见病 + 年薪 50 万。
- 把这些碎片拼在一起,超级大脑就能轻易猜出:“哦,这肯定是张三!”
- 这就是论文说的“累积 PII 暴露”(CPE): 单独看每一块拼图都没事,但拼在一起就泄露了你的全部身份。
2. CAMP 的解决方案:聪明的“记忆管家”
CAMP 就像是一个带记忆的、极其警觉的私人管家,它站在你和云端“超级大脑”之间。它不再只看你当下说的话,而是盯着整个对话的拼图过程。
它的工作流程可以用以下三个步骤来比喻:
第一步:建立“风险地图” (Co-occurrence Graph)
管家手里有一张地图。
- 当你提到“名字”时,地图上点亮了一个点。
- 当你提到“地点”时,又点亮了一个点。
- 关键点: 管家会画线连接这些点。如果“名字”和“地点”同时出现在对话里,这条线就会变粗,代表风险升级。如果再加上“工资”和“公司”,这张网就会变得非常密集,风险指数(CPE 分数)会像滚雪球一样非线性暴涨。
第二步:触发“回溯重写” (Retroactive Pseudonymization)
这是 CAMP 最厉害的地方。
- 一旦管家发现风险分数超过了安全线(比如拼图快拼完了),它不会只是阻止你下一句话。
- 它会立刻回头,把你们之前所有的聊天记录全部“重写”一遍!
- 它会把之前提到的“张三”、“上海”、“腾讯”全部替换成完全虚构但逻辑通顺的假名字(比如“李四”、“北京”、“阿里”)。
- 注意: 这个替换是一致的。如果之前把张三换成了李四,后面提到张三时依然叫李四,这样机器人才能听懂上下文,不会发疯。
第三步:完美的“变脸” (De-masking)
- 云端“超级大脑”处理的是全是假名字(李四、北京...)的对话,它完全不知道你的真实身份。
- 当它把回答传回来时,管家会瞬间把假名字变回真名字。
- 结果: 你看到的回答是:“好的,李四(其实是张三),你在北京(其实是上海)... 等等,不对,是张三在上海..." —— 不,你会看到:“好的,张三,你在上海..."
- 对你来说,对话流畅自然,毫无违和感;但对云端模型来说,它从未见过你的真实信息。
3. 为什么要这样做?(核心优势)
- 旧方法(每轮过滤): 像是一个只盯着单张纸的安检员。你一张一张递纸,每张纸都安全,但拼起来就是通缉令。
- CAMP 方法(会话级保护): 像是一个看着整个拼图过程的管家。它知道什么时候拼图快完成了,于是它把整幅画都换成了临摹画,只把真画留给你自己看。
4. 实验结果:真的有效吗?
论文在医疗、招聘、金融等四个场景做了测试:
- 旧系统: 即使每一句话都检查了,最终还是有 3 到 6 种敏感信息(如姓名、工资、疾病)泄露给了云端。
- CAMP 系统: 在风险累积到临界点时介入,最终0 个真实敏感信息泄露给云端。
- 体验: 用户的对话体验完全没有变差,机器人依然能聪明地回答问题,只是它“以为”它在和一个假人聊天。
总结
这篇论文的核心思想是:隐私不仅仅是“不说真话”,更是“不让碎片拼成真相”。
CAMP 就像是一个时间旅行者,它在风险累积到不可收拾之前,把过去的所有对话都“篡改”成了假版本发给 AI,等 AI 回答后,再把真相还原给你。它既保护了你的隐私,又保留了 AI 的聪明才智,解决了多轮对话中“温水煮青蛙”式的隐私泄露问题。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。