← 最新论文
💻 computer science

BodhiPromptShield: Pre-Inference Prompt Mediation for Suppressing Privacy Propagation in LLM/VLM Agents

本文提出了 BodhiPromptShield 框架,通过策略感知的提示调解机制,在检索、记忆和工具调用等跨阶段流程中检测并延迟恢复敏感信息,从而有效抑制 LLM/VLM 代理中的隐私传播风险。

原作者: Bo Ma, Jinsong Wu, Weiqi Yan

发布于 2026-04-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Bo Ma, Jinsong Wu, Weiqi Yan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 BodhiPromptShield(菩提提示盾)的新系统,它的核心任务是保护我们在与 AI 助手对话时的隐私

为了让你更容易理解,我们可以把现在的 AI 系统想象成一个繁忙的跨国物流公司,而用户的提示词(Prompt)就是寄送的包裹

1. 现在的痛点:包裹在运输途中“泄露”了

以前,我们以为只要把包裹上的寄件人名字涂黑(传统的隐私保护),就安全了。但在这个 AI 物流系统中,问题比这复杂得多:

  • 传统做法的漏洞:传统的隐私保护就像是在包裹刚出厂时涂黑名字。但是,这个包裹在送到最终目的地之前,要经过很多中转站:
    • 检索站(Retrieval):AI 会拿着包裹里的信息去查资料库。
    • 记忆站(Memory):AI 会把包裹里的信息记在笔记本上。
    • 工具站(Tools):AI 可能会调用外部工具(比如查汇率、订机票)。
    • 日志站(Logs):所有的操作都会被记录下来。

问题在于:如果包裹里的敏感信息(比如你的身份证号、家庭住址)在“出厂”时只是简单涂黑,但 AI 在中转站(检索、记忆、工具调用)里又把涂黑的部分还原或者复制到了新的地方,那么隐私就泄露了。就像你涂黑了信封上的地址,但快递员在分拣时把地址抄在了自己的小本子上,或者把包裹里的信纸复印了一份传给第三方。

2. BodhiPromptShield 的解决方案:智能“安检与伪装”系统

BodhiPromptShield 就像是一个超级智能的安检与伪装中心,它不仅仅是在包裹出厂时涂黑名字,而是在包裹进入物流网络之前,就进行精心的处理:

  • 识别敏感物:它先扫描包裹,精准识别出哪些是“危险品”(敏感信息,如姓名、银行卡号、医疗记录)。
  • 三种伪装策略(根据情况灵活选择):
    1. 贴标签(Typed Placeholders):把“张三”换成 <人名_1>,把"138 开头的手机号”换成 <电话_1>。这样 AI 知道这里有个人,但不知道是谁。
    2. 模糊化(Semantic Abstraction):把“住在北京市朝阳区某小区”模糊成“住在北京市的一个居民区”。保留了位置的大致概念,方便 AI 做决策,但隐藏了具体门牌。
    3. 加密代号(Secure Symbolic Mapping):把敏感信息变成一个只有授权人员(在特定环节)才能解开的乱码代号。
  • 关键创新:延迟解密(Delayed Restoration):
    这是最厉害的一点。以前,AI 可能刚把名字涂黑,转头为了查资料又把名字还原了。BodhiPromptShield 规定:只有到了最后必须执行具体任务(比如真的要去银行转账)
    这就好比:包裹在仓库、分拣中心、运输车上时,里面的东西永远是“加密”或“模糊”的;只有到了最终签收台,经过严格授权,才允许打开看真东西。

3. 效果如何?(用数据说话)

论文在一个叫 CPPB 的模拟测试场里做了实验:

  • 泄露率大幅下降:在没有保护的情况下,敏感信息在物流链条(检索、记忆、工具)中的泄露率高达 10.7%。用了 BodhiPromptShield 后,这个泄露率降到了 7.1%
  • 业务不受影响:最重要的是,这种保护没有让 AI 变笨。AI 依然能准确回答问题(准确率 94%),任务也能成功完成(成功率 92%)。就像包裹被伪装后,快递员依然知道要把货送到哪个城市,只是不知道具体是谁收的。

4. 为什么这很重要?(比喻总结)

想象一下,你去医院看病,医生(AI 助手)需要帮你查医保、记病历、开药方。

  • 以前的做法:医生在病历本上把你的名字涂黑,但在查医保系统、记电子病历、开药单时,又把名字写出来了。结果,你的隐私在医院的各个科室、各个系统里到处“裸奔”。
  • BodhiPromptShield 的做法
    • 在病历本上,你的名字被替换成“患者 A"。
    • 在查医保系统时,系统只看到“患者 A",查不到你的真实身份。
    • 在记电子病历时,只记录“患者 A 有高血压”。
    • 只有到了药房发药、或者最后生成正式发票的那一瞬间,经过严格授权,系统才把“患者 A"还原成你的名字。

5. 总结

这篇论文的核心思想是:隐私保护不能只靠“涂黑”,而要靠“控制传播”

BodhiPromptShield 就像给 AI 系统装了一个智能的“防扩散阀门”。它确保敏感信息在 AI 的“大脑”(记忆)、“眼睛”(检索)和“手脚”(工具调用)里传播时,始终保持伪装状态,直到最后不得不使用真实信息的时刻才解密。

一句话概括:它让 AI 在帮你办事时,“只知其事,不知其人”,直到最后必须知道你是谁的时候,才告诉你“哦,原来是你”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →