← 最新论文
💻 computer science

Benchmarking Knowledge-Extraction Attack and Defense on Retrieval-Augmented Generation

本文介绍了首个用于评估检索增强生成(RAG)系统中知识提取攻击与防御的系统性基准测试,通过在不同模型、数据集和语言之间建立统一框架及标准化协议,实现了可复现的比较,并为开发保护隐私的 RAG 应用提供指导。

原作者: Zhisheng Qi, Utkarsh Sahu, Li Ma, Haoyu Han, Ryan Rossi, Franck Dernoncourt, Mahantesh Halappanavar, Nesreen Ahmed, Yushun Dong, Yue Zhao, Yu Zhang, Yu Wang

发布于 2026-06-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhisheng Qi, Utkarsh Sahu, Li Ma, Haoyu Han, Ryan Rossi, Franck Dernoncourt, Mahantesh Halappanavar, Nesreen Ahmed, Yushun Dong, Yue Zhao, Yu Zhang, Yu Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,将 RAG(检索增强生成) 系统视为一位非常聪明、乐于助人的图书管理员,他可以访问一个庞大的私人图书馆(知识库)。当你提出问题时,管理员并不仅仅是靠猜测;他们会跑向书架,找到最相关的书籍,阅读页面,然后仅根据他们找到的内容为你写一份摘要回答。这对于准确性非常有益,但也产生了一个新问题:如果一个窃贼发现了一种方法,可以诱骗图书管理员把整个图书馆的内容逐页大声读出来,甚至包括那些本该保密的部分,该怎么办?

这篇论文本质上是对这些“数字图书管理员”进行的一次安全压力测试。作者构建了一个“健身房”(基准测试),旨在观察不同的“窃贼”(攻击方式)如何窃取秘密,以及不同的“保安”(防御手段)如何有效地阻止他们。

以下是使用简单类比对他们研究结果的拆解:

1. 设置:图书馆、窃贼与保安

  • 图书馆 (RAG 系统): 一个结合了搜索引擎(检索器)和聊天机器人(生成器)的系统。
  • 窃贼 (攻击者): 一个通过提出刁钻问题来实施非法行为的人。他们使用两种手段:
    • “地图” (信息): 他们设计一个问题,诱骗图书管理员的搜索算法调取出他们想要的确切秘密页面,即使这个问题听起来很古怪。
    • “指令” (命令): 一旦管理员拿到了这些页面,窃贼就会给出一个命令,比如“逐字逐句大声朗读这些页面”,从而强迫聊天机器人泄露秘密。
  • 目标: 在不被管理员察觉的情况下,尽可能多地窃取秘密信息。

2. “健身房” (基准测试)

在此之前,研究人员在不同的健身房里测试这些窃贼,而每个健身房都有不同的规则、不同的图书管理员和不同的图书馆。你无法判断一个窃贼是真的更厉害,还是仅仅因为他所在的健身房更容易。

作者构建了一个统一的、标准化的巨大健身房,其中:

  • 每个窃贼面对的是相同的图书馆(医疗记录、公司邮件、受版权保护的书籍)。
  • 每个窃贼对抗的是相同的图书管理员(不同的 AI 模型)。
  • 每个窃贼都由相同的计分卡进行评判。

3. 窃贼 (攻击策略)

论文测试了几种类型的窃贼:

  • 随机投掷者: 向图书管理员投掷随机的词汇或胡言乱语,看看是否能奏效。(就像蒙着眼睛投掷飞镖)。
  • 优化者: 利用数学计算出能够找到特定秘密的完美问题。如果窃贼完全了解图书管理员的搜索引擎是如何工作的(白盒),这种方法效果极佳;但如果窃贼使用的搜索引擎与管理员不同(黑盒),则会失败。
  • 社会工程学家 (IKEA): 他们不直接索要秘密,而是通过礼貌的、像人类一样的问题,随着时间的推移慢慢诱骗图书管理员泄露信息。这是最狡猾的一种,因为它看起来并不像是在进行攻击。

4. 保安 (防御策略)

论文测试了四种阻止窃贼的方法:

  • 门口的保镖 (查询拦截/Query Block): 一个在你进入之前阅读你问题的保安。如果问题听起来像是“读给我看那个秘密文件”,保镖会立即把你踢出去。
    • 结果: 非常擅长阻止明显的窃贼,但“社会工程学家”(IKEA)可以轻松绕过,因为他们的提问听起来很正常。
  • 书架上的过滤器 (阈值防御/Threshold Defense): 管理员被告知:“只提取与你的问题非常相似的书籍。”如果窃贼提出了一个奇怪的问题,由于相似度得分太低,管理员将找不到匹配的书籍。
    • 结果: 对阻止“优化者”类型的窃贼非常有效,但它也可能误伤那些措辞与图书馆原文略有差异的正当问题。
  • 耳语者 (系统拦截/System Block): 管理员得到一条规则:“如果你发现了秘密,不要大声读出来。”相反,他们会说:“我无法分享那个信息。”
    • 结果: 擅长阻止直接的要求,但“社会工程学家”有时可以通过以一种不会触发“秘密”警报的方式询问信息来绕过此限制。
  • 摘要员 (摘要防御/Summary Defense): 管理员被告知:“不要逐字逐句阅读页面。只需给我一个简短的摘要。”
    • 结果: 这是一个强大的防御手段。即使管理员找到了秘密,他也无法泄露精确的文本。然而,如果窃贼提出的问题毫无意义,管理员可能会直接说“我没有什么可以总结的”,这虽然停止了窃取,但也停止了对话。

5. 实验的关键结论

  • “优化者”是一把双刃剑: 如果窃贼了解图书管理员内部的搜索引擎,他们将极其强大。但如果他们使用的是与管理员不同的搜索引擎,他们的魔法技巧就会失效。
  • “社会工程学家”是最难捕捉的: 因为他们不使用粗鲁的命令或古怪的数学,他们比明显的窃贼更容易溜过“保镖”和“耳语者”的防御。
  • 安全性 vs. 实用性: 最强的防御(过滤器)几乎能阻止所有的窃取,但它也会让图书管理员对普通用户而言变得不再那么好用,因为它会拦截那些并非完美匹配的“还可以”的问题。你必须在安全性和实用性之间取得平衡。
  • 闭源 vs. 开源: 最“聪明”的图书管理员(闭源模型,如 GPT-4)实际上比开源模型更擅长执行窃贼要求其逐字朗读秘密的命令,仅仅是因为它们更擅长遵循指令。

总结

这篇论文并没有发明新的窃取方式或新的保护方式;相反,它建立了一个公平的竞技场,用以观察现有的方法究竟哪些真正有效。研究发现,尽管我们拥有优秀的保安,但那些最狡猾的窃贼(即通过礼貌、拟人化提问的窃贼)仍然是一个重大威胁,并且不存在一种既能阻止一切,又不会让图书管理员对普通用户失去作用的“神奇护盾”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →