← 最新论文
💬 NLP

SilentRetrieval: Hijacking Retrieval-Augmented Generation via Semantically-Preserving Adversarial Data Poisoning

本文介绍了 SilentRetrieval,这是一种两阶段数据投毒攻击,通过注入精心设计的流畅对抗性文档来劫持检索增强生成系统,这些文档在保持高检索排名的同时成功操纵大语言模型的输出,并通过维持语义连贯性来规避检测。

原作者: Jiachen Qian

发布于 2026-05-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiachen Qian

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,将检索增强生成(RAG)系统比作一位非常聪明但略显健忘的图书管理员。当你提出问题时,这位管理员不会仅仅依赖自己的记忆(那可能已过时或会凭空捏造);相反,他们会迅速奔向一座庞大的图书库(即“语料库”),寻找最相关的页面,阅读这些内容,然后基于所找到的信息为你撰写答案。

论文《SilentRetrieval》描述了一种新颖且隐蔽的入侵该图书管理员的方法。攻击者并非通过大喊大叫或砸碎图书馆窗户(那样太明显)来行事,而是悄悄地将一本精心伪造的假书混入书架。当管理员寻找答案时,他们会首先发现这本假书,阅读它,然后自信地告诉你一个听起来完全真实的谎言。

以下是该攻击方式的分解步骤:

1. 问题所在:“信任我”的图书馆

图书管理员信任书架上的书籍。如果书籍内容干净准确,管理员就能给出好的回答。但如果有人将一本外观与真书毫无二致的假书偷偷混入其中,管理员可能会抓取这本假书而非真实事实,从而导致“幻觉”(即自信的谎言)。

2. 攻击手段:"SilentRetrieval"

研究人员创建了一种两步法来制造这本假书,且不被察觉。

第一步:“完美契合”(协调束搜索)
想象一下,你想将真实百科全书条目中的一段话替换为谎言,但你不能随意涂写胡言乱语,否则管理员会立即将其剔除。

  • 旧方法: 以前的黑客会编写胡言乱语或明显的 nonsense。管理员的“流畅度过滤器”(一种检查文本是否自然的工具)会立即识破并拒绝它。
  • SilentRetrieval 方法: 攻击者使用一种复杂的算法,对真实文章的措辞进行微调,使其刚好包含谎言,同时保持句子结构和行文流畅,使其听起来仍像正常的百科全书条目。这就像修改食谱,将“加盐”改为“加毒药”,但手法如此微妙,以至于食谱看起来仍像一道正常且美味的菜肴。
  • 目标: 确保这本假书在你搜索该主题时,仍然是管理员找到的最相关的书籍。

第二步:“平滑过渡”(上下文自适应触发词生成)
一旦伪造的段落准备就绪,攻击者需要确保管理员在阅读时相信这个谎言。

  • 系统并非简单地在末尾粘贴一个随机句子(例如“天空是绿色的!”),而是利用另一个 AI 编写一个“触发”句子,使其与伪造段落完美融合。
  • 它听起来像是自然的结论或“已验证的事实”,符合文章的基调。这与笨拙地贴在书页上的便条截然不同,后者是自然融入故事的一部分。

3. 结果:黑客技术有多高明?

研究人员在两个庞大的数字图书馆(一个包含 36.1 万页,另一个包含 880 万页)上测试了这种方法。

  • 隐蔽性: 伪造文档几乎与真实文档无法区分。当人类审查员查看它们时,仅约15%的情况下将其标记为“可疑”,而旧式笨拙的黑客方法则高达83%。对于检查“奇怪词模式”的计算机而言,这些假书看起来与真书几乎一样正常。
  • 成功率: 当管理员被问及问题时,在较小的图书馆中,假书被找到的概率为84.6%。一旦找到,管理员相信谎言并给出错误答案的概率为57.5%
  • “大图书馆”测试: 即使他们在拥有 2100 万页(超大规模)的图书馆中进行测试,假书仍能在**74.2%**的情况下进入搜索结果的前列。

4. 防御措施:如何阻止它

论文还测试了如何保护这位图书管理员:

  • “第二意见”(重排序): 如果管理员用一位更严格、更具批判性的“第二管理员”(交叉编码器)来检查前几项结果,那么假书被选中的可能性就会降低。
  • “群体投票”(段落隔离): 不让管理员只阅读一页并做出决定,而是让他们阅读五篇不同的文章并对答案进行投票。如果假书是唯一包含谎言的,其他四篇真实文章将投票否决它。
  • 结果: 结合使用这些防御措施(第二管理员 + 群体投票)将攻击的成功率从57.5%降低到了21.3%。然而,这会使管理员的速度变慢(大约慢 6 倍)。

核心结论

这篇论文表明,RAG 系统存在一个隐藏弱点:语料库完整性。如果攻击者能够将几篇精心编写、具有“隐蔽性”的假文档注入数据库,他们就能劫持系统的回答,而系统却察觉不到任何异常。

关键要点在于,流畅性是一把双刃剑。让攻击文本听起来过于完美,会使简单过滤器更难捕捉到它,但这也使得攻击更加危险,因为 AI(以及人类)更有可能信任它。论文建议,为了保持安全,我们需要“分层”防御——使用多重检查和制衡机制,而不是仅仅依赖一种方式来识别假新闻。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →