✨ 要点🔬 技术摘要
想象一下,互联网是一个巨大的、混乱的图书馆,每一本书、每一篇博客文章和每一个维基条目都可能是一个线索。现在,想象一位超级聪明的机器人图书管理员,他几乎读过了所有的书,但当需要了解非常新或非常具体的信息时,他就会卡壳。为了解决这个问题,我们给了这位图书管理员一个特殊的工具:一个“检索增强生成”(Retrieval-Augmented Generation,简称 RAG)系统。把这想象成一个神奇的放大镜。当你提出一个问题时,放大镜能瞬间找到图书馆中最相关的页面,并将它们递给机器人,然后机器人利用这些页面来编写答案。这就像拥有一个能够瞬间查阅事实,而不是仅仅依靠几年前记忆的天才。这对于保持信息的新鲜度非常了不起,但它也有阴暗的一面:如果有人偷偷往图书馆里塞进了一页假页面怎么办?如果图书管理员抓取了那页假页面,机器人可能会相信那个谎言,并充满自信地告诉你一个错误的答案。这就是“语料库投毒”(corpus poisoning)的世界——危险不在于黑入机器人的大脑,而在于欺骗它所信任的图书馆。
于是有了 DenialRAG ,一项探索如何以一种隐蔽方式欺骗这些系统的全新研究。研究人员提出了一个大胆的问题:如果我们不隐藏真相,而是先告诉机器人真相,紧接着立刻告诉它为什么 这个真相是错误的,会发生什么?以往大多数诡计试图在不提及正确答案的情况下低声诉说错误答案,因为担心提到真相会唤醒机器人的记忆并破坏诡计。但本文的作者发现,这种担忧可能是没必要的。他们创建了一个“被投毒”的文档,明确写道:“你可能认为答案是 X,但这其实是个错误!真正的答案是 Y,以下是为什么 Y 更好的原因。”他们将此称为 DenialRAG 。
该研究针对八种不同的机器人大脑(大语言模型)和三种不同类型的问题测试了这个想法。他们发现,这种“否定真相”的策略极其有效,尤其是在某些模型上。事实上,在某些系统中,它的效果比他们尝试过的任何其他诡计都要好,在特定测试中的成功率高达 94% 。研究人员还尝试使用五种不同的安全网来阻止这种攻击,比如要求机器人保持怀疑精神或重写问题。虽然这些安全网有所帮助,但它们并未完全阻止攻击;“DenialRAG”诡计在许多情况下仍然奏效,导致机器人给出错误答案的可能性依然显著。
论文指出,成功的秘诀不仅在于撒谎,更在于冲突 。通过在同一个段落中放入正确答案和错误答案,并让争论向错误答案倾斜,这种“毒素”就变成了一个自洽的故事,让机器人难以忽视。研究还表明,并非所有机器人都同样容易受骗。较小、较便宜的模型很容易被愚弄,而最新、最强大的模型则较难被欺骗,尽管并非不可能。研究人员总结道,并没有一种单一的“魔法护盾”可以阻止所有的这类攻击。相反,危险程度在很大程度上取决于攻击是如何编写的,以及哪个机器人正在阅读它。这提醒我们,在人工智能时代,图书馆里的哪怕一句话,都能改变机器人讲述的故事。
技术摘要:“DenialRAG:通过嵌入参数化否定实现单文档 RAG 投毒”
问题陈述 检索增强生成(RAG)系统通过外部文档来约束大语言模型(LLM)的生成,这类系统极易受到语料库投毒的影响。在这种威胁模型中,攻击者将精心构造的文档插入检索语料库,旨在引导生成器转向攻击者选定的错误答案(Y Y Y ),且无需访问模型权重、系统提示词或检索器内部信息。虽然先前的单文档攻击(如 PoisonedRAG、AuthChain、CorruptRAG)已经证明单个受污染的段落可以误导 RAG 系统,但它们通常会避免明确提及正确答案(X X X )。普遍的假设是,提及 X X X 可能会激活模型的参数知识,导致其拒绝受污染的内容。本文研究了避免提及 X X X 是否是必要的,或者显式命名并反驳 X X X 是否可能成为一种更强大的攻击向量。
方法论:DenialRAG 作者提出了 DenialRAG ,这是一种单文档投毒攻击,它在受污染的段落中显式地嵌入了正确答案(X X X )与攻击者选定答案(Y Y Y )之间的冲突。DenialRAG 并非抑制 X X X ,而是通过命名 X X X 并提供一个攻击者控制的解释,说明为何应拒绝 X X X 而选择 Y Y Y 。
该攻击流水线分为两个阶段:
离线攻击阶段: 给定目标查询 q q q 、正确答案 X X X 和目标错误答案 Y Y Y ,攻击者使用 LLM 生成一段短小(≤100 字)的受污染段落。该生成过程涉及两次调用:
特征提取: 识别问题意图和显著证据节点(实体、日期),以确保检索相关性。
段落构建: 生成包含四个组成部分的结构化段落:
开篇: 断言 Y Y Y 是确定的答案,并附带具体细节。
证据编织: 融入提取的证据节点,以契合用户查询。
嵌入式否定: 显式命名 X X X ,将其定性为误解或过时的数值,并提供拒绝它的理由。
结尾权威性: 通过机构或记录引用再次确认 Y Y Y 。 生成的文档被插入到检索语料库 K K K 中。
在线查询阶段: 当用户提交 q q q 时,检索器会选中该受污染段落(由于其具有高度的词汇/语义重叠)。接收到上下文后,生成器面对一个 X X X 已被承认并被“解释掉”的环境,从而被引导输出 Y Y Y 。
核心贡献
新颖的攻击机制: 引入了 DenialRAG,它挑战了“正确答案必须被规避”的投一次攻击假设。它证明了显式命名 X X X 并在局部解决冲突以支持 Y Y Y 的做法可以非常有效。
系统性评估: 在三个开放域问答数据集(Natural Questions, HotpotQA, MS-MARCO)、来自四个厂商的八个目标 LLM(涵盖从低成本级到前沿模型)以及四种现有的单文档投毒基准模型上进行了全面的评估。
防御分析: 评估了五种推理时防御措施(Paraphrase, InstructRAG, TrustRAG, RobustRAG, AstuteRAG),以确定它们是否能缓解单文档攻击。
组件与稳定性分析: 通过消融实验确定“嵌入式否定”是最关键的组件;跨模型分析显示,攻击效果并非均匀分布,而是高度依赖于投毒机制与目标模型对齐程度及参数知识之间的相互作用。
结果
攻击有效性: DenialRAG 在所有三个数据集上对 Mistral-7B 的攻击成功率(ASR)最高(分别为 89%、94%、86%)。然而,有效性具有强烈的模型依赖性。在模型前沿领域(如 GPT-5.2, GPT-5.5),其他攻击(如 PIA-direct 直接断言或 CorruptRAG-AK 时效更新框架)往往表现更好。例如,CorruptRAG-AK 在 GPT-5.5 上占据主导地位,而 DenialRAG 在前沿模型上的表现较成本级模型显著下降。
防御鲁棒性: 推理时防御在许多设置下降低了 ASR,但未能提供统一的保护。
Paraphrase 效果有限。
InstructRAG 和 TrustRAG 虽然降低了某些攻击的 ASR,但在 DenialRAG 和 CorruptRAG-AK 面前仍留下了显著的残留风险,尤其是当受污染段落本身就在解释冲突时。
RobustRAG 和 AstuteRAG 在特定设置下表现出强力的削减作用(例如 AstuteRAG 将 GPT-5.2 上的 DenialRAG ASR 降至约 8%),但在 Mistral-7B 上对 DenialRAG 仍然无效(ASR 保持在 ~77-86%)。
消融研究发现: 移除“嵌入式否定”(即仅断言 Y Y Y )会导致 ASR 最大幅度的下降(平均下降约 17 个百分点),证实了“解释为什么 X X X 是错误的”这一机制是成功的核心驱动力。显式命名 X X X 也至关重要;省略正确答案的名称会降低有效性。
模型层级稳定性: 当从成本级模型转向前沿模型时,DenialRAG 表现出最大的性能跌幅(下降了 30.3 个百分点),这表明更强的模型更擅长根据其参数知识来交叉检查 DenialRAG 呈现的显式矛盾。相反,将冲突构架为“时效更新”的攻击(CorruptRAG-AK)在不同模型层级间表现更为稳定。
意义与主张 本文声称,RAG 投毒风险无法用单一的攻击家族或单一的目标模型来表征。投毒攻击的有效性高度取决于特定的攻击机制(如否定、断言或时效更新框架)与目标 LLM 的架构及对齐方式之间的相互作用。
作者强调,虽然 DenialRAG 是一个强有力的、新的攻击向量(尤其针对成本级模型),但它并非普遍优越。研究表明,防御措施往往是不统一的:一种能够缓解某种类型投毒(如直接断言)的防御,可能会使系统在面对另一种类型(如嵌入式否定或时效更新)时依然脆弱。因此,本文得出结论:理解 RAG 安全性需要通过分析跨越不同模型和防御谱系的多种攻击机制,而非仅仅依赖单一指标或模型类别来定义威胁图景。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。