← 最新论文
💻 computer science

DenialRAG: Single-Document RAG Poisoning via Embedded Parametric Denial

本文介绍了 DenialRAG,一种新颖的单文档 RAG 投毒攻击,它通过在检索到的段落中明确命名并反驳正确答案,从而引导大语言模型转向攻击者选择的错误答案,证明了其有效性具有高度的模型依赖性,且目前的防御手段仅能提供部分、非均匀的保护。

原作者: Abay Zhurekbay, Tao Liu, Fan Li

发布于 2026-08-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Abay Zhurekbay, Tao Liu, Fan Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,互联网是一个巨大的、混乱的图书馆,每一本书、每一篇博客文章和每一个维基条目都可能是一个线索。现在,想象一位超级聪明的机器人图书管理员,他几乎读过了所有的书,但当需要了解非常新或非常具体的信息时,他就会卡壳。为了解决这个问题,我们给了这位图书管理员一个特殊的工具:一个“检索增强生成”(Retrieval-Augmented Generation,简称 RAG)系统。把这想象成一个神奇的放大镜。当你提出一个问题时,放大镜能瞬间找到图书馆中最相关的页面,并将它们递给机器人,然后机器人利用这些页面来编写答案。这就像拥有一个能够瞬间查阅事实,而不是仅仅依靠几年前记忆的天才。这对于保持信息的新鲜度非常了不起,但它也有阴暗的一面:如果有人偷偷往图书馆里塞进了一页假页面怎么办?如果图书管理员抓取了那页假页面,机器人可能会相信那个谎言,并充满自信地告诉你一个错误的答案。这就是“语料库投毒”(corpus poisoning)的世界——危险不在于黑入机器人的大脑,而在于欺骗它所信任的图书馆。

于是有了 DenialRAG,一项探索如何以一种隐蔽方式欺骗这些系统的全新研究。研究人员提出了一个大胆的问题:如果我们不隐藏真相,而是先告诉机器人真相,紧接着立刻告诉它为什么这个真相是错误的,会发生什么?以往大多数诡计试图在不提及正确答案的情况下低声诉说错误答案,因为担心提到真相会唤醒机器人的记忆并破坏诡计。但本文的作者发现,这种担忧可能是没必要的。他们创建了一个“被投毒”的文档,明确写道:“你可能认为答案是 X,但这其实是个错误!真正的答案是 Y,以下是为什么 Y 更好的原因。”他们将此称为 DenialRAG

该研究针对八种不同的机器人大脑(大语言模型)和三种不同类型的问题测试了这个想法。他们发现,这种“否定真相”的策略极其有效,尤其是在某些模型上。事实上,在某些系统中,它的效果比他们尝试过的任何其他诡计都要好,在特定测试中的成功率高达 94%。研究人员还尝试使用五种不同的安全网来阻止这种攻击,比如要求机器人保持怀疑精神或重写问题。虽然这些安全网有所帮助,但它们并未完全阻止攻击;“DenialRAG”诡计在许多情况下仍然奏效,导致机器人给出错误答案的可能性依然显著。

论文指出,成功的秘诀不仅在于撒谎,更在于冲突。通过在同一个段落中放入正确答案和错误答案,并让争论向错误答案倾斜,这种“毒素”就变成了一个自洽的故事,让机器人难以忽视。研究还表明,并非所有机器人都同样容易受骗。较小、较便宜的模型很容易被愚弄,而最新、最强大的模型则较难被欺骗,尽管并非不可能。研究人员总结道,并没有一种单一的“魔法护盾”可以阻止所有的这类攻击。相反,危险程度在很大程度上取决于攻击是如何编写的,以及哪个机器人正在阅读它。这提醒我们,在人工智能时代,图书馆里的哪怕一句话,都能改变机器人讲述的故事。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →