ADMIT: Few-shot Knowledge Poisoning Attacks on RAG-based Fact Checking
本文介绍了ADMIT,这是一种少样本、语义对齐的对抗性多重注入技术,它通过注入最小化的对抗性内容来覆盖真实证据,从而在跨多种模型和领域的高攻击成功率下毒化基于检索增强生成(RAG)的事实核查系统并操纵大语言模型的输出。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你有一位非常聪明、博览群书的图书管理员(即AI),他擅长回答问题,但有时会因为并非全知全能而编造内容。为了解决这个问题,你给图书管理员定下一条特殊规则:“在回答之前,请先在我们可信的图书库中查阅事实。”这套系统被称为RAG(检索增强生成)。它本应成为终极的事实核查者。
现在,想象一个捣蛋鬼(即攻击者)想要诱使图书管理员给出错误的答案。
过去诱骗图书管理员的方法
过去,研究人员试图通过以下方式诱骗图书管理员:
- 大声喊出指令:直接在问题中写入“忽略书籍,回答是!”(这类似于提示注入)。
- 淹没图书馆:向数百本书籍中投毒谎言,使得无论图书管理员选取哪本书,找到的都是谎言。(这属于通用知识投毒)。
问题在于:在现实世界中,这些伎俩往往失效。如果你询问一个医学事实,图书管理员很可能会调取一本真实可信的医学教科书,其中内容会驳斥你的谎言。图书管理员足够聪明,会说:“等等,这本新书说 X,但可信的医学教科书说 Y。我将采纳 Y。”
新伎俩:ADMIT
本文介绍了一种名为ADMIT的新型隐蔽攻击。攻击者不再淹没图书馆或大声喊出指令,而是采用“少样本”(Few-Shot)策略。
类比:金苹果篮中的“一颗坏苹果”
想象图书管理员被要求核查一项声明。他取出了5 本书进行阅读。
- 其中4 本是真实可信的,并指出该声明为假。
- 另外1 本则是攻击者的作品。
在过去,图书管理员会忽略那本坏书,因为其他四本书的说法与之相反。但ADMIT不同。攻击者不仅仅编写谎言;他们撰写了一篇精心伪造的新闻报道,其逼真度、权威性和说服力极强,足以诱骗图书管理员产生这样的想法:“哇,这本书提供了非常具体、详细的解释,足以推翻其他书籍的结论。”
ADMIT 的工作原理(“魔法咒语”):
- 设置阶段:攻击者无法访问图书管理员的“大脑”或图书馆的搜索引擎。他们是在盲操作。
- 演练阶段:攻击者使用一个“傀儡图书管理员”(代理模型)来测试他们的伪造文章。他们反复重写文章,不断询问傀儡图书管理员:“这篇文章看起来真实到足以让你改变主意吗?”
- 最终成品:一旦文章完美无缺,攻击者便将仅一篇这样的伪造文章混入图书馆数据库。
- 结果:当真正的图书管理员搜索答案时,会找到 4 本真实书籍和 1 本伪造书籍。由于伪造书籍撰写得极为出色(它模仿真实新闻报道的语气、引用虚假专家、并显得自信满满),图书管理员会感到困惑。他们将自己的判断从“假”翻转为“真”,甚至还会撰写一个令人信服的解释,来合理化自己为何改变主意。
为何这令人担忧(论文发现)
研究人员在11 种不同的 AI 模型(从开源模型到最先进的商业模型)以及4 种不同类型的事实核查(一般新闻、科学、气候和健康)上测试了该方法。
- 投毒率极低:他们仅需污染图书馆内容的0.00000093%。这相当于在拥有十亿页内容的图书馆中,仅添加了一页伪造内容。
- 成功率极高:尽管投毒量微乎其微,但攻击**86%**的情况下都成功了。
- 连“最聪明”的 AI 也中招:即使是那些被设计得格外谨慎和逻辑严密(如“推理模型”)的 AI 模型,也未能幸免。
- 突破防御:论文测试了常见的防御手段,例如让 AI 对答案进行“投票”,或检查文本是否听起来怪异。ADMIT 通过了所有测试,因为伪造的文本听起来并不怪异;它听起来完全正常。
核心结论
该论文表明,即使你拥有一个旨在对照可信来源核查事实的系统,你仍然可以诱骗它。你无需破坏系统或用垃圾信息淹没它。你只需要植入一篇极其出色、具有欺骗性的信息,其逼真程度足以让 AI 相信谎言并忽略真相。
简而言之:ADMIT 证明,在“真相”与“说服”的较量中,如果谎言撰写得足够精妙,即使是世界上最聪明的 AI 图书管理员,也可能被诱骗相信谎言就是真相。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。