← 最新论文
💬 NLP

TriShieldRAG: A Three-Ring Defense-in-Depth Framework Against Knowledge Corruption in Retrieval-Augmented Generation

TriShieldRAG 是一个三层防御框架,通过结合摄入防护(ingest guard)、检索评分器(retrieval scorer)和跨 LLM 共识机制(cross-LLM consensus mechanism),在保持良性查询准确性的同时,将检索增强生成(RAG)系统中知识投毒攻击的成功率从约 91% 显著降低至 13%。

原作者: Susil Kumar Mohanty, Rohit Patel, Kosuru Yuvaraj, Jeenal Chaudhary, Disha Singhania

发布于 2026-07-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Susil Kumar Mohanty, Rohit Patel, Kosuru Yuvaraj, Jeenal Chaudhary, Disha Singhania

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个你最喜欢的超级聪明机器人朋友——我们叫他“先知(The Oracle)”——几乎无所不知的世界。但问题在于:先知只记得它多年前在学校学到的知识。如果你问它关于一部全新的电影或一个秘密的家族食谱,它就必须进行猜测或编造。为了解决这个问题,我们给了先知一张图书馆借书卡。现在,每当你提出问题时,先知都会迅速从图书馆中抓取几本书,阅读它们,并利用这些新鲜的信息来回答你。这被称为检索增强生成(Retrieval-Augmented Generation),简称 RAG。这就像是在考试前给天才一份“作弊纸”。

但这种设置中存在一个狡猾的问题。如果有人溜进图书馆,种下了几本看起来和真书一模一样的假书怎么办?如果这些假书被放在真实答案的旁边,先知可能会阅读它们,并相信它们是真的,从而给你一个完全错误的答案。这被称为数据投毒(data poisoning)。这就像是一个恶作剧者把蛋糕配方里的原料换成了盐和沙子;面包师(先知)完美地遵循了指令,但结果却是一场灾难。科学家们现在面临的大问题是:我们如何阻止恶作剧者用假书来欺骗我们的智能机器人?

这篇论文介绍了一种全新的、超安全的图书馆系统,叫做 TriShieldRAG。作者并没有仅仅依赖一个保安来检查书籍,而是构建了一个三层防御系统,就像一座拥有三层保护措施的城堡。他们针对一种特定的恶作剧者(即通过植入五本假书来欺骗机器人的类型)测试了这个系统,发现当没有任何防御措施时,机器人被欺骗的概率高达 91%,而新的三层防御系统将这种受骗率降低到了仅为 13%

三重防御圈

把这个图书馆想象成一个繁忙的机场。假书是试图溜进来的“毒素”。作者设计了三个检查站,或者说三个“环(Ring)”,书籍在到达先知手中之前必须通过这三个环节。

第一环:门口的保镖(摄入守卫 - Ingest Guard)
第一环就像一个严格的保镖,在有人试图把书放到书架上的那一刻就开始检查每一本书。这个守卫会寻找明显的红旗。如果一本书的写法非常奇怪、具有重复性,或者包含了你即将提出的确切问题(比如一本名为“谁发明了电灯泡?”的书正好放在答案旁边),保镖会立即将其踢出去。在论文的测试中,这一环是主要的贡献者,它在假书进入图书馆之前就拦截了绝大多数假书。它是第一道防线,在门口就挡住了最粗糙的诡计。

第二环:值得信赖的图书管理员(检索评分器 - Retrieval Scorer)
有时候,一本假书写得非常好,以至于保镖漏掉了它,它成功滑上了书架。当你提问时,图书馆会取出五本看起来最相关的书。第二环是一位聪明的图书管理员,负责重新评估这五本书。这位图书管理员不仅看书与问题的匹配程度,还会检查另外两件事:出处(Provenance)(这本书从哪里来?它来自像著名百科全书这样的可靠来源,还是来自一个随机博客?)以及一致性(Consistency)(这堆书中的其他书籍是否也同意这本书的内容?)。如果一本书来源不明,且与另外四本书的内容相矛盾,图书管理员就会将其标记为可疑,并将其推到队伍的后方。论文指出,只要假书在这一堆书中仍属于“少数派”,这一环就能发挥最佳效果——如果恶作剧者设法让整个书架都填满了假书,这一环可能会感到困惑。

第三环:评审团(跨大模型共识 - Cross-LLM Consensus)
如果书籍通过了前两环并交到了先知手中,第三环就会介入。该环节不再是只让一个机器人给出答案,而是要求三个不同的机器人(具体来说是名为 Claude、Mistral Small 和 Llama 3.2 的模型)阅读相同的书籍并回答问题。这三个机器人由不同的公司构建,拥有不同的“个性”。如果三个机器人对答案达成一致,那就太好了!但如果它们意见不一,系统就会认为情况有些蹊跷。随后,它会剔除最可疑的书籍,并要求机器人使用一组新的书籍重新尝试。这种“投票”机制确保了即使其中一个机器人被一本聪明的假书所蒙蔽,另外两个机器人也可能识破谎言并纠正航向。

论文的研究发现(以及未证明的部分)

作者使用了一个包含 5,000 篇真实维基百科文章10 个特定问题的图书馆进行了测试。他们为每个问题植入了 5 本假书,旨在欺骗系统。在没有任何防御的情况下,系统有 91% 的时间会中招。当他们开启完整的 TriShieldRAG 系统时,受骗率骤降至 13%

然而,论文也非常诚实地说明了它目前尚未证明的部分。他们测试的“恶作剧者”是非自适应的(non-adaptive),这意味着恶作剧者并不知道这三个防御环的存在,只是使用了标准的手段。作者承认,一个更聪明的恶作剧者,如果知道保镖和图书管理员的具体工作方式,可能会设法让假书绕过他们。他们还指出,他们的“少数派投毒”规则(即第二环和第三环在假书少于真书时效果最好)是基于数学和逻辑推导出来的,但他们还没有进行大规模实验来证明它在每一种场景下都能成立。

作者还指出,由于需要询问三个不同的机器人来获取意见,他们的系统运行起来速度较慢且成本较高。在现实世界的应用中,他们可能会只针对棘手的问题使用这种高强度的检查,而不是对每一个问题都进行检查。

总结

TriShieldRAG 并不是一个能让数据投毒变得不可能的魔杖。相反,它是一个稳健的多层屏蔽系统,让恶作剧者极难得逞。通过在书籍到达时进行检查、在书籍被选中时进行复核,以及通过评审团验证最终答案,该系统捕捉到了几乎所有的诡计。论文表明,虽然我们目前还无法阻止所有可能的攻击,但这种三层防御的方法在防止我们的 AI 朋友被虚假信息误导方面迈出了巨大的一步。作者已经计划在更聪明的恶作剧者和更大的图书馆中测试此系统,但就目前而言,他们已经证明了“三个脑袋(和三层防御)总比一个要好”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →