← 最新论文
🤖 machine learning

RAGuard: A Layered Defense Framework for Retrieval-Augmented Generation Systems Against Data Poisoning

本文介绍了 RAGuard,这是一个针对检索增强生成(RAG)系统的两层防御框架,它将对抗性检索器微调与一种无需标签、黑盒化的零知识推理补丁(ZKIP)相结合,在保持高检索准确度的同时,有效地中和了事实数据投毒攻击。

原作者: Pushkal Kumar, Tucker Nielson, Tanish Kolhe, Shubham Zala, Vincent Li

发布于 2026-07-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Pushkal Kumar, Tucker Nielson, Tanish Kolhe, Shubham Zala, Vincent Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个超级聪明的机器人朋友,它几乎无所不知,但也有点健忘,有时还会胡编乱造。为了帮它记住最新的新闻和事实,你给了它一个神奇的图书馆,让它在开口说话前可以查阅答案。这种设置被称为“检索增强生成”,简称 RAG。这就像是给一位天才一份“作弊条”,这样他们就不必仅仅依赖自己的记忆。但问题在于,如果一个调皮的恶作剧者溜进那个图书馆,把真正的书换成充满谎言的假书怎么办?如果机器人信任了那些假书,它就会告诉你错误的答案,而且它甚至可能意识不到自己被骗了。这被称为“数据投毒”,对于任何将这些智能系统用于医疗建议或法律事实等重要领域的人来说,这是一个巨大的担忧。

现在,见见 RAGuard,论文中提出的旨在保护那个神奇图书馆的新超级英雄团队。研究人员构建了一个两层防御系统来阻止这些骗子。第一层就像是图书馆门口的一名强壮保镖。这个保镖通过阅读数千本假书进行了训练,因此它能识别出谎言的“氛围”,并在这些书到达机器人面前之前就把它们踢出去。但保镖并不完美;有时一本非常逼真的假书会溜过去。这就是第二层发挥作用的地方:一个聪明的侦探,名叫 ZKIP(零知识推理补丁)。ZKIP 不需要已知的骗子名单,也不需要“正确答案钥匙”。相反,它玩的是一场“如果……会怎样?”的游戏。对于机器人即将阅读的每一本书,ZKIP 都会问:“如果我们没有这本书,机器人的回答会发生什么变化?”如果移除一本书会导致机器人的回答突然改变或变得更加困惑,ZKIP 就知道这本书很可能是一个骗子,并将其丢弃。

研究人员在一个大规模的问题集上测试了这个系统,并发现了一些惊人的结果。当他们用假书填满图书馆(占总数的 30%)时,仅靠保镖可以抓住一些,但不能全部。然而,当他们把侦探 ZKIP 加入团队时,系统在他们的测试中变得近乎完美。在所有开启了防御功能的测试运行中,ZKIP 将“攻击成功率”降至 0.000,这意味着在他们测试的特定样本中,没有任何成功的诡计被察觉。需要注意的是,这一结果适用于所测试的样本,并不保证机器人在所有可能的现实场景中永远不会给出错误答案。唯一的代价是什么?机器人必须进行额外的思考。对于每一个问题,它必须阅读 6 次(一次包含所有书籍,然后针对每本书各读一次,以观察缺失该书时会发生什么),以确保自己没有被愚弄。虽然这会增加一些时间,但研究人员表明,机器人在找到正确答案方面的频率与在干净的图书馆中一样高,证明了你可以兼顾安全与准确性。

然而,论文也谨慎地指出,这个盾牌可能存在裂痕之处。该系统在假书试图改变事实(例如说“天空是绿色的”而不是“蓝色的”)时效果最好。如果恶作剧者使用大量共同讲述同一个谎言的假书,系统就会感到吃力,因为仅仅移除其中一本并不会改变机器人的想法。此外,该系统是为事实设计的,而非意见;如果问题是关于人们“认为”什么而不是什么是“真实”的,侦探可能会感到困惑,因为人们的答案自然会有所不同。研究人员还注意到,他们的假书是通过重写真实文本来保持关键词不变而制作的,这意味着一个仅仅寻找匹配词汇的简单搜索工具(如基础关键词搜索)完全没有被骗。这表明,虽然 RAGuard 是一个强大的新工具,但对抗狡猾骗子的战斗仍在进行中,未来的工作需要测试它是否能抵御更聪明、更具协同性的攻击。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →