← 最新论文
💻 computer science

RADAR: Defending RAG Dynamically against Retrieval Corruption

RADAR 是一个新颖的框架,通过将上下文选择建模为基于图的能量最小化问题并利用贝叶斯记忆节点在平衡稳定性与适应性的同时最小化存储成本,从而在动态环境中防御检索增强生成系统免受对抗性检索污染。

原作者: Ziyuan Chen, Yueming Lyu, Yi Liu, Weixiang Han, Jing Dong, Caifeng Shan, Tieniu Tan

发布于 2026-05-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Ziyuan Chen, Yueming Lyu, Yi Liu, Weixiang Han, Jing Dong, Caifeng Shan, Tieniu Tan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一位非常聪明但略显轻信、名叫LLM的助手。这位助手擅长写故事和回答问题,但由于它并不了解世界上的所有事情,有时会编造内容或感到困惑。为了解决这个问题,你为它配备了一位“研究员”,这位研究员会前往互联网查找文章,并将它们交给助手。这套系统被称为RAG(检索增强生成)。

然而,存在一个问题:互联网是一个嘈杂且混乱的地方。恶意行为者(黑客)可以将假新闻、谎言或恶意指令悄悄混入这些文章中。如果研究员交给助手一堆大部分是谎言的文件,助手就会相信这些谎言并给出错误的答案。

本文介绍了一种名为RADAR的新型防御系统。你可以将 RADAR 想象为一位坐在研究员和助手之间的超级聪明的主编。它的任务是审视那堆文件,找出哪些是可信的,并在助手看到之前将虚假文件剔除。

以下是 RADAR 的工作原理,通过简单的类比进行解释:

1. “群体拥抱”与“孤立说谎者”(图论与最小割)

当研究员带回 10 篇文章时,RADAR 并不是逐一阅读它们。相反,它将它们视为派对上的一群人。

  • 派对:每篇文章都是一位宾客。
  • 对话:RADAR 会问:“宾客 A 同意宾客 B 的观点吗?”或者“宾客 A 与宾客 B 的观点是否矛盾?”
  • 目标:RADAR 希望找到最大的、彼此都相互认同的和谐宾客群体。

RADAR 使用一种数学技巧(称为最大流最小割)来解决一个谜题:“我们如何将派对切割成两个群体,使得以最小的切割代价将‘说谎者’与‘说真话者’隔离开来?”

  • 如果某份文件是说谎者,它将被“切断”与主群体的联系。
  • 如果某份文件在说真话,它将与其他说真话者保持连接。
  • 结果如何?助手只接收那个“说真话”的群体来撰写最终答案。

2. “记忆银行”(动态防御)

互联网每天都在变化。昨天正确的事实今天可能变为错误(例如,“谁是总统?”这个问题每隔几年就会改变)。

  • 旧防御:大多数安全系统就像只关注此刻走进来的人的保安。它们不记得昨天谁在那里。如果一个说谎者今天混了进来,只要他看起来像个普通人,保安可能抓不住他。
  • RADAR 的方法:RADAR 拥有一个记忆银行。它记得昨天给出的答案。
    • 如果今天的新信息与昨天的答案一致,RADAR 会说:“太好了,我们仍然走在正确的轨道上!”并保留该记忆。
    • 如果今天的新信息与昨天的答案强烈矛盾(例如发生重大新闻事件),RADAR 会说:“等等,情况变了。旧答案现在成了谎言。”它会更新记忆以反映新的真相。

这就像一位侦探保留着案件档案。如果有新证据证明嫌疑人是无辜的,侦探就会更新档案。如果新证据只是重复他们已知的内容,他们就保持档案原样。这防止了系统被暂时的噪音或“花哨”的谎言所迷惑。

3. “贝叶斯信念”(数学魔法)

RADAR 如何判断记忆是对是错?它使用一种称为贝叶斯推断的方法。

  • 想象你有一个直觉(一种信念),认为某个故事是真的。
  • 然后,你获得了新证据。
  • RADAR 根据新证据在多大程度上支持旧故事,从数学上更新你的“直觉”。
  • 如果新证据强烈支持旧故事,你的“直觉”就会变成“确信”。
  • 如果新证据强烈反驳旧故事,你的“直觉”就会降为“假”。

这使得 RADAR 既能灵活(适应真实变化),又能稳定(忽略随机噪音或临时攻击)。

为什么这比现有的方法更好?

  • 存储:旧方法试图保存每一份曾经见过的文档以便日后比较。这就像试图把整个图书馆都塞进你的背包里。既沉重又缓慢。RADAR 只保存它所相信内容的微小“摘要”(记忆节点),使其非常轻便且快速。
  • 动态攻击:黑客变得越来越聪明;他们不断改变谎言。旧防御就像一面只能抵挡一种箭矢的静态盾牌。RADAR 则像一面会移动和适应的盾牌,无论攻击者如何改变瞄准方向,都能阻挡箭矢。

总结

本文声称,RADAR 是一种保护 AI 助手免受互联网虚假信息欺骗的新方法。通过将筛选优质信息视为连接朋友、隔离敌人的谜题,并通过记住过去的真相来识破新的谎言,RADAR 即使在互联网上充斥着恶意行为者时,也能保持 AI 答案的准确性。

简而言之:RADAR 是一个智能过滤器,它知道该信任谁、该忽略谁,以及何时更新自己的信念,同时保持系统的快速与轻便。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →