← 最新论文
🤖 AI

Combating Knowledge Corruption in Agent Systems: A Byzantine-Tolerant Secure Collaborative RAG Framework

本文介绍了 SecureCollaRAG,这是一个具有拜占庭容错能力的协作式 RAG 框架,它利用多源知识验证和基于动态图神经网络(GNN)的可信度评分,在非独立同分布(non-IID)数据分布下,安全地验证文档溯源并防止知识篡改攻击,同时保持领域知识的完整性。

原作者: Zhaoqi Wang, Daqing He, Zijian Zhang, Ye Liu, Jiamou Liu, Zhirui Zeng, Zhan Qin, Zhen Li, Xin Li, Hongwei Yao, Jincheng An, Yong Liu, Yi Li, Qi Sun, Xiulei Liu, Liehuang Zhu

发布于 2026-08-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhaoqi Wang, Daqing He, Zijian Zhang, Ye Liu, Jiamou Liu, Zhirui Zeng, Zhan Qin, Zhen Li, Xin Li, Hongwei Yao, Jincheng An, Yong Liu, Yi Li, Qi Sun, Xiulei Liu, Liehuang Zhu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在向一个超级聪明的机器人图书管理员寻求真相。这个机器人被称为大语言模型(LLM),它读过几乎所有被写下的文字,但它有时会编造事实或忘记近期的事件。为了解决这个问题,我们构建了一个名为 RAG(检索增强生成)的系统。把 RAG 想象成在机器人回答你的问题之前,先给它一叠新鲜且相关的书籍,这样它就可以引用事实,而不是靠猜测。但问题在于,如果有一个狡猾的反派潜入图书馆,把书中的几页换成了谎言怎么办?如果机器人相信了那些假页面,它就会告诉你月亮是由奶酪组成的,或者某种危险的药物是安全的。这被称为“知识污染”攻击。你即将阅读的这篇论文正是在应对这个可怕的问题,它在探讨:当我们从许多不同的、有时甚至可疑的图书馆获取书籍时,我们该如何阻止机器人相信那些骗子?

这篇论文的作者赵其望(Zhaoqi Wang)及其团队提出了一种聪明的全新盾牌,名为 SecureCollaRAG。他们意识到,如果你向五个不同的图书馆询问同一个事实,其中四个说“天空是蓝色的”,而一个说“天空是绿色的”,你可能应该相信大多数人的意见。然而,事情并不总是那么简单。有时候,骗子隐藏得非常巧妙,使他们的假页面看起来几乎与真实的页面一模一样,或者他们可能只是在极微小、微妙的细节上撒谎。

为了解决这个问题,该团队构建了一个像超级组织严密的侦探小队一样的系统。该系统不仅仅是阅读书籍,它还会观察书籍之间是如何相互关联的。想象一下,这些文档就像是在参加派对的人。系统会在谈论相似话题的人之间画出隐形的线。如果一群骗子试图传播一个假故事,他们都会向彼此低声诉说着同样的胡言乱语,从而形成一个与派对其他部分格格不入的奇怪、紧密的圈子。该系统使用一种特殊的数学工具——“图神经网络”(你可以把它想象成一个超级智能的模式识别器)来识别这些可疑的圈子。它会给每一份文档一个“可信度评分”,就像是一个信任等级。如果一份文档的评分太低,它会在机器人图书管理员看到它之前就被踢出去。

研究人员不仅构建了这个系统,还用一些非常棘手的反派对其进行了测试。他们甚至发明了一种新型攻击,称为“自适应篡改攻击”(ATA)。这就像是一个反派,他不仅仅是粘贴一张假页面,而是利用机器人自己的大脑来帮助他写出一个听起来完全自然、且每次都会略有变化的谎言,从而使其难以被抓获。尽管有这些阴险的手段,SecureCollaRAG 仍展示了它能够识破伪装的能力。在测试中,当旧方法让坏人的成功率接近 80% 时,新系统在许多情况下能将攻击者的成功率降至个位数(例如 5% 或更低)。

论文指出,通过使用这种“拜占庭容错”(这是一个表示“即使我们的某些助手是叛徒,我们也能应对”的专业术语)的方法,我们可以确保即使 AI 系统是从许多不同的、不受信任的来源获取信息时,依然保持安全。这有点像拥有一名保安,他不只是检查身份证,还会观察人们之间的互动,确保即使房间里有少数间谍,真相最终仍会胜出。作者们通过数学证明,只要坏人占总来源的数量不到一半,他们的系统就能过滤掉谎言并保持机器人的诚实。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →