Combating Knowledge Corruption in Agent Systems: A Byzantine-Tolerant Secure Collaborative RAG Framework
本文介绍了 SecureCollaRAG,这是一个具有拜占庭容错能力的协作式 RAG 框架,它利用多源知识验证和基于动态图神经网络(GNN)的可信度评分,在非独立同分布(non-IID)数据分布下,安全地验证文档溯源并防止知识篡改攻击,同时保持领域知识的完整性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在向一个超级聪明的机器人图书管理员寻求真相。这个机器人被称为大语言模型(LLM),它读过几乎所有被写下的文字,但它有时会编造事实或忘记近期的事件。为了解决这个问题,我们构建了一个名为 RAG(检索增强生成)的系统。把 RAG 想象成在机器人回答你的问题之前,先给它一叠新鲜且相关的书籍,这样它就可以引用事实,而不是靠猜测。但问题在于,如果有一个狡猾的反派潜入图书馆,把书中的几页换成了谎言怎么办?如果机器人相信了那些假页面,它就会告诉你月亮是由奶酪组成的,或者某种危险的药物是安全的。这被称为“知识污染”攻击。你即将阅读的这篇论文正是在应对这个可怕的问题,它在探讨:当我们从许多不同的、有时甚至可疑的图书馆获取书籍时,我们该如何阻止机器人相信那些骗子?
这篇论文的作者赵其望(Zhaoqi Wang)及其团队提出了一种聪明的全新盾牌,名为 SecureCollaRAG。他们意识到,如果你向五个不同的图书馆询问同一个事实,其中四个说“天空是蓝色的”,而一个说“天空是绿色的”,你可能应该相信大多数人的意见。然而,事情并不总是那么简单。有时候,骗子隐藏得非常巧妙,使他们的假页面看起来几乎与真实的页面一模一样,或者他们可能只是在极微小、微妙的细节上撒谎。
为了解决这个问题,该团队构建了一个像超级组织严密的侦探小队一样的系统。该系统不仅仅是阅读书籍,它还会观察书籍之间是如何相互关联的。想象一下,这些文档就像是在参加派对的人。系统会在谈论相似话题的人之间画出隐形的线。如果一群骗子试图传播一个假故事,他们都会向彼此低声诉说着同样的胡言乱语,从而形成一个与派对其他部分格格不入的奇怪、紧密的圈子。该系统使用一种特殊的数学工具——“图神经网络”(你可以把它想象成一个超级智能的模式识别器)来识别这些可疑的圈子。它会给每一份文档一个“可信度评分”,就像是一个信任等级。如果一份文档的评分太低,它会在机器人图书管理员看到它之前就被踢出去。
研究人员不仅构建了这个系统,还用一些非常棘手的反派对其进行了测试。他们甚至发明了一种新型攻击,称为“自适应篡改攻击”(ATA)。这就像是一个反派,他不仅仅是粘贴一张假页面,而是利用机器人自己的大脑来帮助他写出一个听起来完全自然、且每次都会略有变化的谎言,从而使其难以被抓获。尽管有这些阴险的手段,SecureCollaRAG 仍展示了它能够识破伪装的能力。在测试中,当旧方法让坏人的成功率接近 80% 时,新系统在许多情况下能将攻击者的成功率降至个位数(例如 5% 或更低)。
论文指出,通过使用这种“拜占庭容错”(这是一个表示“即使我们的某些助手是叛徒,我们也能应对”的专业术语)的方法,我们可以确保即使 AI 系统是从许多不同的、不受信任的来源获取信息时,依然保持安全。这有点像拥有一名保安,他不只是检查身份证,还会观察人们之间的互动,确保即使房间里有少数间谍,真相最终仍会胜出。作者们通过数学证明,只要坏人占总来源的数量不到一半,他们的系统就能过滤掉谎言并保持机器人的诚实。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。