Addressing Corpus Knowledge Poisoning Attacks on RAG Using Sparse Attention
本文引入了稀疏文档注意力检索增强生成(SDAG),这是一种采用块稀疏注意力机制来防止检索增强生成系统中有害跨文档交互的新型防御机制,从而显著缓解了语料库知识投毒攻击,并优于现有的最先进防御技术。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代人工智能的版图中,大型语言模型充当着人类知识的庞大仓库,能够以惊人的流利度回答问题并生成文本。然而,这些模型存在一个局限性:它们的训练数据在某个时间点停止了,这意味着如果没有帮助,它们无法了解最近发生的事件或特定的、小众的事实。为了解决这个问题,研究人员开发了一种称为检索增强生成(Retrieval-Augmented Generation)的系统。在这种设置下,当用户提出问题时,系统首先搜索一个庞大的文档库以寻找相关信息。随后,它将问题和这些检索到的文档一起输入给语言模型,模型利用它们作为指南来构建准确的答案。这种方法使人工智能的知识保持新鲜,并减少了它编造事实的可能性,这种问题被称为“幻觉”。然而,正是对外部文档的这种依赖创造了一个新的漏洞。因为系统信任它找到的文档,恶意攻击者可能会秘密地将虚假信息注入到文档库中。如果系统检索到了这些被投毒的文档,它可能会被误导,从而忽略真相而交付谎言。
以色列理工学院的研究人员发现,这些系统处理信息的方式存在一个特定的弱点,使其容易受到此类欺骗的影响。在标准语言模型中,允许人工智能关注文本不同部分的机制旨在让每个单词都能回顾之前的所有单词,形成一个连续的流。这在撰写故事或总结单篇文章时效果很好,因为上下文从一句话自然流动到下一句。然而,在检索系统中,输入通常是粘贴在一起的一组独立的、截然不同的文档。研究人员认为,处理这些文档的标准方法允许一个文档中的单词以一种可能产生危害的方式与另一个文档中的单词进行交互。当存在恶意文档时,其误导性的内容会影响人工智能对真实文档的理解,从而有效地毒化整个回答。
为了解决这个问题,该团队引入了一种名为“稀疏文档注意力”(Sparse Document Attention)的新型防御策略。该方法不再允许人工智能让检索集中的每个单词都看向其他所有单词,而是为文档之间创建了一个严格的边界。它迫使系统将每个检索到的文档视为一个孤立的岛屿。在单个文档内部,单词仍然可以相互引用以保持上下文,但它们被完全阻断,无法观察或受其他检索到的文档中的单词影响。这一变化仅在系统生成答案时应用,不需要重新训练底层人工智能模型,也不需要复杂的软件流水线增补。这只是对注意力规则的一次简单调整,防止了骗子与说真话者之间有害的“跨界对话”。
研究人员在多种场景下对这种方法进行了严格测试,使用了不同的问答数据集和多种类型的语言模型。他们模拟了攻击场景,即对手注入误导性文档,旨在引导人工智能走向特定的错误答案。在这些测试中,允许文档相互影响的标准系统经常中计,往往会产生攻击者预期的错误答案。相比之下,使用这种新型稀疏注意力方法的系统表现得更为稳健。它在绝大多数情况下都能成功忽略被投毒的文档,保持了回答的准确性,并大幅降低了攻击的成功率。这种提升非常显著,以至于新方法优于现有的、更为复杂的用于捕捉此类攻击的防御策略。
研究还探讨了伪造文档的位置如何影响结果。他们发现,当一个欺骗性文档的内容与真实文档非常相似时,系统抵抗其影响的难度会增加。然而,即使在这些困难的情况下,新方法依然有效。此外,研究人员发现,即使人工智能被要求解决需要结合多个文档信息的复杂问题(如多步推理问题),这种防御机制依然表现良好。虽然初始设置显示出与标准方法相比略微的性能下降,但研究人员发现,通过对模型进行简短的微调以适应新规则,可以完全恢复这种损失,从而得到一个既能抵御攻击又具有高度准确性的系统。
研究结果表明,人工智能观察其素材的方式与素材本身同样重要。通过简单地防止不同的文档相互“交谈”,系统就会变得更难被欺骗。这种方法提供了一种实用且高效的方式来保障基于检索的人工智能系统的安全,确保它们依赖于真相,而不是被房间里最具有说服力的谎言所左右。这项工作为保护这些系统建立了新标准,表明对模型处理信息方式的基础性改变,可以比添加复杂的检测工具层更加有效。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。