When Context Bites: Detecting RAG Poisoning via Document-Level Attention Collapse
本文介绍了 D-SCAN,这是一个轻量级检测框架,它通过监测文档级注意力塌陷(即随着模型聚焦于对抗性文档,注意力熵度降低的独特特征)来识别 RAG 投毒攻击,从而克服了现有输出侧检测方法的局限性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代人工智能的版图中,大型语言模型充当着人类知识的庞大图书馆,能够以惊人的流畅度回答问题并生成文本。然而,这些模型存在一个盲点:除非被告知,否则它们本质上并不了解最新的事实或世界的具体细节。为了解决这个问题,开发者使用了一种称为“检索增强生成”(retrieval-augmented generation)的系统。可以将这个过程想象成一名学生在进行开卷考试;计算机首先在数据库中搜索相关的文档,将它们输入给模型,然后要求模型根据这些新信息编写答案。这种方法使机器能够获取最新的事实,但也为麻烦打开了大门。如果攻击者将一份精心设计的虚假文档混入数据库,模型可能会阅读它、相信它,并利用它来构建一个有害或错误的答案。这被称为“投毒攻击”(poisoning attack),在法律和医学等高风险领域,它构成了严重的风险,因为一个错误的事实就可能产生现实世界的后果。
长期以来,试图捕捉这些攻击的研究人员一直观察计算机生成的最终答案。他们希望通过检查答案是否听起来不确定或是否自相矛盾来发现谎言。普遍观点认为,当模型感到困惑或产生幻觉时,它的语气会显得犹豫,就像人在猜测一样。然而,来自悉尼科技大学和北京大学的一个研究小组发现,这一假设是极其危险且错误的。他们发现,当模型被投毒文档成功欺骗时,它不仅不会表现出困惑,反而会显得比平时更加自信。攻击者设计这些伪造文档时非常完美,以至于模型变得“盲目自信”,对错误答案分配的概率甚至高于它对正确答案的概率。这意味着,依赖于检测不确定性或不一致性的传统方法通常是徒劳的,因为模型并非不确定,而是深信自己是正确的。
为了解决这个问题,研究人员不再关注最终的文本,而是开始观察机器在思考时其内部的运作情况。他们检查了模型在阅读不同文档时是如何分配注意力的。在正常、健康的阅读过程中,模型会将注意力分散到多个文档上,权衡来自每个文档的证据,以构建一个完整的图景。研究人员发现,当发生投毒攻击时,这种行为会发生剧烈变化。模型停止关注其他文档,几乎完全专注于那份被投毒的单一文件。他们将这种现象称为“注意力坍缩”(attention collapse)。这就像模型的目光被劫持了,锁定在恶意信息上并忽略了其他一切。即使攻击未能改变最终答案,这种情况也会发生,这使其成为一个可靠的早期预警信号,表明出了问题。
基于这一发现,该团队开发了一种名为 D-SCAN 的新检测工具。该系统旨在轻量化且快速地监控模型工作的内部注意力模式。D-SCAN 不会等待看到最终答案是否错误,而是监测模型注意力坍缩到单个文档上的那个特定时刻。在测试中,研究人员使用了三组不同的复杂问题,发现他们的新方法在识别攻击方面远优于现有技术。虽然其他工具难以区分真实答案与虚假答案,但 D-SCAN 能够一致地识别出投毒尝试。或许最重要的一点是,即使攻击未能成功改变最终输出,该工具依然有效。这表明,模型被劫持的行为是一个独立于最终结果之外的独特特征。
这项研究还揭示了一个关于模型规模的惊人细节。人们可能会假设,更大、更强大的计算机会更擅长识破诡计,但研究人员发现事实恰恰相反。较小的模型实际上更擅长检测毒素,而最大的模型似乎更容易被愚弄。这表明,使这些大型模型如此出色地遵循指令的训练过程,可能也让它们过于信任所接收到的文档。通过关注注意力如何分布的内部机制,而非表层的文本,研究人员提供了一种保护这些系统的新方法。他们的工作表明,要保护人工智能,我们不仅要理解它说了什么,还要理解它是如何思考的。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。