CiteShade: Citation Laundering in Multi-Source Retrieval-Augmented Generation and Its Counterfactual Defense
本文介绍了 CiteShade,一种针对检索增强生成(RAG)系统的创新攻击手段,该攻击通过操纵模型生成错误答案并将其错误地归因于可信来源,并提出了一种反事实防御机制,用于验证引用的真实因果驱动因素。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代数字领域,人工智能系统正越来越多地承担着通过搜索海量文档库来回答复杂问题的任务。这个过程被称为检索增强生成(RAG),就像一个允许在考试时翻阅教科书的学生一样。与其仅仅依赖可能过时或容易产生幻觉的内部记忆,该系统会调取数据库中相关的页面,并利用它们来构建答案。为了确保透明度,这些系统被设计为能够引用其来源,即为每一个说法附上支持该说法的特定文档的引用。对于用户而言,这种引用就像是一张收据,一种验证信息来自可靠之处而非机器想象的方式。其背后的基本假设很简单:如果系统指向了一个来源,那么该来源必然是真正说服机器给出该答案的依据。
香港城市大学的一位研究人员发现,这一假设极其脆弱。他们发现了一种欺骗这些系统的新方法,这种方法不是通过改变答案本身,而是通过劫持“收据”。他们的研究表明,攻击者可以控制数据库中的单个文档,操纵系统产生一个完全错误的答案,同时将责任推给另一个并不包含该错误证据的、受信任的文档。研究人员将此称为“引用洗白”(citation laundering)。这是一种隐蔽的欺骗形式,因为错误看起来是合法的,因为它得到了用户信任的引用的支持,尽管错误的真正起因在于用户从未看到的隐藏恶意来源。
研究人员通过建立一个涉及多个文档和一系列需要结合不同来源信息的难题的受控实验,展示了这一漏洞。在标准的、安全的情景下,系统会阅读可用文档,找到正确的事实,并引用持有这些事实的文档。然而,当研究人员在其中引入一个精心设计的恶意文档时,系统的行为发生了剧烈变化。这个恶意文档并不试图删除正确的信息或阻碍系统寻找真相。相反,它的写法极具说服力,以至于系统会采纳其错误的说法作为答案。至关重要的是,该文档的结构也利用了系统选择引用源时的特性。
系统选择引用的方法并非对哪个文档导致了答案的完美反映。相反,它受到文档在列表中的位置以及附加在它们身上的特定标记或标签的影响。研究人员发现,通过将恶意文档放在特定位置,并添加一个微妙的句子来呼应一个受信任且无辜文档的标签,他们可以迫使系统引用那个无辜的文档。结果是一个“洗白”后的引用:系统给出了一个由坏文档驱动的错误答案,但用户看到的却是指向好文档的引用。在测试中,这种技术将错误答案率从微不足道的 1% 提升到了近 70%。在最脆弱的系统中,这种攻击成功的案例超过了 90%,证明了这一缺陷并非罕见的故障,而是这些系统如何将答案与来源联系起来的一个根本性弱点。
这项发现之所以特别令人担忧,是因为这种攻击不需要在文本中隐藏任何复杂的指令或命令。恶意文档读起来就像一篇正常的百科全书条目,将一个虚假事实陈述为既定事实,随后又用一句话随口提及那个受信任的来源。系统遵循其自然模式,捕捉到这种措辞和文本的位置,从而生成引用。研究人员表明,这种漏洞与系统的引用意愿相关,而非与其整体规模或智能程度相关。那些最擅长提供准确、有据可查答案的模型,实际上最容易受到这种技巧的影响,因为它们才是最倾向于生成引用的模型。一个从不提供引用的系统无法被诱导进行引用洗白,但它也无法被人类读者审计。
为了理解问题的深度,研究人员测试了一种防御机制,即简单检查引用的文本是否支持该主张。这是目前用户和自动化工具验证信息的一种标准方式。他们发现,这种防御在面对“引用洗白”时完全失效。因为系统指向了那个受信任的文档,而该文档确实存在且与主题相关,所以检查通过了。系统并不是在谎报受信任文档的内容,它是在谎报究竟是哪个文档导致了该答案。受信任的文档是无辜的,但它被用作恶意文档的盾牌。研究人员通过从上下文中移除恶意来源并观察系统是否恢复到正确答案,证实了恶意来源才是错误答案的真正驱动者,证明了该引用只是一个红鲱鱼(误导信息)。
该研究还探讨了仅仅过滤掉奇怪或混乱的文本是否能阻止攻击。他们发现,由于恶意文档的写作风格听起来像是自然的、专业的散文,因此它们能够避开旨在捕捉明显错误或奇怪措辞的过滤器。可靠检测这种特定类型欺骗的唯一方法是观察来源与答案之间的因果联系,不仅要问“这个来源是否支持该主张?”,还要问“这个来源是否真的导致了该主张?”研究人员提出了一种新的防御方法,通过模拟逐一移除每个来源的过程,来观察哪一个才是真正负责输出的来源。虽然这种方法在计算上更为昂贵,但它是看穿“洗白”的唯一途径。
这项工作的意义不仅限于学术好奇。随着人工智能越来越多地融入新闻、研究和决策领域,对引用的信任成为了一个关键的安全特性。如果这一特性可以被操纵,那么整个审计追踪都将变得不可靠。研究人员表明,这不仅是一个理论风险,也是一个可以用相对简单的工具执行的实际风险。他们展示了这种攻击在不同类型的问题和不同的模型上都能奏效,表明该问题具有普遍性。最有效的模型——即在正常条件下最有用且最准确的模型——反而是最容易被误导去提供带有看似可信引用的错误答案的模型。
最后,论文揭示了系统“声称使用的”与“实际使用的”之间的鸿沟。引用并非机器所被说服的来源的记忆;它是机器自身解码过程的产物,受文本位置和它所看到的标签的影响。这种脱节创造了一个让攻击者可以将虚假主张隐藏在信任之名下的空间。研究人员并未发现可以通过简单的补丁或规则变更来修复此问题。相反,他们表明目前的验证信息的方法是不够的,需要一种新的方法来确保被归功的来源确实是起作用的来源。这项工作发出了一个警告:在自动化答案的时代,收据并不总是购买的凭证,而看起来最可信的证据,往往是最危险的。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。