Retrieved But Not Reliable: A Survey on Attacks, and Defenses in Retrieval-Augmented Generation
本综述通过形式化威胁模型,将攻击分为针对准确性、隐私性和公平性目标的攻击类别,并回顾了特定阶段的防御、基准测试和可解释性方法,为检索增强生成(RAG)的鲁棒性提供了一个统一的、感知流水线的概述。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代数字化景观中,人工智能已从简单的聊天机器人演变为复杂的科研助手。这些大语言模型能够编写代码、总结复杂的报告并回答复杂的问题。然而,多年来它们一直面临着一个持久的缺陷:它们经常会极其自信地捏造事实。为了解决这个问题,工程师们开发了一种名为“检索增强生成”(Retrieval-Augmented Generation)的系统。该系统不再仅仅依赖于训练期间记忆的信息,而是首先搜索一个庞大的外部文档库,提取出最相关的实事,然后利用这些事实来构建答案。这种方法将人工智能锚定在现实之中,使其更加准确,且不易编造内容。然而,这种向外界寻求信息的机制本身也引入了一系列新的脆弱性。正如图书馆可能会被有人偷偷放入伪造书籍的行为所破坏一样,人工智能的外部知识库也可能被“投毒”,导致系统检索到虚假信息,并生成有害或错误的输出。
一项由包括胡志明市理工大学和宾夕利瓦尼亚州立大学研究人员在内的机构开展的全面新调查,绘制了这些新兴的危险以及为应对这些危险而建立的防御措施。研究团队不仅列举了攻击手段,还构建了一个统一的框架,用以理解对手是如何针对人工智能工作流的不同阶段进行攻击的。他们发现,攻击者通常追求三个主要目标:他们希望让人工智能给出错误的答案,希望诱导其泄露私人信息,或者希望放大针对特定群体的偏见。研究人员根据威胁打击的环节对这些威胁进行了分类。第一个失效点是检索过程本身,攻击者可能会注入误导性的文档,以确保人工智能找到错误的信息源。第二个是排序阶段,即系统决定哪些找到的文档更为重要;在此阶段,攻击者可能会试图提升一份伪造文档的权重,使其出现在列表顶端。第三个是生成阶段,即人工智能撰写最终回复的过程;第四个是溯源阶段,即在错误发生后尝试识别是哪份文档导致了失误。
该调查显示,最常见的攻击方法涉及“语料库投毒”,即对手将恶意文档插入外部数据库。这些文档经过精心设计,看起来像是合法的来源,但包含细微的错误或虚假陈述。当人工智能搜索答案时,它会检索到这些被投毒的文档,并将其视为真理。例如,攻击者可以注入一份声称某种特定抗生素可以治疗流感的文档,从而导致人工智能自信地给出危险的医疗建议。另一种更复杂的策略是“后门攻击”,即系统被训练或操纵,仅在存在特定的、隐藏的触发词时才会做出反应。如果用户提出的问题包含该触发词,人工智能就会忽略所有其他证据,并检索一份预先植入的恶意文档以生成有害的响应。研究人员还详细描述了“提示词注入”攻击,即恶意指令被隐藏在检索到的文档之中。一旦人工智能阅读了这份文档,它可能会将隐藏的文本解释为一条命令,要求其忽略用户的原始问题,转而泄露敏感数据或执行未经授权的操作。
除了单纯破坏系统之外,该调查还强调了这些攻击如何损害隐私和公平性。在隐私方面,攻击者可以将人工智能作为从数据库中提取机密信息的工具。通过提出精心设计的提问,他们可以诱骗系统泄露存储在文档中的个人或组织隐私细节。调查中引用的一项研究显示,在使用后门触发器时,攻击者实现泄露特定文档的成功率可高达 94%。关于公平性,研究人员发现攻击者可以通过在数据库中注入带有偏见的内容,从而使人工智能的输出产生针对特定人口统计群体的偏差。例如,通过注入将特定性别与负面特质联系起来的文档,人工智能可能会被操纵,从而生成强化有害刻板印象的响应,通过机器的视角有效地放大社会偏见。
为了应对这些威胁,研究人员审查了广泛的防御策略,每种策略都针对流程中的特定阶段。在检索阶段,防御重点在于清理数据库并提高搜索引擎的抗操纵能力,例如过滤掉低质量来源或检测文本中的异常模式。在重排序阶段,系统正在被开发用于交叉检查多份文档,并降低那些看起来可疑或与其余证据不一致的文档的权重。在生成阶段,人工智能本身正在学习变得更加具有怀疑精神,学习识别检索到的文档是否与已知事实冲突,或者文本中是否包含隐藏指令。最后,在溯源阶段,正在出现新的方法,可以追踪错误答案是由哪份特定文档引起的,从而允许开发人员精准定位并移除错误的源头。
尽管取得了这些进展,调查结论指出,该领域仍处于早期阶段,并面临着重大障碍。许多当前的防御方法都依赖于能够完全访问人工智能系统的内部运作机制,但在现实应用中,系统往往是一个“黑盒”,很难实现这一点。此外,攻击的有效性与隐蔽性之间存在着不断的权衡:高效的攻击往往产生的文本听起来不自然,因此更容易被察觉;而隐蔽的攻击则更难执行。研究人员还指出,随着人工智能系统向处理更复杂任务(如分析数据图表或处理图像与文本结合)的方向演进,新的且不可预测的漏洞很可能会出现。前进的道路需要一个持续测试与改进的循环,以确保随着这些强大的工具越来越多地融入我们的生活,它们能够保持稳健,抵御那些试图利用它们的人。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。