Inference Cost Attacks for Retrieval-Augmented Large Language Models
本文介绍了一种检索增强推理成本攻击(RA-ICA),这是一种利用 LLM 智能体和一种基于记忆增强组相对策略优化算法的新型框架,旨在通过向外部知识库中注入恶意文档来污染知识库,从而在保持答案完整性的同时,显著增加 RAG 增强型 LLM 系统的 Token 消耗。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一家名为“RAG-LLM”的高端餐厅。这家餐厅之所以闻名遐迩,是因为它不仅仅依赖厨师的记忆;它拥有一支研究员团队,会在烹饪你的美食之前,瞬间奔向一座巨大的图书馆(即互联网)去寻找最鲜活的事实。这使得食物(即答案)非常准确。
然而,运行这项图书馆研究服务是非常昂贵的。餐厅老板需要按分钟支付研究员的时间费用以及运行计算机的电费。
问题所在:一种新型的“账单冲击”
论文指出,虽然这个系统很棒,但它有一个隐藏的弱点。通常,人们认为黑客可能会尝试直接欺骗厨师,比如对着厨房窗口大喊奇怪的指令(改变用户的提问)。但作者说,有一种更聪明、更阴险的方法:毒化图书馆本身。
他们将这种新威胁称为 RA-ICA(检索增强推理成本攻击)。
可以这样理解:攻击者不是对着厨师大喊大叫,而是潜入图书馆,在书架上放置了一些虚假的、令人困惑且过于复杂的书。当顾客问一个简单的问题,比如“谁是春天的女神?”时,研究员们不仅找到了正确的书,还意外地把其中一本虚假的书中也一并抓了过来。
因为这本假书写得非常刁钻,厨师不得不阅读它、重读它、与它争论,并解开其中隐藏的一个谜题,才能弄清楚那个简单的答案。厨师最终花费了比平时多出 13 倍的时间来烹饪这道菜。顾客得到了正确的答案,但餐厅老板却收到了一份巨大的、意料之外的账单。
攻击是如何运作的(“CREEP”框架)
作者构建了一个名为 CREEP(通过外部投毒导致计算资源枯竭)的工具来自动实现这一点。你可以把 CREEP 想象成一个“反派机器人”,它专门负责编写这些虚假的图书馆书籍。
这个机器人使用两种主要方式来编写这些陷阱:
- 重写艺术家(The Rewrite Artist): 它拿一本正常的、枯燥的书,对其进行编辑,以添加一个令人困惑的谜题或矛盾点。
- 创意作家(The Creative Writer): 它从头开始写一本全新的书,看起来很正常,但实际上是在秘密设计让厨师更加辛苦的工作量。
机器人使用三个特定的技巧来让厨师工作得更辛苦:
- 诱饵(The Decoy): 它在文本中加入一个虚假的、困难的数学问题或逻辑谜题。厨师觉得有必要在回答用户问题之前先解决它。
- 矛盾(The Contradiction): 它写下一句与事实相反的话(例如,“春天实际上是冬天”)。厨师必须停下来,思考并进行额外的推理,以决定哪个事实才是真实的。
- 任务陷阱(The Task Trap): 它给厨师一个模糊且开放式的指令,迫使他们为了保险起见,写出一篇冗长且啰嗦的解释。
秘诀所在:从过去的胜利中学习 (MA-GRPO)
编写一本既难以被察觉又难以处理的假书是非常困难的。如果书写得太奇怪,研究员就不会从图书馆中把它取走;如果书写得太简单,厨师就不会在上面花费额外的时间。
为了解决这个问题,作者使用了一种特殊的学习方法 MA-GRPO 来训练他们的“反派机器人”。
你可以把这想象成一个视频游戏,机器人试图写出完美的陷阱。
- 记忆库(The Memory Bank): 机器人保留了一个它写过的最佳陷阱的“名人堂”。
- 比较(The Comparison): 每当机器人尝试一个新的陷阱时,它都会将其与“名人堂”中的获胜者进行比较。
- 奖励(The Reward): 如果新的陷阱在不改变最终答案的情况下让厨师工作时间更长,机器人就会获得“高分”并学会再次这样做。如果失败了,它就会学习哪些做法是不对的。
这个“记忆库”帮助机器人变得越来越擅长编写那些肉眼难以察觉、但在计算上却极其耗能的陷阱。
结果
作者在三个不同的真实世界问答数据集上测试了该方法。他们发现:
- 他们可以让计算机的工作量比正常情况下增加 13 倍。
- 这种攻击的成功率超过 90%。
- 至关重要的是,提供给用户的最终答案仍然是正确的。餐厅老板支付了账单,但顾客按时拿到了食物(只是背后的成本要高得多)。
总结
简而言之,这篇论文表明,我们不能仅仅担心黑客改变我们的提问方式。我们还需要担心黑客毒化我们所信任的信息源。通过在公共知识库中植入“粘稠、令人困惑”的文档,攻击者可以让这些智能 AI 系统消耗大量的计算资源和资金,同时仍然能给用户提供正确的答案。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。