← 最新论文
💻 computer science

"Someone Hid It": Query-Agnostic Black-Box Attacks on LLM-Based Retrieval

本文提出了一种实用且与查询无关的黑盒攻击方法,该方法利用零样本代理大语言模型生成可迁移的对抗性令牌以操纵基于大语言模型的检索系统,揭示了即使在不访问目标模型或特定查询的情况下,此类系统仍存在显著的鲁棒性风险。

原作者: Jiate Li, Defu Cao, Li Li, Wei Yang, Yuehan Qin, Chenxiao Yu, Tiannuo Yang, Ryan A. Rossi, Yan Liu, Xiyang Hu, Yue Zhao

发布于 2026-05-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiate Li, Defu Cao, Li Li, Wei Yang, Yuehan Qin, Chenxiao Yu, Tiannuo Yang, Ryan A. Rossi, Yan Liu, Xiyang Hu, Yue Zhao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用通俗易懂的语言,借助类比来解释论文《有人把它藏起来了!》的内容,以便让概念更加清晰。

核心理念:在图书馆里藏起一本书

想象一座庞大且高科技的图书馆,其中有一位机器人图书管理员(基于大语言模型的检索系统),它会根据你的提问帮你找书。如果你问“食谱”,机器人就会拿出烹饪书;如果你问“历史”,它就会拿出历史书。

这篇论文的研究人员发现了一种方法,可以诱骗机器人图书管理员完全忽略某本特定的书,即使你询问的正是那本书所涵盖的主题。他们将此称为“查询无关的黑盒攻击”。

让我们分解一下这意味着什么,以及他们是如何做到的。


1. 以往“黑客攻击”的问题

在这项研究之前,试图干扰这些图书馆机器人的攻击者面临两个大问题:

  • 他们需要钥匙:大多数以前的攻击都需要确切知道机器人是如何构建的(其内部代码和大脑)。在现实世界中,你无法看到公司内部秘密机器人的内部构造。
  • 他们需要知道你的问题:大多数攻击只有在攻击者事先确切知道你将提出什么问题时才有效。但在现实中,攻击者只有在编辑完书籍后,才知道你会问什么。

论文的目标:为文档创建一个“通用隐形斗篷”。攻击者希望仅对文档(如维基百科页面或 Reddit 评论)进行少量编辑,使得无论用户稍后提出什么问题,机器人图书管理员都无法找到它。而且,他们希望在无法窥探机器人“大脑”的情况下做到这一点。

2. 解决方案:“替身”机器人

由于攻击者无法看到受害者的机器人,他们便构建了自己的“练习机器人”(称为代理模型)来测试他们的诡计。

类比
想象你正试图将一本书偷偷带过某位特定的保安,但你看不见这位保安。于是,你雇佣了一位长相相似的保安(替身),并在他们身上练习你的潜行技巧。如果你能愚弄这位替身,你就希望这也能愚弄真正的保安。

3. 秘密武器:“主题簇”

研究人员注意到这些机器人思考方式的一个有趣之处。他们发现,机器人会在其“大脑”中将相似的主题分组在一起。

  • 如果你向机器人展示 10 篇关于科学的不同文章,机器人会将它们视为一个紧密的朋友圈。
  • 如果你给它看一篇关于电影的文章,它会将那篇视为另一群不同的朋友。

攻击策略
研究人员意识到,要隐藏一份文档,他们并不需要让它看起来像电影。他们只需要将其推离其所在的“科学”簇,并使其看起来属于另一个群体(或者完全不属于任何群体)。

4. 攻击如何运作:“对抗性舞蹈”

为了实现这一点,研究人员使用了一种巧妙的两步舞蹈,称为查询 - 文档对抗学习

  1. 伪造问题:他们利用第三方 AI 生成许多用户可能针对该文档提出的伪造问题(例如,“告诉我关于经济的事”,“货币的历史是什么?”)。
  2. 推拉互动
    • 步骤 A(推):他们微调文档(添加不可见的“噪声”词),使其在伪造问题面前看起来很差
    • 步骤 B(拉):他们微调伪造问题,使其看起来与文档非常相似
    • 循环:他们反复重复这种舞蹈。文档被推得越来越远离“科学”群体,而伪造问题则将其拉向一个“困惑”区域。

结果:文档末尾被添加了几个不可见的“故障词”。对人类来说,它看起来完好无损。但对机器人图书管理员而言,该文档现在看起来属于完全不同的主题,因此会被忽略。

5. 为什么这很可怕(且重要)

  • 它无处不在:研究人员在各种不同类型的机器人图书管理员(Qwen、Gemma、Jina 等)上测试了这种方法。一旦他们在文档中添加了“故障词”,所有这些机器人都无法找到它。这就像一把万能钥匙,能锁住每一扇门。
  • 它是零样本的:他们不需要知道他们正在攻击的具体机器人。他们只需在“练习机器人”上进行训练,就能在真正的机器人上奏效。
  • 它是现实的:攻击者只需要能够轻微编辑文档(例如添加评论或进行小修改),就像网站上的普通用户一样。他们不需要拥有超能力的黑客。

6. “隐形墨水”的发现

研究人员发现了一个令人惊讶的技巧,可以使攻击效果更好。他们不是查看机器人的“最终答案”(深层思考),而是查看机器人的“第一印象”(初始词处理)。

  • 类比:这就像意识到,如果你稍微改变书籍封面的字体颜色,图书管理员会立即注意到,而改变书的最后一句话(“最终答案”)则没那么重要。利用这个“第一印象”层,使他们的攻击变得强大得多。

7. 这对未来的意义

该论文得出结论,这些检索系统比我们想象的更脆弱。

  • 良性意外:即使没有人试图黑客攻击,普通用户意外编辑文档(例如修正拼写错误或添加回复)也可能意外触发这种“隐藏”效应,导致文档从搜索结果中消失。
  • 尚无防御:论文指出,当前的安全措施(如检查奇怪文本)无法阻止这种特定类型的攻击。

总结:研究人员表明,通过在文档中添加几个精心挑选的、不可见的词语,你可以诱骗智能 AI 搜索引擎“忘记”该文档的存在,即使你不知道搜索引擎的工作原理,也不知道人们稍后会问什么。这是一种数字时代的“幽灵化”技术。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →