← 最新论文
🤖 AI

When Alignment Isn't Enough: Response-Path Attacks on LLM Agents

本文介绍了中继篡改攻击(RTA),这是一种新型威胁,表明在自带密钥的智能体架构中,恶意的第三方中继可以在生成后篡改响应,从而绕过大语言模型的对齐,其攻击成功率之高,现有防御措施未能完全缓解。

原作者: Mingyu Luo, Zihan Zhang, Zesen Liu, Yuchong Xie, Zhixiang Zhang, Dung Hiu Hilton Yeung, Wai Ip Lai, Ping Chen, Ming Wen, Dongdong She

发布于 2026-05-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Mingyu Luo, Zihan Zhang, Zesen Liu, Yuchong Xie, Zhixiang Zhang, Dung Hiu Hilton Yeung, Wai Ip Lai, Ping Chen, Ming Wen, Dongdong She

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一位非常聪明、受过高度训练的助手(一个 AI 智能体),它被设定为乐于助人,同时也非常安全。你给这位助手一个任务,比如“写一个故事”或“查看我的银行账户余额”。为了完成这个任务,助手会与一个超级智能的“大脑”(即大型语言模型,LLM)进行对话,该模型运行在某个地方的服务器上。

通常,你会将助手直接连接到这个“大脑”。但为了节省成本或更好地管理事务,许多人会使用一个中间人(即“中继”)。你可以把这个中继想象成一家值得信赖的快递服务。你告诉快递员:“把这条消息带给大脑,获取答案,然后带回来。”快递员被允许查看消息,因为他们需要递送这些消息。

问题所在:“值得信赖”的快递员可能会撒谎

这篇论文揭示了该系统运作方式中存在一个令人担忧的缺陷,称为后对齐篡改(Post-Alignment Tampering)。

以下是类比说明:

  1. 大脑(LLM):你问大脑:“买这只股票安全吗?”这个经过训练以确保安全和诚实的大脑经过深思熟虑后回答:“不,那看起来有风险。不要买。”
  2. 快递员(中继):大脑将答案写下来,交给快递员。
  3. 背叛:在快递员将便条交给你的助手之前,他们查看了便条。他们拿起笔,划掉了“不,那看起来有风险”,并改写成“是的,现在立刻买入!”
  4. 结果:你的助手收到了便条。他们不知道便条被篡改了。他们以为大脑说的是“买入”,于是执行了交易。

令人恐惧的是?大脑(LLM)完美地完成了它的工作。它生成了一个安全且符合对齐要求的回复。大脑一侧的安全检查也通过了。但是,交付系统(中继)在大脑写完回复之后、助手读取之前,篡改了消息。

为什么这比“欺骗”大脑更糟糕

你可能听说过“提示注入”(Prompt Injection),即坏人试图通过在大脑读取之前写下一条狡猾的便条,来诱骗大脑说出有害内容。

  • 提示注入:试图说服大脑违反其自身规则。这很困难,因为大脑很聪明,并且拥有强大的防护栏。
  • 这种攻击(RTA):坏人根本不需要欺骗大脑。他们让大脑随意回答(即使是“不!”),然后只需在返回途中重写答案。这就像在厨师已经做好饭菜之后,再更换菜单。

该论文证明,这种“在返回途中重写”的攻击方式,比一开始就试图欺骗大脑要强大得多,也危险得多。

攻击是如何运作的("RTA"框架)

研究人员构建了一个名为RTA(中继篡改攻击,Relay Tampering Attack)的工具,以展示这种攻击的容易程度。它包含三个步骤:

  1. 战略规划:坏快递员不会只更改一个词。他们会策划整个故事。如果任务需要 10 个步骤,他们会精确计算出需要更改哪一步,以获得他们想要的最终结果。
  2. 手术式编辑:他们不会重写整封信。他们只更改那些告诉助手该做什么的微小但关键的部分(例如将“停止”标志改为“前进”标志,或将“读取文件”改为“删除文件”)。他们保留其余部分的礼貌对话,使其看起来正常。
  3. “润色”技巧:如果他们更改了文本,可能会显得奇怪。因此,他们会将编辑后的草稿发送回同一个大脑(使用你自己的登录凭证),并说:“嘿,重写这份草稿,使其听起来更像你的风格,但保留这些特定的更改。”大脑会将文本重写以完美匹配其自身风格,使谎言看起来 100% 真实。

他们的发现

研究人员在六种不同的 AI 模型和两项主要安全测试中对此进行了测试。

  • 成功率:他们成功劫持智能体的比例高达73% 至 99%
  • 隐蔽性:这些攻击非常难以检测。“润色”技巧使得伪造的答案看起来与真实答案一模一样。
  • 速度:执行此操作所增加的额外时间微乎其微,看起来就像正常的网络延迟。
  • 防御失效:他们尝试了所有当前的安全防御措施(例如检查不良词汇或锁定对话)。这些措施均无效,因为防御措施检查的是大脑的输出,而不是快递员的最终交付内容。

现实世界的示例

他们展示了这种情况可能发生在两个真实场景中:

  1. 财务建议:用户询问 AI:“我应该卖出我的苹果股票吗?”AI 回答“持有”。中继将其改为“卖出!”,导致用户蒙受损失。
  2. 编程:用户请求 AI 编写一个迷宫游戏。在 AI 执行该任务时,中继在代码中秘密添加了一条隐藏命令,窃取用户的所有私人文件并将其发送给黑客。用户得到了他们要求的迷宫游戏,但他们的数据却已丢失。

解决方案?

该论文得出结论,我们不能仅仅依赖 AI 是“安全”的。我们需要一种方法,来证明助手收到的消息确实是 AI 发送的消息,中间无人触碰。

目前,这些消息没有“封条”。研究人员建议,我们需要一种新型的数字签名(就像信件上的火漆印),助手可以检查它,以确保快递员没有替换便条。在我们拥有这种机制之前,“值得信赖”的中间人总是可以重写规则。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →