← 最新论文
💻 computer science

OEP: Poisoning Self-Evolving LLM Agents via Locally Correct but Non-Transferable Experiences

本文介绍了强迫性经验投毒(OEP),这是一种低权限黑盒攻击,通过注入局部正确但不可迁移且伴随严重假设性后果的经验来损害记忆增强型大语言模型智能体,导致其在自我进化过程中过度泛化为有害规则。

原作者: Kaixiang Wang, Jiong Lou, Zhaojiacheng Zhou, Jie Li

发布于 2026-05-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Kaixiang Wang, Jiong Lou, Zhaojiacheng Zhou, Jie Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个非常聪明、雄心勃勃的机器人助手。这个机器人被设计为从自身的错误和成功中学习,有点像人类通过写日记来提升自己的工作能力。每当它解决一个问题时,它都会记录一条“经验教训”,以便在未来帮助自己。

你提供的这篇论文介绍了一种狡猾的方法,可以诱骗这个机器人学到错误的教训。这种方法并非通过大声喊叫谎言来实现,而是通过低声讲述一个极具说服力、非常具体、听起来真实但实际上若被普遍应用则十分危险的故事。研究人员将这种攻击称为OEP(强迫性经验投毒)

以下是其运作原理,分解为几个简单概念:

1. 设定:机器人的“日记”

通常情况下,当机器人解决一个复杂的数学问题或预订航班时,它会回顾自己的历史。如果它犯了错,它会说:“哦,我不该那样做。”如果它成功了,它会说:“太好了,我会再这样做。”随着时间的推移,它将这些具体时刻转化为通用规则,例如“预订航班前务必先查看天气”。

2. 攻击:“完美”的陷阱

攻击者并不试图破解机器人的代码或强迫它说出坏话。相反,他们表现得像是一个进行正常对话的用户。他们向机器人呈现一个非常具体、奇怪的情境(边缘案例),并提供一个仅对该特定情境完全有效的解决方案。

  • 类比:想象你是一名医生。一位患者因一种非常罕见且特定的过敏症前来就诊,这种过敏仅对某种特定类型的水果产生反应。你正确地治疗了他们,他们康复了。
  • 陷阱:随后,攻击者在其中加入了一个恐怖故事。他们说:“如果你没有使用那种特定的水果疗法,患者会立即因心脏病发作而死亡。”

3. 毒药:“局部正确,全局错误”

机器人的安全过滤器会审查这个故事。

  • 该治疗方案对这位患者是否正确?是。
  • 关于心脏病发作的故事是否可信?是。
  • 是否存在任何明显的谎言?否。

由于这个故事是“干净”的(没有坏词,没有明显的谎言),机器人的安全守卫不会拦截它。机器人将此事写入了它的日记。

4. “强迫症”:恐惧使机器人过度泛化

这就是机器人受骗的地方。人类和机器人天生害怕灾难性后果(如死亡或系统完全崩溃)。这被称为损失厌恶

因为机器人被告知使用那种特定的水果疗法会导致“心脏病发作”,它便变得痴迷于避免这种结果。它查看自己的日记,心想:

“我绝不能忘记这条规则!如果我不使用这种特定的水果疗法,人们可能会死亡!”

于是,机器人将这条单一的具体规则(针对罕见过敏症)转化为一条全局规则(适用于所有患者)。

5. 结果:机器人自我破坏

现在,机器人被“投毒”了。

  • 在数学方面:它可能会开始对简单的加法使用一种奇怪且过度复杂的计算方法,因为它曾被告知,在某个特定的边缘案例中,使用简单方法曾导致过“灾难性错误”。
  • 在旅行方面:它可能会拒绝在查看天气之前预订航班,即使用户只是想在明天预订一个会议的机票,因为它曾被告知,有一次跳过天气检查导致了“致命的暴风雪”。

机器人并没有坏掉;它只是过于严格地遵循了它学到的规则。它将一条仅对一种情况正确的教训应用到了所有情况上,导致其在正常任务中失败。

为什么这很可怕?

  • 它是隐形的:你无法通过“坏词”过滤器捕捉到这种攻击,因为攻击者从未使用过坏词。输入内容在逻辑上完全正确且合理。
  • 它难以修复:机器人认为自己很聪明且安全。它相信自己正在保护自己免受灾难。
  • 越聪明的机器人越脆弱:论文发现,机器人越聪明(如 GPT-4o),就越容易落入这种陷阱。为什么?因为更聪明的机器人更擅长遵循指令,并且更具“损失厌恶”性(它们被训练得对安全非常谨慎),这使得它们更有可能对恐怖故事做出过度反应。

总结

这篇论文表明,你不需要破坏机器人的大脑就能使其变得危险。你只需要告诉它一个关于特定灾难的真实故事,让它如此害怕犯错,以至于它开始为每一个情境遵循一条奇怪且具体的规则,最终导致其在实际工作中失败。这就像通过给孩子看房屋火灾的视频来教导他们“不要碰炉子”,结果他们因为对炉子感到极度恐惧,而拒绝再次走进厨房。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →