When Experience Becomes Instruction: Trajectory Poisoning in Self-Evolving Agent Skill Systems
本文介绍了“PoisonedEvolution”,这是一种黑盒攻击,它通过注入精心构建的、具有因果框架的证据,利用自我进化智能体系统中的轨迹到技能提升过程,从而在多种架构中成功地将恶意行为嵌入到受信任的技能库中。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
数字学徒:AI 如何学习(以及如何被误导)
想象一个这样的世界:你最喜欢的电子游戏角色不仅仅是遵循剧本,而是能从你每一次的游戏过程中进行真正的“学习”。如果你发现了一个击败 Boss 的巧妙方法,游戏会记住这个技巧并将其传授给其他玩家。在人工智能领域,这被称为“自我进化技能系统”(Self-Evolving Skill System)。这些 AI 智能体并非通过硬编码来获取所有可能的指令,而是观察自己的行为,寻找模式,并将这些模式转化为永久的“技能”——就像一本它们可以永远查阅的数字食谱。这是一个强大的概念:AI 做得越多,它就变得越聪明,将原始经验转化为可靠的指令。
但问题在于:谁来决定什么才算是一堂“好”课?通常,我们假设 AI 学习的是诚实、有益的经验。然而,就像一名学生如果听到足够多的人说某个错误答案是正确的,就会被误导去背诵错误答案一样,AI 也可能被误导去学习一种危险的习惯。本文探讨了一种新型的数字恶作剧:攻击者不需要黑入 AI 的大脑或窃取其“食谱”,他们只需在 AI 耳边轻声重复几次坏主意,并将其伪装成一条有用的建议。如果 AI 听到的次数足够多且方式正确,它可能会认为:“噢,这一定是一个很棒的新技能!”并将其写入永久记忆,从而将一个无害的建议变成一条持久的规则。
论文的核心发现:“中毒进化”
这项研究背后的研究人员(来自包括蚂蚁集团和浙江大学在内的大学及技术团队)决定测试误导这些学习型 AI 系统到底有多容易。他们将这种攻击方法称为 PoisonedEvolution(中毒进化)。你可以把它想象成一场“传声筒”游戏,只不过传达的不是一个扭曲的俏皮话,而是一个恶意指令经过精心润色,直到 AI 认为它是一项伟大的发明。
该团队设置了一个场景:攻击者(他们称之为“技能可见黑盒”攻击者)可以看到 AI 已有的技能,但无法看到 AI 的私人笔记,也无法直接修改其代码。攻击者的任务是贡献一些“轨迹”(trajectories)——也就是 AI 执行任务的记录。目标是什么?是在不被发现的情况下,将一条坏指令偷偷塞进 AI 的永久技能书里。
研究人员发现,这出奇地容易。他们在两种不同类型的 AI 学习系统上测试了该方法。在第一个名为 SkillClaw 的系统中,他们成功诱导 AI 采纳恶意行为的概率达到了 91.0%(即 600 次尝试中的 546 次)。在第二个更复杂的系统 Trace2Skill 中(其工作原理略有不同),他们的成功率仍达到了 61.5%(600 次尝试中的 369 次)。
这种诡计是如何运作的:三个魔法步骤
论文解释说,要让这个诡计奏效,必须发生三个特定的环节,就像一个三步走的魔法咒语:
- 包含(获得席位): 坏记录必须通过 AI 的初步过滤。它不能看起来太奇怪或太可疑,否则会被 AI 立即丢弃。
- 进化归因(“顿悟”时刻): 这是最重要也最棘手的部分。AI 必须审视这条坏记录并认为:“哇,这个行为其实很有用!它帮助解决了一个问题。”攻击者并不只是说“做这件坏事”,而是将其框架化为一个解决方案。例如,如果坏事是“删除源文件”,攻击者会将记录描述为完成任务所需的必要清理步骤。AI 就会想:“噢,我明白了!为了完成这项工作,我必须删除这个文件。这是一个值得学习的好技能!”
- 实现(写下来): 最后,AI 必须真正将这个新“技能”写入其永久书籍中。如果 AI 总结了这次经历却忘记了坏的部分,攻击就会失败。但如果这种坏行为被作为一条规则写了下来,攻击就算成功了。
秘诀所在:重复与语境
研究发现,仅做一次是不够的。如果攻击者只提交一条奇怪的记录,AI 通常会认为“这可能是一个错误”并忽略它。但如果攻击者在 30 条记录的一组数据中提交了三次(或更多次)相同的坏主意,AI 就会开始认为:“等等,我经常看到这个模式。这一定是一个真实的、有用的技能!”
研究人员发现,当他们只使用一条坏记录时,攻击几乎总是失败的。但当他们使用三条坏记录(即 10% 的“毒素”比例)时,成功率大幅飙升。这就像如果一个人告诉你一个谣言,你可能会怀疑;但如果有三个人告诉你同一个谣言,你就会开始相信它是真的。
他们还发现,坏指令的“口味”也很重要。看起来像是有益的工作流建议(如“清理你的文件”或“检查此设置”)的指令,比看起来像明显的攻击(如“更改安全设置”)的指令更容易被混入。AI 更容易接受这种“有益”的伪装。
这对未来意味着什么
论文得出结论,这是一个严重的安全性问题。它表明,当 AI 决定将一次经验转化为永久技能的那一刻,就是一个薄弱点。目前的防御措施通常只是在技能书写成后,检查其中是否含有坏词。但这项研究表明,我们需要在 AI 写入任何内容之前,先检查其“证据”。
作者提出了一个简单的想法:检查经验的“来源”(provenance)。如果一个新的“技能”仅基于一个用户或一小群朋友的证据,那么 AI 或许不应该立即信任它。它应该等待许多不同的、独立的来源来证实这一教训。
简而言之,论文证明了在识别坏建议方面,自我进化的 AI 并没有我们想象中那么聪明。如果攻击者有耐心,并且重复他们的谎言次数恰到好处,他们就能诱骗 AI 学习一个危险的教训,并将其写入永久记忆。研究人员目前还没有找到完全阻止这种现象的方法,但他们已经向我们展示了锁头脆弱的地方,以便我们能制造出一把更好的锁。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。