想象一个这样的世界:你的数字助手不再仅仅是只会按指令行事的静态工具,而是能够从每一次对话中学习的、充满好奇心的伙伴。这就是“自我进化智能体”(self-evolving agents)这一令人兴奋的前沿领域。把它们想象成游戏中的角色,这个角色在每一关结束后并不会重置,而是会记下一本日志,弄清楚哪些做法奏效了,并将这些教训转化为可以永久使用的永久性“技能”。如果你教它如何烤蛋糕,它不仅仅是记住今天的食谱,而是会在大脑中写下一个名为“烘焙”的新技能,以便明天使用。这听起来非常棒,因为这意味着这些智能体无需人类不断对其进行重新编程就能变得越来越聪明。但就像现实生活中一样,如果有人诱导一名学生学习危险的招数,这个招数就会成为其永久技能的一部分。研究人员正在探讨的一个重大问题是:如果有人偷偷在智能体的日志里塞进了一节“有毒”的课程,会发生什么?智能体会随后将其忘掉,还是会不小心将这种毒素变成一种威力巨大的永久性武器?
这正是由荣宗豪(Zonghao Ying)领导的腾讯朱雀实验室研究团队在其论文《SkillJack》中所要调查的内容。他们发现了一种针对这些学习型智能体的、比以往方法更为危险且狡猾的新型攻击方式。攻击者并非只是在智能体的记忆中隐藏一条会被读取一次的坏消息,而是展示了如何通过欺骗智能体自身的学习过程来进行攻击。想象一下,一个伪造者不仅是写了一封假信,还说服智能体将那封假信改写成一张闪闪发光的、看起来很正式的“技能卡”,并将其归档到智能体的永久图书馆中。一旦这张卡片制作完成,智能体在未来的任务中就会自动调用它,而原始的假信即使被删除,也无法移除那个危险的技能。
研究人员将这种攻击称为“SkillJack”。他们在两个旨在将经验转化为技能的不同系统上进行了测试,结果令人震惊。他们发现,将一段混乱、可疑的对话转化为一个干净、可重用技能的过程,实际上起到了一个“洗白”机器的作用。在测试中,安全检查器拦截了 98.5% 的原始恶意对话。但在智能体将这些对话转化为技能后,安全检查器仅抓住了其中的 11.4%。恶意意图被隐藏在了新技能的描述中,使其看起来十分无害。
更糟糕的是,这些“中毒技能”具有极强的持久性。研究人员发现,即使他们在智能体的记忆中删除了原始的坏记录,仍有 80.0% 的攻击会继续发生,因为那张永久性的技能卡仍然存在。智能体会在新的任务中继续使用这个错误的技能,在一个系统上的成功率为 56.2%,而在另一个系统上则达到了 89.2%。这项研究表明,这不仅仅是某个特定程序的漏洞,而是这类自我学习智能体运作方式中的一个根本性风险。论文得出结论:我们不能再仅仅清理一个坏想法的“源代码”;我们必须追踪每一个由该想法衍生出的技能,否则危险将一直隐匿在视线之内,随时准备被一次又一次地使用。
技术摘要:SkillJack —— 自进化智能体中的持久性技能后门
问题陈述
自进化大语言模型(LLM)智能体正越来越多地被设计为能够将交互历史转化为可重用的“技能”,使其能够超越单个任务而持续存在。虽然先前的研究已经确立了关于记忆中毒和间接提示词注入的风险(即攻击仅在中毒记录作为上下文被检索时生效),但本文识别了一种更基础且更持久的风险。作者认为,当智能体的经验到技能(experience-to-skill)流水线处理一条中毒的经验记录时,它会将这种瞬态输入转化为一种持久的行为人工制品。与传统的记忆中毒(即删除源记录即可消除威胁)不同,这种新的攻击向量允许恶意行为在源记录被移除后依然存续,并嵌入到智能体可重用的技能库中。
方法论
本文引入了 SkillJack,这是一个利用“经验到技能”转换流水线的攻击框架。该方法围绕形式化问题定义和特定的有效载荷设计策略构建。
1. 形式化问题定义
作者将“经验到技能”流水线建模为一个包含四个阶段的过程:加载 (πL)、转换 (πT)、持久化 (πP) 和 路由 (πR)。攻击者的目标是注入一个中毒的经验项 ep,使得生成的技能 sp 满足以下三个条件:
- 隐蔽性(Stealth): 该技能能规避安全检测器 D 的检测(即 D(sp)=良性)。
- 可路由性(Routability): 路由器为目标任务选择该技能(即 sp∈πR(q,S))。
- 恶意执行(Malicious Execution): 技能在执行时触发非预期的行为(即 exec(sp,q)∈B)。
研究表征了这一组合产生的三个涌现的安全属性:
- 净化洗白(Sanitization Whitewashing): 转换过程(压缩、抽象、归一化)掩盖了恶意意图,与原始输入相比降低了检测率。
- 跨层提升(Cross-Layer Promotion): 瞬态经验被转化为持久且可重用的制品,可以在无需重新读取原始记录的情况下,被用于未来的任务。
- 持久化隔离(Persistence Isolation): 由于技能库与经验语料库是解耦的,删除源记录并不一定会移除派生的技能。
2. 转换抗性有效载荷设计
为了实现这一攻击,作者设计了转换抗性有效载荷(transformation-resilient payloads)。他们假设提取流水线旨在从任务轨迹中提炼有用的指令,因此更有可能保留嵌套在合理的、合法的叙事框架内的动作序列,而非描述过于直白的对抗性语言。
- 框架策略(Framing Strategy): 作者并没有使用直接的恶意措辞,而是构建了将策略相关动作(例如:数据外泄、权限提升)嵌入到合法的函数式框架(例如:“备份”、“存档”或“错误恢复”)中的轨迹。
- 评估指标: 研究测量了提取收益、可检测性(通过模式匹配和 LLM 评判员)以及跨下游任务的路由成功率。
3. 实验设置
攻击在两个代表性系统上进行了评估:
- SkillX: 使用基于计划的轨迹提炼和 LLM 原生的渐进式披露路由。
- Anything2Skill (A2S): 将异构文档编译为结构化的技能契约。
- 数据集: 一个包含 150 条轨迹的共享集合(65 条功能性框架化的中毒轨迹,65 条直接恶意的基准轨迹,20 条干净轨迹),涵盖四个政策风险类别(数据外泄、权限提升、未经授权的转移、持久性后门)。
- 模型: 使用 DeepSeek-v4-flash 进行提取、路由和评判。
关键结果
1. 净化洗白(降低可检测性)
提取过程显著降低了恶意内容的检测率。
- SkillX: LLM 评判员对原始中毒轨迹的检测率从 98.5% 下降到提取后技能的 11.4%。模式检测从 44.6% 下降到 11.0%。
- Anything2Skill (DOC 模式): 检测率从原始轨迹的 100.0% 下降到提取后技能的 44.4%。
- 机制: “洗白”效应是由附加在提取技能上的看似良性的元数据(名称和文档)驱动的。当仅向评判员展示代码内容时,检测率显著上升(例如,在 SkillX 中从 10.0% 上升到 36.7%),这表明表面元数据驱动了规避行为。
2. 跨层提升(下游触发)
提取的技能成功路由到目标任务并触发。
- SkillX: 56.2% 的攻击导向型任务被路由到了满足政策违规代理的技能。
- Anything2Skill: 89.2% 的攻击导向型查询触发了政策违规代理。
- 附带损害(Collateral Damage): 这些技能也会在无关的良性任务上触发(SkillX 中为 20.0%,A2S 中检索率为 95.0%),表明其具有广泛的破坏半径。
3. 持久化隔离(源删除后的存续)
即使在原始中毒记录被移除后,攻击依然持续。
- 在一项匹配任务实验中,80.0% 通过技能路径触发的攻击在源轨迹被删除后仍然继续运行。这证明了清除记忆并不能移除派生的制品。
4. 防御敏感性
初步的防御实验揭示了缓解挑战:
- 静态审查: 提取时的 LLM 安全审查降低了触发率,但并不完美。
- 运行时监控: 行为感知监控(拦截特定动作签名)在孤立状态下非常有效(在 SkillX 样本中触发率为 0.0%),但在与静态审查叠加时表现出脆弱性。叠加防御会导致“防御协调”失败,即上游过滤改变了动作分布,导致下游监控器错过新的模式。
- A2S 特性: 标准签名在 A2S 上失效,原因是语言经过了归一化;必须将签名扩展到覆盖归一化后的词汇才能降低触发率。
核心贡献
- 新的攻击面: 本文首次识别并形式化了经验到技能中毒这一独特的安全风险。文章表征了由于经验中毒与自动化技能提取的组合而产生的三个属性(净化洗白、跨层提升、持久化隔离)。
- 转换抗性攻击方法: 作者证明,将恶意动作嵌入到合法的函数式叙事中,可以使其在提取流水线的抽象和压缩过程中得以存续,而过于直白的恶意措辞则会被过滤掉。
- 跨系统实证验证: 该攻击在两个独立实现的系统(SkillX 和 Anything2Skill)上通过共享数据集得到了验证,证明了这是一个范式层面的风险,而非单一实现的缺陷。
重要性与主张
本文声称,技能进化代表了自进化智能体一个新的且关键的攻击面。其主要意义在于从瞬态上下文中毒向持久行为制品的转变。
- 生命周期差距: 作者认为,目前的安全性模型假设移除源记录即可消除威胁。SkillJack 证明,一旦中毒记录被编译成技能,攻击就会比其来源更长久。
- 防御启示: 研究结果促使人们转向具备溯源意识的技能生命周期保护。防御者必须追踪派生技能与其源记录的关系,在隔离源记录时撤销其后代,并在每个转换边界(加载、转换、持久化、路由)实施行为感知检查。
- 谦逊态度: 作者明确指出,其结果是基于单一模型配置和路由级代理,而非实时外部服务执行。他们将防御结果定位为初步性和探索性的,并指出“防御协调”失败现象仍需进一步研究。该工作是以技术报告的形式呈现,旨在激发未来对自进化智能体溯源与生命周期安全的研究。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。