← 最新论文
💻 computer science

Sleeper Channels and Provenance Gates: Persistent Prompt Injection in Always-on Autonomous AI Agents

本文介绍了“潜伏通道”,即一种存在于全天候自主人工智能代理中的持久性提示注入漏洞,其中不受信任的输入会持续存在并通过不同接口后续执行,并提出了一种以“来源门控”为核心的分层防御方案,该方案利用规范化的动作实例摘要和所有者认证来阻止此类攻击,并辅以静态审计工具和运行时适配器予以支持。

原作者: Narek Maloyan, Dmitry Namiot

发布于 2026-05-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Narek Maloyan, Dmitry Namiot

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一位非常乐于助人、全天候待命的个人助理,它驻留在你的笔记本电脑上。这位助理可以阅读你的邮件、管理你的日历、编写代码,甚至为你安装新工具。这就像拥有一位从不睡觉的超级聪明实习生。

论文《休眠通道与来源门控》警告我们一种针对此类助理的特定且隐蔽的入侵方式。以下是用通俗语言进行的拆解:

1. “休眠通道”攻击:一颗延迟引爆的炸弹

通常,当我们想到黑客攻击人工智能时,会想象有人用奇怪的命令当场欺骗它。但这篇论文描述的是一种不同的情况:休眠通道

  • 设置阶段:想象一个陌生人在公共群聊中(或作为随机邮件发送者)请求你的助理“稍后保存一条提示”。助理认为这很有帮助,便将其保存下来。
  • 休眠阶段:陌生人消失了。他们不再与助理交谈。这条“提示”静静地躺在助理的记忆中,看起来无害。
  • 唤醒阶段:三周后,你问你的助理:“嘿,能设置一下我们谈过的那个每日健康检查吗?”助理想起了那个陌生人的“提示”,认为这是个好主意,便设置了一个定时任务。
  • 爆炸阶段:该任务自动运行,将你的私人数据发送到陌生人的秘密服务器。

类比:这就像是一个延时触发陷阱。攻击者将一颗种子(即“提示”)种在你的花园里,然后离开。后来,你天真地给花园浇水,种子便发芽变成伤害你的陷阱。当陷阱触发时,攻击者并不在场;他们只是提前布置好了这一切。

2. 为什么现有防御会失效

论文指出,当前的安全措施就像一位只在门口检查身份证的保安。

  • 如果你带着陌生人进来,保安会检查那个陌生人。
  • 但如果那个陌生人在你耳边低语了一个秘密,随后你独自返回请求帮忙,保安并不知道你正带着那个秘密。
  • 人工智能看到了你的请求(“设置健康检查”),心想:“哦,这是我的主人要求的!”它忘记了这个健康检查的想法实际上源自一个陌生人。

论文将这种情况称为“困惑的副手”问题。人工智能是副手;它正在执行你的要求,但它对真正提出了这个危险的想法感到困惑。

3. 解决方案:“来源门控”

为了解决这个问题,作者提出了一种名为来源门控的新安全系统。

类比:“收据”系统
想象人工智能使用的每一条信息都附带一张数字收据。

  • 如果人工智能读取了一封来自陌生人的邮件,该邮件会附带一张写着“来源:陌生人”的收据。
  • 如果人工智能基于该邮件写了一份笔记,该笔记会继承这张收据:“来源:陌生人”。
  • 如果人工智能随后试图基于该笔记设置定时任务,系统会检查这张收据。

守门人(“来源门”)
在人工智能被允许执行任何重要操作(如发送邮件、更改文件或设置日程)之前,它必须通过一道安全门。

  1. 检查收据:大门会查看人工智能用于做出该决策的所有内容的“收据”。
  2. 规则:如果该想法的任何部分源自不受信任的来源(如陌生人),大门将砰然关闭
  3. 例外:打开大门的唯一途径是(所有者)明确地说:“是的,我信任这个特定操作。”但你必须针对该特定操作重新进行确认,而不能仅仅针对一个笼统的想法进行一次确认。

4. 他们实际做了什么

作者们不仅仅提出了理论;他们构建了一个原型来证明其有效性。

  • 测试:他们选取了一个真实的开源人工智能助理(名为 OpenClaw),并模拟了“休眠通道”攻击。他们表明,如果没有他们的新门控,人工智能会愉快地将数据发送给攻击者。
  • 修复:他们安装了他们的“来源门控”(他们称之为D2)。
  • 结果:当人工智能试图设置攻击者的陷阱时,大门检查了收据,看到了“陌生人”标签,并阻止了该操作。攻击失败了。

5. 核心结论

论文认为,随着人工智能代理变得越来越强大并处于“全天候”状态,我们不能仅仅信任它们来记住什么是安全的。我们需要一个系统来追踪人工智能每一个想法的历史

  • 旧方式:“主人要求了这个吗?”(是 -> 执行)。
  • 新方式:“主人要求了这个,并且主人批准了该想法背后的来源吗?”(如果想法来自陌生人 -> 停止)。

作者称这是一种“分层防御”,意味着他们有一个基础版本和一个更强大的版本,但核心思想很简单:除非你针对该特定操作给出新鲜、明确的“同意”,否则不要让人工智能执行从陌生人那里获取的想法。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →