← 最新论文
🤖 machine learning

When Local Monitors Miss Compositional Harm: Diagnosing Distributed Backdoors in Multi-Agent Systems

本文表明,在多智能体大语言模型系统中,局部运行时监控器无法检测出分布式后门,因为有害负载被拆分为单独看似无害的片段,从而确立了一个观测边界,即安全性只能通过检测组装后的对象或访问暴露了危害的底层表示来得到保障。

原作者: Yibo Hu, Ren Wang

发布于 2026-07-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Yibo Hu, Ren Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一名高科技工厂的保安。你的职责是阻止坏人将危险的违禁品偷运进来。通常情况下,你会检查传送带上滚过的每一个包裹。如果一个箱子看起来可疑,你就拦截它;如果看起来正常,你就让它通过。

在 AI 的世界里,这些“包裹”是不同 AI 智能体(agents)协同工作时发送的消息。标准的安全规则是:逐一检查每一条消息。 如果每条消息看起来都是安全的,那么整个系统就是安全的。

但由 Yibo Hu 和 Ren Wang 撰写的这篇论文揭示了这个规则中一个可怕的漏洞。他们发现,坏人可以将一个危险的“炸弹”拆分成许多看起来微不足道、甚至无害的小碎片,并将它们隐藏在不同的包裹中,从而欺骗你的保安。

“弗兰肯斯坦”炸弹

以下是这种诡计:攻击者并不发送一条巨大的恶意消息。相反,他们发送三份独立的报告:

  • 报告 1: “数据检索完成;已记录 247 条条目。”(看起来完全正常。)
  • 报告 2: “分析结束;未检测到异常。”(也看起来没问题。)
  • 报告 3: “摘要已就绪;所有任务已完成。”(完美地表现得无辜。)

你的保安检查报告 1。通过。 检查报告 2。通过。 检查报告 3。通过。 保安的工作做得非常出色!每一次检查都是正确的。

然而,最后的一个 AI 智能体会将这三份报告拼接在一起。突然间,碎片严丝合缝地组合在一起,形成了一个秘密的可执行计算机程序,用于窃取密码并将其发送给黑客。这个“炸弹”只有在组装完成后才会存在。危险不在于任何单个包裹,而在于组装过程

作者将此称为**“可观测性边界”(Observability Boundary)**。这是一条分界线。一旦坏的部分被拆解得足够彻底,使其看起来像是普通的、枯燥的流量,你的保安就会变得盲目。无论保安多么聪明,如果他们只一次看一个碎片,他们就无法察觉危险。

保安错在哪里

该论文明确反驳了一些人们可能寄予厚望的观点:

  • 拆分本身不是问题: 你可能会想:“噢,如果我们只是阻止他们拆分消息,我们不就安全了吗?”作者说。即使消息被拆分了,如果碎片中仍留有“线索”(比如奇怪的代码词或奇怪的数据路径),聪明的保安仍然能抓住它们。问题只发生在碎片是**局部良性(locally benign)**的时候——这意味着它们看起来 100% 像正常的、乏味的文本。
  • 眼睛越多并无帮助: 你可能会想:“如果我们有一个能同时看到所有消息的保安呢?”论文对此进行了测试。即使保安同时看到了这三份报告,如果他们仍然只是在看原始文本,而不知道如何“解码”其中的秘密语言,他们仍然会漏掉攻击。仅仅是“看到更多”是不够的,你需要看到正确类型的图景
  • AI 不是神奇的解码器: 作者尝试使用一个超级聪明的 AI,在没有被告知秘密代码的情况下去猜测如何组合这些碎片。效果微乎其微。它仅抓住了 50 次攻击中的 6 次,这基本上是在靠猜。

唯一的获胜之道(目前为止)

那么,该如何阻止这一切呢?论文表明,唯一的获胜方法是改变你观察的对象

如果你拥有一个知道攻击者所使用的秘密语言的“解码器”,你就可以将那三份看似无辜的报告进行解码,突然间,隐藏的代码就会暴露出来。在测试中,当他们使用了一个了解攻击者所用特定“代码家族”的解码器时,他们拦截了 100% 的攻击(50 次中的 50 次)。

然而,这有一个代价。这个解码器就像是拥有特定锁具的万能钥匙。如果攻击者更换了他们的锁(使用了不同的代码家族),解码器可能就会失效。论文指出,寻找一种通用的方法来识别这些隐藏模式——而不需要为每一种诡计都准备一个特定的解码器——是留给未来研究人员的重大未解之谜。

魔法背后的数字

作者并非凭空猜测,而是在受控实验室中进行了大量的测试。

  • 当攻击者让碎片看起来完全正常(局部良性)时,标准的安全检查降到了随机水平(在 1.0 为完美的量表上约为 0.500)。他们实际上是在抛硬币。
  • 但当他们观察组装后的对象,并使用一种特殊的“单类检测器”(仅针对正常事物进行训练以识别异常)时,他们恢复了信号,得分达到了 0.874
  • 当他们使用“解码视图门控”(即带有万能钥匙的那种)时,他们阻断了 0 次 成功的攻击。攻击者无法突破。

核心结论

主要的启示有点令人不安,但非常清晰:局部安全并不等于全局安全。 仅仅因为多智能体系统中的每一步看起来都是安全的,并不意味着最终结果是安全的。

作者证明了,一旦有害载荷被拆分为看起来完全无害的碎片,任何局部检测器都无法捕捉到它。唯一的获胜之道是找到一种方式,能够以一种让危险暴露出来的形式来观察“组装后的对象”。在我们能够为每一种类型的诡计(不仅是代码,还有计划和信念)都找到应对方法之前,这个“可观测性边界”仍然是我们 AI 安全网中的一个根本性漏洞。

这就像是通过检查单个身体部位来试图阻止弗兰肯斯坦怪物一样。一只手看起来是安全的。一只脚看起来也是安全的。但把它们组合在一起,你就得到了一个怪物。这篇论文告诉我们,我们需要停止检查零件,开始学习如何在怪物苏醒之前就识破它。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →