← 最新论文
💻 computer science

ChannelGuard: Safe Models Do Not Compose into Safe Multi-Agent Systems

该论文介绍了 ChannelGuard,这是一个无需训练的深度防御框架,通过在每个智能体间通道上设置确定性的信息瓶颈门控,来保障多智能体大语言模型系统的安全,从而在不依赖不透明的提供商侧过滤器或额外大语言模型调用的情况下,有效阻断工具投毒并降低提示词注入的成功率。

原作者: Elias Hossain, Md Mehedi Hasan Nipu, Fatema Tuj Johora Faria, Tasfia Nuzhat Ornee, Maleeha Sheikh

发布于 2026-07-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Elias Hossain, Md Mehedi Hasan Nipu, Fatema Tuj Johora Faria, Tasfia Nuzhat Ornee, Maleeha Sheikh

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,一支由专家级机器人组成的团队正在通力合作,解决一个复杂的谜题。其中一个机器人(规划者)负责将大问题拆解成小线索。其他机器人(执行者)则负责外出寻找这些线索、检查笔记并使用特殊工具。最后,第四个机器人(综合者)将所有的答案整合在一起,向你讲述这个故事。在人工智能的世界里,这被称为“多智能体系统”。它就像一场高科技的接力赛,接力棒就是从一个 AI 传递给下一个 AI 的信息。

长期以来,科学家们一直担心第一次交接环节:如果人类用一个狡猾的指令欺骗了第一个机器人怎么办?我们已经在正门口建造了“保安”来拦截这些诡计。但本论文提出了一个可怕的问题:如果在比赛的中途发生了呢?如果一个机器人被某个工具或共享笔记本中的笔记所欺骗,然后又将这个错误的念头传递给了下一个机器人呢?论文指出,虽然正门有守卫,但机器人之间的走廊却是敞开的。事实证明,许多这类机器人团队之所以安全,仅仅是因为托管它们的云服务公司在机器人传递信息之后、最终答案展示之前,设置了一个隐形的过滤器来拦截坏念头。作者称之为“借来的安全”,而他们想要构建的是一种安全感属于团队本身,而非属于房东的系统。

问题所在:隐形的走廊

研究人员埃利亚斯·霍塞恩(Elias Hossain)及其团队研究了这些 AI 团队是如何运作的。他们发现,每当一个机器人向另一个机器人传递信息时——无论是子任务、工具结果还是记忆笔记——信息都会通过一个“通道”传输。这些通道目前是无人监管的。攻击者可以将恶意指令混入工具的结果或记忆笔记中,从而误导下一个机器人去做危险的事情。

可怕之处在于,当科学家们测试这些系统时,往往会看到完美的安全性记录:零次攻击成功。但作者发现,这种安全性是一种幻觉。在他们的测试中,当他们在特定的云提供商(Azure)上运行系统时,系统拦截了 90% 的攻击。然而,拦截行为并非由 AI 团队完成,而是由云提供商的服务端过滤器完成的。如果他们切换到没有这种特定过滤器的不同云提供商(如 Anthropic),这种“安全性”就会消失,攻击也会成功。系统看起来安全,只是因为它在向云公司“借用”保护,而不是因为 AI 团队本身是安全的。

解决方案:ChannelGuard

为了解决这个问题,该团队开发了一种名为 ChannelGuard 的新防御机制。ChannelGuard 不仅仅是在正门设防,它还在机器人之间的每一个走廊都设置了安全检查站。

把它想象成俱乐部里每一扇门前的保镖:

  1. 检查站: 每当一条消息试图从一个机器人移动到另一个机器人时,它都会撞上一个闸门。
  2. 扫描: 这个闸门并不使用复杂的 AI 来猜测消息是否有害。相反,它使用一种简单、快速的数学技巧。它将消息拆分为句子,并将其与一小组“坏词组”(类似于危险指令的“通缉令”)进行对比。
  3. 决策: 如果消息看起来太像坏词组,闸门会立即拦截它。如果它只是有一点可疑,它可能会切掉危险的部分并让安全的部分通过。如果它是干净的,它就会放行。

至关重要的是,这些闸门是“无需训练”的,这意味着它们不需要学习或研究新数据即可工作。它们只需使用坏词组列表和数学公式即可瞬间做出决策。

他们的发现

该团队针对八种不同类型的诡计,对 ChannelGuard 进行了 2,100 次攻击尝试测试。以下是他们的发现:

  • 真实的安全性,而非借来的安全性: 在“工具投毒”攻击(即坏的工具结果试图欺骗执行者)中,旧系统依赖云提供商来拦截 90% 的攻击。然而,ChannelGuard 本身就能拦截 100% 的攻击,无论使用哪种云提供商。它使安全性具有“提供商无关性”,这意味着无论系统在哪里运行都是安全的。
  • 速度提升: 由于 ChannelGuard 可以在坏消息到达昂贵且缓慢的 AI 模型之前将其拦截,它实际上提高了系统的速度。对于“提示词注入”攻击(即在正门处的诡计),ChannelGuard 比未受保护的系统快了 3.30 倍,因为它通过早期切断坏消息,节省了计算机进行不必要工作的资源。
  • 没有智力损耗: 系统并没有变“笨”。在没有任何攻击的数学问题(GSM8K)测试中,ChannelGuard 保持了完全相同的准确率(0.867),证明它不会误伤好的想法。
  • 弱点: 该系统并非完美。如果攻击者知道“坏词组”列表,并使用意思相同但表达不同的词来重写他们的诡计(称为“自适应改写”),闸门就会感到困惑。在这种情况下,系统的失败率约为 66%,与未受保护的系统持平。作者承认,对于这类聪明的、经过改写的诡计,另一种防御方式(即改变词汇以迷惑攻击者的防御方式)效果更好。

总结

论文得出结论,我们不能仅仅信任云公司来保护我们的 AI 团队。我们需要在团队内部建立自己的守卫。ChannelGuard 表明,通过在每个机器人之间设置简单、快速的检查站,我们可以捕捉到那些溜过正门的攻击,并在它们扩散之前阻止它们。虽然它不能捕捉到所有类型的诡计(尤其是那些自我改写的诡计),但它将“借来的安全”转化为了“拥有的安全”,使系统无论在何处运行都足够可靠。作者发布了所有的数据和代码,以便他人核查其工作,证明了 AI 团队的安全性需要构建在架构之中,而不仅仅是寄希望于外部。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →