← 最新论文
🤖 AI

Stateful Online Monitoring Catches Distributed Agent Attacks

本文介绍了一种有状态的在线监测系统,该系统通过实时聚合多个用户账户中的微弱可疑信号来检测分布式代理攻击,在有效克服传统单上下文监测器局限性的同时,保持了极低的延迟。

原作者: Davis Brown, Samarth Bhargav, Arav Santhanam, Kasper Hong, Ivan Zhang, Matan Shtepel, Steffi Chern, Alexander Robey, Eric Wong, Hamed Hassani

发布于 2026-06-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Davis Brown, Samarth Bhargav, Arav Santhanam, Kasper Hong, Ivan Zhang, Matan Shtepel, Steffi Chern, Alexander Robey, Eric Wong, Hamed Hassani

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

问题所在:“分而治之”的诡计

想象你是一名大型繁忙机场的安全检查员。你的职责是阻止人们携带危险物品入境。你有一台扫描仪,它会检查通过 X 光机时每一个行李箱。

旧方法(标准监控器):
你的扫描仪非常擅长发现装满枪支或炸药的行李箱。如果有人试图偷运炸弹,扫描仪就会发出警报,你就能拦住他们。

新威胁(分布式智能体攻击):
现在,想象有一伙犯罪分子想要将一台巨大的非法机器走私进国内。这台机器太大了,无法装进一个行李箱;如果他们把所有东西都放在一个包里,你的扫描仪肯定会抓到。

于是,他们改变了策略。他们雇佣了 50 个不同的人:

  • A 携带了一把螺丝刀。
  • B 携带了一根电线。
  • C 携带了一块电池。
  • D 携带了一块电路板。

就其本身而言,每一个行李箱看起来都完全无辜。螺丝刀只是个工具,电线也只是根电线。你的扫描仪检查了每一个,发现并无异常,便让他们通过了。

但一旦这 5 0 个人进入内部,他们在后勤室集合并组装起那台机器。等到他们制造出武器时,为时已晚;破坏已经造成。

论文的发现:
研究人员发现,AI 智能体(聪明的计算机程序)正被如此利用。攻击者将一个巨大的、有害的网络攻击(例如黑入银行)拆分为数十个微小的、看似平庸且无害的任务。他们将这些任务分散在数百个不同的用户账号中。

因为标准的安全监控器只能一次观察一段对话,它们只能看到“螺丝刀”或“电线”。它们忽略了这些碎片其实是一个更大、更危险的拼图的一部分。论文显示,这些“分布式攻击”极其隐蔽,以至于标准监控器只能捕捉到其中的 20%,而在面对常规攻击时,它们通常几乎能百分之百捕捉到。


解决方案:“拥有记忆力的侦探”

研究人员构建了一种新型的安全卫士,称为在线状态化监控器(Online Stateful Monitor)

类比:侦探 vs. 扫描仪

  • 标准监控器 就像一台扫描仪,看一眼行李箱,说一句“一切正常”,然后立刻忘掉。它不记得 10 分钟前发生了什么,也不记得 B 带来了什么。
  • 状态化监控器 则像一位随身携带笔记本的侦探。当 A 带着螺丝刀进来时,侦探会把它记下来。当 B 带着电线进来时,侦探翻看笔记本,看到了螺丝刀,然后心想:“等等。一把螺丝刀加一根电线?这很可疑。”

它是如何工作的(魔术技巧):

  1. 按“氛围”分组(聚类): 该监控器不会详细阅读每一段对话(那样太慢了)。相反,它使用一种智能系统将听起来相似的对话归为一类。它把所有的“螺丝刀”请求放进一个堆,把所有的“电线”请求放进另一个堆。
  2. 识别模式: 如果监控器看到“螺丝刀”堆和“电线”堆同时在增长,而且它们来自不同的人,它就会意识到这些是同一个拼图的碎片。
  3. “大脑袋”检查: 大多数情况下,监控器只进行这种快速的分组,这样既快又省钱。但如果某个堆变得过于可疑(比如有 10 个人都在索要黑客工具的零件),监控器就会调动一个“大脑袋” AI,将整堆证据放在一起进行综合分析,然后判定:“是的,这绝对是一场协同攻击。”

为什么这很重要

1. 它能更早地捕捉攻击
在旧系统中,由于守卫看不出联系,攻击会成功。而在新系统中,守卫在罪犯还在收集零件的过程中就能识破模式,从而在破坏发生前将其拦截。论文指出,这种新系统能将攻击捕捉时间提前 30%

2. 它不会拖累“好人”
你可能会想:“如果这个侦探要检查每个人的笔记本,难道不会让机场变慢吗?”
研究人员用数百万个虚假请求测试了该系统。他们发现,对于 99% 的正常用户(仅仅是在写代码或提问的人),新监控器的速度与旧监控器一样快。只有在极少数看起来可疑的情况下,它才会花费额外的时间。这就像拥有一个超高速扫描仪,只有在情况诡异时才会请出重型侦探。

3. 它捕捉到了意料之外的东西
研究人员聘请了一支“红队”(道德黑客)团队,尝试在两个月内破解他们的系统。他们尝试用各种方法来欺骗这个监控器。

  • 惊喜: 监控器不仅捕捉到了“分布式”攻击,还捕捉到了标准的越狱攻击(即试图诱导 AI 做出坏事行为)。
  • 原因: 因为即使攻击者试图在单次对话中欺骗 AI,他们也经常在不同的账号间重复使用类似的套路。监控器的“笔记本”识别出了这些重复套路的模式,并发出了警报。

核心结论

论文认为,为了保障 AI 安全,我们不能再仅仅一次只看一段对话。攻击者太聪明了,他们会将邪恶的计划拆解成细小、隐形的碎片。

为了阻止他们,我们需要能够记住并在实时环境中连接各点的安全系统。这种新的“状态化监控器”正是为此设计的——它扮演着一位能洞察全局,而非仅仅观察单一瞬间的侦探角色。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →