← 最新论文
💻 computer science

ChronosAttack: Adversarial Tool Scheduling Attacks on LLM Agents

本文介绍了 ChronosAttack,这是一种新颖的对抗性技术,通过操纵异步大语言模型(LLM)智能体中真实工具响应的响应时机,在不修改内容的情况下改变决策结果,证明了响应顺序本身构成了跨多种模型的显著攻击面。

原作者: Arash Vashagh

发布于 2026-08-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Arash Vashagh

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

现代人工智能已经从单纯回答问题的系统演变为能够采取行动的智能体。这些智能体作为数字助手,能够触及外部世界,利用软件工具查看天气预报、预订航班或检索数据库条目。它们不仅仅是在阅读静态文档;它们在与动态环境进行交互,等待工具完成工作,然后利用这些新信息来决定下一步该做什么。这一过程依赖于一系列事件:智能体提出问题,工具执行工作,工具返回答案,然后智能体利用该答案继续推进。为了使这些系统安全可靠,我们不仅需要了解它们接收到了什么信息,还需要了解信息的到达时间如何塑造它们的决策。

研究人员早已知晓,信息的呈现顺序会改变人类或机器对情境的解读方式。如果选项列表被重新排序,排在顶部的选项往往比底部的选项显得更重要。本文探讨了一种利用这一原理来攻击 AI 智能体的新颖且微妙的方式。这项名为 ChronosAttack 的研究调查了攻击者是否可以通过延迟诚实、未经修改的工具响应的到达时间,来改变智能体的最终决策。攻击者不需要黑入工具,不需要更改数据,也不需要注入虚假指令。他们只需要控制时钟,将特定的信息信息稍作拦截,时间长到足以改变智能体看到该信息的顺序。

研究人员在来自主要科技公司的四种不同的强大 AI 模型上测试了这一想法。他们设定了一个场景,即智能体必须根据工具提供的三个独立证据在三个选项中做出选择。在正常情况下,工具会按自然、逻辑的顺序返回答案。在攻击场景中,研究人员对特定的响应引入了微小且受控的延迟。这些延迟非常微小,以毫秒(即一秒钟的几分之一)为单位进行测量,但足以打乱智能体接收证据的顺序。证据的内容完全相同;改变的仅仅是时间。

结果显示,这种对时间的简单操纵可以剧烈地改变智能体的选择。在某些情况下,延迟导致智能体以高置信度将决策转向了一个特定的目标选项。例如,其中一个模型最初只有 10% 的概率选择某个选项,但在证据顺序发生偏移后,该选项的选择率上升到了 83%。另一个模型表现出了更加戏剧性的反应,但方向相反:当顺序改变时,它几乎完全放弃了原有的选择。第三个模型则保持相对稳定,这表明并非所有系统在面对此类定时攻击时都同样脆弱。研究发现,这种效应并不局限于那些具有记忆功能的智能体;即使智能体同时处理所有信息,仅仅改变文本出现的顺序就足以扭转决策。

研究人员还检查了更大的延迟是否会导致更强的攻击。他们发现,延迟的大小并不如其创造的特定顺序重要。一个仅导致两个证据顺序交换一次的微小延迟,其效果往往与导致多次交换的较大延迟一样有效。这表明,漏洞在于智能体如何权衡信息的序列,而非干扰的幅度。为了应对这一问题,团队测试了两种防御策略。一种策略是等待所有工具完成工作后再将结果呈现给智能体,从而确保信息以固定、安全的顺序到达。另一种策略是要求智能体使用每种可能的排列顺序多次进行决策,并且只有当结果保持一致时才接受答案。这两种方法都显著降低了攻击者控制结果的能力,尽管其有效性因所使用的具体 AI 模型而异。

这项工作揭示了工具响应的时间是一个在很大程度上被忽视的安全边界。它证明了智能体的决策过程对输入的节奏非常敏感,即便这些输入是完全真实的。该研究并不声称这种漏洞存在于每一个现实世界的系统中,也不暗示所有的 AI 智能体都面临同样的风险。相反,它提供了一个清晰的证明,即事件的序列是一个可以被操纵以改变结果的变量。通过展示不到一秒钟的延迟就能将决策从一个选项转移到另一个选项,这项研究凸显了 AI 安全的一个新前沿。它表明,随着这些智能体越来越多地融入我们的数字生活,确保它们能够抵御时间的微妙影响,将与保护它们免受虚假数据或恶意指令的影响同样重要。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →