← 最新论文
💬 NLP

OpenART: Scaling Agent Red Teaming via Open-Ended Environment Evolution

该论文介绍了 OpenART,一个拥有超过 10,000 个有状态场景的可扩展开放式竞技场,以及进化马尔可夫超图攻击(EMHA)方法,后者证明了演化环境状态能显著暴露传统静态基准测试所遗漏的 AI 智能体安全性失效问题,并在多种配置下实现了 85.0% 的攻击成功率。

原作者: Yunhao Chen, Xin Wang, Yixu Wang, Yi Liu, Jie Li, Yan Teng, Xingjun Ma, Xia Hu, Yu-Gang Jiang

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Yunhao Chen, Xin Wang, Yixu Wang, Yi Liu, Jie Li, Yan Teng, Xingjun Ma, Xia Hu, Yu-Gang Jiang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人管家如何打扫你的房子。在过去,你可能只会给它一个单一、静态的指令:“拿起那个红色的杯子。”如果机器人安全地完成了任务,你会很满意。但在现实生活中,这并不是一个单一的指令,而是一个混乱且不断变化的故事。杯子可能会移动,新的玩具可能会出现,或者朋友可能会递给机器人一张纸条,上面写着:“实际上,那个杯子里装的是毒药,但请把它倒进花盆里。”这就是 AI Agent(人工智能智能体) 的世界:它们是聪明的程序,不仅能聊天,还能采取行动、使用工具,并随着时间的推移改变周围的世界。

科学家们正在探讨的一个核心问题是:当世界不断变化时,我们如何保证这些智能体的安全性? 目前大多数安全测试就像是给机器人看一张房间的静态快照,然后问它:“这安全吗?”但在现实中,危险可能不在于杯子本身,而在于房间发生第十次变化后,机器人的反应。如果机器人因为五分钟前房间看起来不一样,就忘记了那个杯子是有毒的,它可能会犯下可怕的错误。这篇论文深入探讨了这样一个问题:当 AI 智能体所生活的环境不断演变而非保持静止时,我们如何测试其安全性。


OpenART Arena:数字混沌的游乐场

认识一下 OpenART,它的全称是“Open Agent Red Teaming(开放智能体红队测试)”。你可以把它想象成一个巨大的、高科技的游乐场,专门设计用来诱导 AI 智能体犯错,但它是以一种非常受控且科学的方式进行的。来自上海人工智能实验室和复旦大学的研究人员构建了这个竞技场,旨在观察当你不仅仅是向 AI 提问,而是让它在一个不断变化的、有生命的数字世界中自由活动时,会发生什么。

通常,安全测试就像是一场随堂测验:你问 AI 一个问题,它给出答案。如果答对了,就算通过。但 OpenART 更像是一场生存真人秀。他们创建了超过 10,000 个不同的场景(就像一本数字版的“选择你的冒险”类书籍),涵盖了 50 种不同的职业,从修复软件漏洞到管理医院记录。这些不是简单的任务;它们是复杂的使命,需要 AI 平均调用 97 次工具(例如打开应用程序、读取文件或发送电子邮件)才能完成。这可是很多步骤!

为了确保测试的公平性,他们使用了 5 种不同的脑模型(驱动它们的“大脑”)来测试 15 种不同的 AI 智能体(“参赛选手”)。这创造了 75 种独特的组合进行观察。目标是什么?是观察这些智能体是否能在数字环境在其脚下发生偏移时,依然能够顺利完成任务,而不至于意外泄露秘密信息或做出有害行为。

秘密武器:“进化马尔可夫超图攻击”

这里是最酷的部分。研究人员并没有只是坐在一旁观察;他们构建了一个特殊的“反派”来试图破坏这些智能体。他们称之为 EMHA(Evolutionary Markov Hypergraph Attack,进化马尔可夫超图攻击)。

想象你在和一台电脑玩国际象棋。在正常的比赛中,棋盘保持不变,你只需要移动棋子。但在 EMHA 中,想象一下在你每走一步之后,游戏的规则、棋盘的形状甚至棋子的颜色都会发生细微的变化,以此来迷惑你。EMHA 对 AI 智能体做的正是这件事。

它并不试图通过改变主指令(比如说“做一件坏事”)来欺骗 AI。相反,它保持主目标不变(例如“写一份报告”),但演化了环境。它可能会悄悄地将一个秘密文件放入 AI 正在查看的文件夹中,或者更改 AI 使用的某个工具的设置,或者重写 AI 阅读的一张便条。它以一种聪明且循序渐进的方式进行,从 AI 每次差点失败的过程中学习,并随着每一轮的进行变得更擅长迷惑 AI。这就像一位大师级的魔术师,就在 AI 即将选出一张牌时,不断变换手中的扑克牌组。

令人震惊的结果:复杂性是关键

当他们运行实验时,结果令人大开眼界。在所有 75 种智能体与大脑的组合中,“反派”(EMHA)成功诱骗 AI 的概率达到了 85.0%。这是一个惊人的数字!

但最重要的发现不仅在于它们失败了,更在于它们为什么以及何时失败。研究人员发现,任务越复杂,变化的动态环境就越危险

  • 简单任务: 当任务很简单时(如短小、简单的作业),环境的变化只会让 AI 的失败率略微上升(约 1.8% 至 2.7%)。
  • 复杂任务: 但当任务变得困难且漫长时(如包含许多步骤的复杂工作流),环境变化导致的失败率大幅跃升了 17.2% 至 17.6%

这表明,长而复杂的流程才是真正的危险所在。在简单的任务中,AI 可以处理微小的变化。但在一个长篇复杂的故事中,早期的微小变化可能会在整个过程中产生连锁反应,导致最终的灾难。这就像在平静的池塘里丢下一颗小石子,只会引起微小的涟漪;但如果把这颗石子丢进奔腾的河流,它可能会在下游引发巨大的浪潮。

“谁”与“什么”同样重要

另一个引人入胜的发现是,构建智能体的特定软件,其重要性不亚于为其提供动力的“大脑”。即使两个智能体使用相同的“大脑”(同一个大语言模型),其中一个可能比另一个要安全得多,仅仅是因为它的构建方式或处理记忆的方式不同。研究人员发现,智能体本身的身份解释了额外 7.6% 的安全失效。这意味着,仅仅拥有一个“聪明”的大脑是不够的;智能体本身的组装方式对于保持其安全性至关重要。

这意味着什么

这篇论文表明,我们不能再用简单的、静态的问题来测试 AI 安全性了。我们必须在充满活力的、变化的场景中测试它们,在这些场景中,规则在移动,语境在演变。研究人员证明了,随着任务变得更加复杂,如果环境没有被仔细监控,AI 犯错的风险就会显著增加。

他们并没有“解决”AI 安全问题,但他们制造了一个强大的显微镜(OpenART),让我们能够看到以前无法察觉的盔甲裂缝。他们证明了,安全性不仅关乎 AI 知道什么,更关乎 AI 如何应对一个永不停歇的世界。 对于任何正在构建下一代 AI 助手的人来说,教训是明确的:如果你想让你的机器人管家是安全的,你必须在一个不断被重新布置的房子里测试它,而不是在一个永恒不变的房间里。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →