← 最新论文
💻 computer science

BraveGuard: From Open-World Threats to Safer Computer-Use Agents

BraveGuard 是一个自我进化的防御框架,它通过挖掘开放世界中的威胁来生成用于训练护卫模型的真实智能体轨迹,与基于静态基准的方法相比,显著提升了对计算机使用智能体的安全性检测能力。

原作者: Yunhao Feng, Yifan Ding, Xiaohu Du, Ming Wen, Xinhao Deng, Yanming Guo, Yuxiang Xie, Baihui Zheng, Yingshui Tan, Yige Li, Yutao Wu, Yixu Wang, Kerui Cao, Wenke Huang, Xingjun Ma, Yu-Gang Jiang

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Yunhao Feng, Yifan Ding, Xiaohu Du, Ming Wen, Xinhao Deng, Yanming Guo, Yuxiang Xie, Baihui Zheng, Yingshui Tan, Yige Li, Yutao Wu, Yixu Wang, Kerui Cao, Wenke Huang, Xingjun Ma, Yu-Gang Jiang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你雇佣了一位超级聪明的数字助手。这位助手不仅仅能聊天,它还能打开文件、浏览网页、在电脑终端输入命令以及安装软件。这就像是把整个办公室、你的档案柜甚至银行账户的钥匙都交给了人类实习生。

问题在于?用户的一句坏话可能很容易被发现,但一个**计算机使用智能体(computer-use agent)**可能会通过一系列看似无害、长而复杂的微小步骤被诱导做出危险行为。

把它想象成一个由微小、看似无害的行为组成的“特洛伊木马”:

  1. 智能体打开一个文本文件(无害)。
  2. 它读取一个配置文件(无害)。
  3. 它下载一个“辅助”脚本(看起来无害)。
  4. 它运行该脚本,而该脚本秘密删除了你的数据库(灾难)。

从个体来看,步骤 1 到 3 看起来都没问题。但整个故事却是一场灾难。现有的安全防护机制就像是只盯着前门(第一个提示词)或后门(最终答案)看的监控摄像头,它们会错过窃贼在偷走电视机之前,是如何穿过厨房、客厅和卧室的。

走进 BraveGuard:“自我进化的安全主管”

这篇论文介绍了一种名为 BraveGuard 的新系统,旨在捕捉这些长期的、隐蔽的攻击。BraveGuard 不是一个只说“不要做 X”的静态规则手册,它是一个通过实践来学习的自我进化系统。

它是如何工作的,我们用一个简单的类比来说明:

1. 智能侦察员(开放世界威胁发现)

想象一位安全主管,他不仅仅坐在办公室里阅读旧手册。相反,他不断扫描新闻、研究论文和黑客论坛,以了解犯罪分子今天正在发明哪些新花招。

  • BraveGuard 的做法: 它阅读有关计算机安全的最新研究,以寻找智能体可能被误导的新方式。它构建了一份关于新攻击模式的“通缉名单”。

2. 训练场(攻击合成与演练)

一旦主管知道某种新花招的存在了(例如,“黑客将恶意代码隐藏在 PDF 中”),他们不会仅仅写下一条规则。他们会将其演出来

  • BraveGuard 的做法: 它创建一个虚假场景,让智能体尝试执行这个新花招。它让智能体运行整个过程,记录每一次点击、打开文件和输入的命令。它捕捉的是整部电影,而不仅仅是预告片。

3. 评审委员会(轨迹监督)

在智能体运行完场景后,人类(或一个智能系统)会观看完整的录像。他们进行标注:是“安全”还是“不安全”。至关重要的是,他们会根据事件的序列解释为什么它是不安全的。

  • BraveGuard 的做法: 它将这些录像转化为一种新型安全卫士(即“防护模型”)的教科书。这个卫士学会了观察整个动作历史,而不仅仅是最后一句。

4. 循环(自我进化的防御)

这是神奇之处。系统会对这个新卫士进行测试。如果卫士漏掉了某个棘手的攻击,系统会分析哪里出了问题,并利用这个失败案例来创建更难的训练场景。

  • 类比: 这就像是一款电子游戏,每当你击败 Boss 时,Boss 都会变得更强。卫士学得越多,训练就变得越聪明,从而形成一个跟上现实世界威胁步伐的循环。

结果:巨大的升级

论文在两个主要的“考试”数据集(AgentHazard 和 ATBench)上测试了这种新卫士与标准安全模型的表现。

  • 旧有的卫士: 标准的安全模型(那些“现成的”模型)在识别这些长期、隐蔽攻击方面表现极差。在一项测试中,它们仅能捕捉到大约 39% 的危险场景。它们就像是只检查大门身份验证,却忽略建筑内部发生什么的保安。
  • BraveGuard: 在针对这些真实的、全景式的场景进行训练后,新的卫士捕捉到了 82% 的攻击。

为什么这很重要(根据论文观点)

论文认为,针对计算机使用智能体的安全性不能仅通过查看对话的开始或结束来解决。你必须观看整部电影。

  • 静态 vs 动态: 旧系统就像一本印刷好的字典;它们只知道书里写的词汇。BraveGuard 则像是一个活的语言学习者,每当现实世界出现新的俚语或威胁时,它都会更新自己的词汇量。
  • 现实性: 通过在实际的计算机操作(文件、终端、浏览器)上进行训练,而不是仅仅使用虚假的文本提示,卫士学会了如何识别导致真实伤害的微妙且具有累积效应的危险。

简而言之,BraveGuard 是一个通过在安全的模拟环境中观察智能体如何被黑客攻击,从而学习如何识别这些技巧,以便在现实世界发生同样情况时能够及时发现。它将明天的“未知”威胁转化为了今天的“已知”教训。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →