← 最新论文
🤖 AI

Benchmarks for Trajectory Safety Evaluation and Diagnosis in OpenClaw and Codex: ATBench-Claw and ATBench-CodeX

该论文提出了 ATBench-Claw 和 ATBench-CodeX 两个领域定制基准,通过针对 OpenClaw 和 Codex 运行环境自定义三维安全分类法,在共享的 ATBench 生成框架下实现了对智能体轨迹安全性的评估与诊断。

原作者: Zhonghao Yang, Yu Li, Yanxu Zhu, Tianyi Zhou, Yuejin Xie, Haoyu Luo, Jing Shao, Xia Hu, Dongrui Liu

发布于 2026-04-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhonghao Yang, Yu Li, Yanxu Zhu, Tianyi Zhou, Yuejin Xie, Haoyu Luo, Jing Shao, Xia Hu, Dongrui Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 ATBench 的“智能体安全体检中心”的升级版。为了让你更容易理解,我们可以把 AI 智能体(Agent)想象成刚入职的超级实习生,而这篇论文就是关于如何给这些实习生在不同工作环境下进行安全考核的故事。

1. 核心背景:实习生变了,考核表也得变

想象一下,你公司新招了一批超级聪明的 AI 实习生。

  • 以前:它们主要在“办公室”里工作(比如写写代码、查查资料),我们有一套通用的《安全考核表》(ATBench)来检查它们会不会乱说话、泄露机密或搞破坏。
  • 现在:这些实习生开始去更复杂的“现场”工作了。
    • 有的实习生去了**“全能工具间”**(OpenClaw):它们能直接操作各种外部工具、发送消息、管理会话,甚至能访问别人的文件。
    • 有的实习生去了**“代码工厂”**(CodeX):它们直接操作代码仓库、运行脚本、安装依赖包,甚至能修改服务器配置。

问题来了:如果还用以前那张通用的《安全考核表》去考它们,就不够用了。因为在“工具间”里,最大的风险是“乱发消息”或“会话被劫持”;而在“代码工厂”里,最大的风险是“删库跑路”或“植入恶意代码”。

这篇论文就是为了解决这个问题:如何快速为不同的工作环境定制一套新的安全考核标准,而不需要重新发明整个考核系统。


2. 核心方法:像搭乐高一样定制“体检标准”

作者没有推翻原来的系统,而是设计了一个**“乐高式”的定制方案**。

原来的 ATBench 系统就像一个通用的体检骨架,它有三个核心维度(就像体检的三个项目):

  1. 风险来源(哪里出的问题?是用户指令太坏,还是工具本身有毒?)
  2. 失败模式(怎么出错的?是计划错了,还是操作太鲁莽?)
  3. 现实危害(最后造成了什么后果?是丢了钱,还是泄露了隐私?)

这篇论文的妙处在于:
它保留了这套“体检骨架”和“体检机器”(数据生成引擎),但允许我们更换“体检项目清单”

  • ATBench-Claw(工具间版)

    • 场景:实习生在操作各种外部工具。
    • 定制重点:我们给清单加上了“会话身份混淆”、“跨工具攻击”、“审批绕过”等新项目。
    • 比喻:就像给去“工具间”的实习生加考“会不会乱按别人家的门铃”或“会不会把别人的钥匙串弄混”。
  • ATBench-CodeX(代码工厂版)

    • 场景:实习生在操作代码仓库和服务器。
    • 定制重点:我们给清单加上了“仓库文件注入”、“破坏性脚本执行”、“依赖包投毒”等新项目,并重新解释了“提示词注入”在代码环境下的含义。
    • 比喻:就像给去“代码工厂”的实习生加考“会不会不小心把工厂的承重墙拆了”或“会不会在代码里藏炸弹”。

总结:系统不用换,只需要根据实习生要去的地方,重新填写一张“风险检查清单”,然后让系统自动生成对应的“考题”和“标准答案”。


3. 实验结果:谁更靠谱?

作者用这套新系统测试了各种 AI 模型(就像让不同的实习生做这套新考题):

  • 普通安全卫士(Guard Models)
    • 在“工具间”(Claw)表现还行,但在“代码工厂”(CodeX)里,很多传统的卫士模型直接“晕头转向”,准确率大幅下降。因为它们没学过怎么识别“代码里的炸弹”。
  • 通用大模型(Instruct Models)
    • 表现不错,特别是那些参数很大的模型(如 Qwen3.5-397B),它们比较聪明,能猜出大部分危险。
  • 作者自家的系统(AgentDoG)
    • 表现最稳! 无论是在“工具间”还是“代码工厂”,它都拿到了最高的分数。
    • 比喻:就像是一个经验丰富的老工头,不管实习生去哪个车间,他都能一眼看出哪里不对劲,不仅知道“不能做”,还能精准指出“为什么不能做”以及“哪里出了错”。

4. 这篇论文告诉我们什么?(一句话总结)

AI 世界变化太快,我们不能指望一套“万能试卷”考遍所有场景。

这篇论文提出了一种**“模块化”**的思路:

只要保留核心的“体检逻辑”,然后根据实习生要去的具体环境(是去修水管还是去写代码),快速定制一份针对性的“风险检查清单”,就能让安全评估系统永远跟得上时代的步伐。

这就好比,你不需要为每个新开的分店重新装修整个大楼,只需要根据分店的业务(是卖咖啡还是卖衣服),更换一下门口的“安全警示牌”和“员工操作手册”,就能保证安全了。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →