← 最新论文
🤖 AI

Cochise: A Reference Harness for Autonomous Penetration Testing

本文介绍了 Cochise,这是一个仅 597 行代码的 Python 参考框架,它实现了用于自主渗透测试的分离式规划器 - 执行器架构,使研究人员能够在活动目录游戏(GOAD)测试床上评估由大语言模型驱动的代理,同时提供用于重放、分析和轨迹数据共享的开源工具。

原作者: Andreas Happe, Jürgen Cito

发布于 2026-05-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Andreas Happe, Jürgen Cito

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人如何闯入一座数字堡垒(计算机网络)以寻找其弱点。这被称为“渗透测试”。最近,研究人员开始利用超级智能的 AI 大脑(大语言模型)来自动完成这项工作。

然而,存在一个问题:每当一个新团队构建一个 AI 黑客时,他们都会建立自己独特的车间、工具和规则手册。这就像将车库里造出的汽车与工厂里造出的宇宙飞船进行比较;你无法判断宇宙飞船更快是因为它的引擎更强大,还是仅仅因为它拥有更好的轮子。

“Cochise"登场了。

请将Cochise想象成并非一名超级间谍,而是一个标准化、透明的 AI 黑客训练健身房。它是一个小巧、简单的“ harness(工具集与规则集)”,让研究人员能够在完全相同的条件下测试不同的 AI 大脑。

以下是其工作原理,借助一些日常类比:

1. 设置:“跳板主机”

想象 AI 需要闯入一座城堡(目标网络),但让 AI 直接站在城堡门口太危险了。

  • 解决方案:Cochise 在城堡外设置了一个安全的**“起跳”平台**(一台独立的计算机)。
  • 类比:AI 坐在控制室里,通过一条长长的、安全的对讲机(SSH)告诉起跳平台上的机器人该做什么。然后,该机器人走进城堡。
  • 为什么? 如果 AI 犯错并意外炸毁了城堡,它只会破坏机器人的指令,而不会摧毁 AI 自己的大脑或控制室。这确保了实验的安全性和可控性。

2. 团队:“规划者”与“执行者”

Cochise 将 AI 的大脑拆分为两个截然不同的角色,以保持条理清晰:

  • 规划者(将军):这部分 AI 退后一步,纵观全局。它维护一份长期的待办事项清单(就像城堡的地图),并决定接下来需要做什么。它记得整个任务。
  • 执行者(士兵):这部分是短期的、专注的。它从将军那里接收具体指令(例如,“尝试打开这扇门”),运行命令,观察结果,然后在任务完成后遗忘一切
  • 类比:想象一位电影导演(规划者)和一位特技替身(执行者)。导演策划场景。特技替身执行危险的跳跃,获取结果,然后导演为下一个场景擦白板。这防止了 AI 被数小时的旧记忆所困扰。

3. “黑盒”记录器

AI 做的每一件事都被记录在一本完美、详细的日记(JSON 日志)中。

  • 类比:这就像飞机上的飞行记录仪。它记录了按下的每一个按钮、AI 产生的每一个想法、使用了多少“燃料”(金钱/Token),以及是否成功。
  • 这为何很酷? 通常,要研究这些 AI 黑客,你需要一个庞大且昂贵的计算机实验室("GOAD"测试床),其运行成本极高。Cochise 为研究人员提供了一个免费的回放套件。你不需要昂贵的实验室;你只需查看“飞行记录仪”数据,就能确切了解 AI 的行为、成本以及失败之处。

4. 为何重要(“参考 harness")

作者非常明确:Cochise 并非世界上最好的黑客。它并不试图成为终极间谍。

  • 类比:把它想象成一把标准化的尺子。你不会用尺子来建造房子;你用它是为了衡量其他工具建造房子的效果如何。
  • 因为 Cochise 非常小巧(仅 597 行代码,而其他项目则有数千行),其他研究人员很容易阅读、理解并修改它。这使得他们能够公平地比较不同的 AI 模型,看看哪一个实际上更聪明,而不是仅仅看哪一个拥有更花哨的设置。

总结

Cochise 是一个简单、开源的工具包,让研究人员能够公平地测试 AI 黑客。它将“思考”与“行动”分离,保持实验安全,并记录每一个细节,以便任何人都能在不需要超级计算机的情况下研究结果。它将 AI 安全研究混乱的世界转变为一种公平、可测量的科学。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →