← 最新论文
🤖 AI

To Defend Against Cyber Attacks, We Must Teach AI Agents to Hack

本立场文件认为,为了应对不可避免的 AI 驱动型网络攻击,防御者必须通过在受控且受监管的环境中负责任地开发并部署自身的进攻性 AI 能力,从而在对手之前掌握威胁,以此从根本上转变其战略。

原作者: Terry Yue Zhuo, Yangruibo Ding, Wenbo Guo, Ruijie Meng

发布于 2026-02-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Terry Yue Zhuo, Yangruibo Ding, Wenbo Guo, Ruijie Meng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心理念:旧规则已不再奏效

在过去的十年里,网络安全一直像是在玩一场**“打地鼠”的游戏**。

  • 旧方式: 黑客必须是高技能的人类。构建一次复杂的攻击就像盖一座定制房屋;这需要数月的艰苦工作和深厚的专业知识。因为成本太高且速度太慢,黑客只会攻击“大房子”(大型企业),或者使用简单的通用工具去敲无数扇门,希望能撞开其中一扇。防御者假设黑客无法负担敲遍每一扇门的代价。
  • 新威胁: AI智能体正在改变游戏规则。想象一下,黑客不再是一个人,而是一个由成千上万个微小、不知疲倦的机器人组成的集群。这些机器人不需要是专家。它们可以在一秒钟内敲击数百万扇门。即使失败率高达99%,只要成功率达到1%,它们就能实现盈利。它们可以攻击那些人类过去因为不值得投入精力而忽略的“小房子”(利基系统)。

该论文认为,目前的防御者正试图通过在机器人身上贴上“禁止进入”的告示牌来阻止这些机器人。 但论文指出,这行不通,因为坏人可以不贴告示牌就制造出自己的机器人。

为什么现有的防御手段正在失效

作者指出,我们正尝试用三种主要方法来阻止AI黑客,但这些方法都像是试图用筛子挡住洪水:

  1. 过滤训练数据(“洁净图书馆”方案):

    • 其理念: 我们从AI的训练书籍中删除所有坏指令(如“如何制造炸弹”),让它永远学不会变坏。
    • 为何失效: 坏黑客不需要阅读“坏书”。他们可以教AI利用基础逻辑和常识来摸索如何进行攻击,就像人类无需手册也能摸索如何撬锁一样。此外,坏黑客可以直接下载AI并亲自进行教学。
  2. 安全对齐(“良好行为”方案):

    • 其理念: 我们训练AI在被要求做坏事时说“不”。
    • 为何失效: 坏黑客很聪明。他们可以误导AI,让AI认为一个坏请求其实是一个好请求(比如要求保安“测试安全性”而不是“破门而入”)。此外,如果AI运行在黑客自己的电脑上,他们可以直接重新训练AI,让它忽略“不”这个按钮。
  3. 输出护栏(“保镖”方案):

    • 其理念: 我们在门口放一个保镖,检查AI发送的每一条消息,并拦截看起来危险的内容。
    • 为何失效: 黑客可以将一次大规模攻击分解为一千个看似无害的小步骤。保镖看到每个步骤都是安全的,但当你把它们组合在一起时,它们就能制造出一枚炸弹。

提议的解决方案:打造你自己的“红队”机器人

论文提出了一个激进的转变:我们必须教会我们自己的AI智能体如何进行攻击,这样我们才能利用它们来保护自己。

这就像是一个消防队

  • 目前的防御: 我们等待火灾发生,然后尝试灭火。
  • 论文的理念: 我们聘请一支专业的纵火犯团队(我们的“进攻性AI”),让他们在受控的、封闭的训练设施(“网络靶场”)内工作。
    • 这些“好纵火犯”会尝试用尽各种手段来烧毁建筑。
    • 因为它们是AI,它们可以在几秒钟内尝试数百万种引发火灾的方法。
    • 我们观察它们在哪里成功,找出我们建筑的薄弱环节,并在真正的坏人出现之前修复它们。

实现这一目标的三个步骤

作者知道这听起来很危险,因此他们提出了三条严格的规则,以确保“好纵火犯”不会造成真实的破坏:

  1. 建立更好的测试赛道: 我们需要更好的“驾驶课程”(基准测试)来衡量这些黑客机器人的水平。我们需要在真实场景中测试它们,而不仅仅是简单的谜题。
  2. 侧重训练,而非仅仅编写脚本: 我们不应该只给机器人一套固定的步骤清单,而是要训练它们学习和适应,就像人类黑客那样。这能让它们更好地发现全新的、未知的弱点。
  3. “沙盒”规则: 这是最重要的部分。“好纵火犯”绝不能离开受控的训练设施。
    • 它们必须留在数字笼子里,无法接触真实的互联网。
    • 它们寻找漏洞并撰写报告。
    • 然后,我们将那份报告交给另一个只知道如何“修补漏洞”而不知道如何“制造漏洞”的“安全AI”。这个“安全AI”才是我们向公众发布的,用于保护我们系统的工具。

总结

论文得出结论,我们不能等待坏黑客学会如何使用AI来攻击我们。等到那时,一切都太晚了。

相反,我们必须先掌握武器。我们需要建立自己的进攻性AI,将其锁在安全的笼子里,并利用它来发现系统中每一个可能的破绽。只有通过理解敌人如何在如此大规模的尺度下思考和行动,我们才有希望实现自我防御。

简而言之: 为了阻止坏机器人,我们必须建造自己的好机器人,让它们比坏机器人更擅长破坏事物,但我们必须把它们关在笼子里,这样它们才能帮助我们修缮房屋。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →