Builder, Defender, Breaker: The Case Against Removing the Human from the AI-Driven Security Lifecycle
本文认为,将人类从人工智能驱动的安全生命周期中移除是根本性的错误,因为这消除了构建、防御与测试角色之间必要的独立性,从而导致了共同的盲点、责任制的削弱,并使系统面临可预测的对抗性利用风险。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下在一个高风险的建筑项目中,你需要建造一座堡垒、守卫它,然后尝试攻破它以寻找弱点。在过去,你会为这些工作聘请三个不同的团队:建造者(Builders)、防御者(Defenders)和破坏者(Breakers)。
这篇文章指出,我们目前正急于用一个单一的、超级智能的 AI 机器人来取代这三个人类团队。其核心逻辑是:如果这个机器人能够编写代码,那么它也可以检查自己的工作并尝试黑入自己的创造物。作者 Mohamed Chahine Ghanem 表示,这听起来很高效,但实际上是一个危险的陷阱。
以下是为什么在这一过程中移除人类是一个错误做法的详细分析,使用了简单的类比:
1. “单脑”问题(单一种植模式)
想象一下,如果设计堡垒的人、守卫大门的人以及尝试撬锁的人都是同一个人的克隆体。他们上了同样的学校,读了同样的书,并且以完全相同的方式思考。
- 风险: 如果这一个“大脑”存在盲点(即他们不知道自己犯下的错误),那么所有三个角色都将拥有同样的盲点。
- 结果: 建造者犯了一个错误。防御者(因为其思维方式与建造者一致)没有发现它。破坏者(同样也与建造者思维一致)不知道如何找到它。由于所有人都在通过同一副眼镜观察世界,这个缺陷就从缝隙中溜走了。论文称之为**“算法单一种植模式”(algorithmic monoculture)**。
2. “批改自己作业”问题(神谕问题)
在学校里,如果你写了一篇论文然后自己给自己评分,你很可能会给自己打高分,因为你知道自己“本意”想表达什么,即使你并没有表达清楚。你会对自己的作品产生偏见。
- 风险: 当 AI 编写代码,然后又编写测试用例来检查这段代码时,它本质上是在批改自己的作业。它检查的是代码是否符合其自身的预期,而不是代码在现实世界中是否真的有效。
- 结果: 系统变成了一个闭环,它只会确认它已经相信的事实。因为它缺乏一个独立的“老师”(人类)来指出:“等等,这根本不合逻辑”,所以它失去了发现真实错误的能力。
3. “速度陷阱”(脱离循环)
想象一位赛车手速度极快,以至于人类安全官无法跟上。起初,安全官会观察赛车;接着,赛车变得太快,安全官只能在事后看一份摘要;最后,赛车快到安全官只是一个乘客,只能在撞车发生后收到一份报告。
- 风险: AI 以机器的速度运行。如果一个 AI 在几秒钟内发现并修复了一个漏洞,人类不可能停下来进行检查,否则会拖慢进度。因此,我们开始移除人类的“停止”按钮。
- 结果: 人类从“在循环内”(做出决策)逐渐变为“在循环上”(观察),最后变为“在循环外”(仅仅是观看结果)。等到人类意识到出了问题时,AI 已经犯下了数千个错误。
4. “可预测的目标”(对手)
安全是一场猫鼠游戏。如果老鼠(防御者)总是以同样的方式思考,那么猫(黑客)就能精准地学会如何抓住它。
- 风险: 如果使用同一个 AI 模型来进行构建、防御和测试,整个系统就会变得可以被预测。黑客只需要弄清楚如何欺骗一种类型的 AI,就可以欺骗整个系统。
- 结果: 这就像是用一种类型的锁来建造城堡。一旦小偷撬开了这种锁,整个城堡就会沦陷。论文指出,在现实世界的测试中,那些擅长攻击其他机器的 AI 系统,在面对能够进行创造性且不可预测思考的人类时,表现得极其糟糕。
5. “无人负责”问题(问责制)
如果一个人类建造者犯了错,你可以问他:“你为什么要那样做?”并追究他的责任。如果一台机器犯了错,你问谁呢?
- 风险: 如果 AI 构建、防御并测试自身,而出了问题(例如发生了大规模的安全漏洞),就没有人可以承担责任。机器并没有“选择”失败,它只是执行了代码。
- 结果: 这造成了**“问责真空”**。如果没有人类来签署并认可工作成果,系统就会失去那种源于“必须为自己的行为负责”而产生的纪律感。
解决方案:让位于人类掌控全局
本文并不是说我们要停止使用 AI。事实上,AI 在处理繁重任务、快速编写代码以及发现明显漏洞方面表现出色。
然而,作者认为人类必须保持作为操作的“大脑”。
- AI 应该是手和眼睛(执行工作)。
- 人类 必须是提供独立判断的大脑。
我们需要人类充当“外部神谕”(批改作业的老师)、“断路器”(按下紧急停止键的人),以及承担责任的人。如果我们完全移除人类,我们不仅仅是在自动化一项工作,我们是在破坏维持数字世界安全的整个安全系统。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。