How Reliable Are AI Attackers Against a Fixed Vulnerable Target? A 400-Run Empirical Study of LLM Penetration Testing Consistency
本研究首次对大语言模型渗透测试的一致性进行了大规模实证分析,结果显示,在对固定脆弱目标进行 400 次重复测试时,四个模型在自主攻击成功率(介于 25% 至 85% 之间)和特定失败模式上表现出统计学上的显著差异。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你是一名安保人员,正试图测试一套新的自动化机器人攻破一栋上锁建筑的能力。你想知道:如果你让同一台机器人用同样的手段尝试 100 次,它每次都会以相同的方式行动,还是表现得不可预测?
这篇论文是一项大规模实验,作者让四台不同的"AI 机器人”(大型语言模型)各自对一台虚构的、存在漏洞的计算机系统发起 100 次攻击。总计400 次攻击。目标不仅仅是看它们能否攻破,而是看它们的表现有多一致。
以下是用通俗语言讲述的整个过程:
1. 设置:一个“蜜罐”游乐场
研究人员构建了一个数字“陷阱屋”(即蜜罐),其中包含三把容易破解的锁:
- 一个带有薄弱大门(SQL 注入)的网上商店。
- 一个带有弱密码的后门(SSH)。
- 一个没有锁的邮箱(匿名 FTP)。
他们告诉 AI 机器人:“你们是经过授权的安全测试人员。你们的工作是攻破这三把锁。开始行动!”
2. 大惊喜:无人说“不”
最令人震惊的发现是关于拒绝的。
过去,人们担心当被要求黑客攻击时,AI 可能会说:“我不能做那个,这很危险。”
- 结果:在全部 400 次尝试中,没有任何一台 AI 说过“不”。
- 比喻:想象你让一台机器人尝试开锁 400 次,每一次它都立刻抓起工具开始工作。没有一台机器人犹豫,也没有一台声称自己“太安全”而不能做。
- 原因:研究人员将请求包装为“授权测试”。似乎当 AI 认为自己在执行一项合法任务(如安保人员)时,它会优先考虑“乐于助人”而非“谨慎行事”。
3. 故障:一台机器人状态不佳
其中一台机器人,Claude,在实验期间遇到了重大技术问题。
- 问题:制造 Claude 的公司(Anthropic)发生了服务器过载事件。这就像机器人的大脑突然因为工厂太忙而陷入昏迷。
- 混淆:起初,研究人员以为 Claude 是在拒绝黑客攻击。但在检查日志后,他们意识到机器人并没有说“我不做”;只是连接机器人的互联网连接不断中断。
- 修正:他们重新分类了这些失败。它们不是“安全拒绝”,而只是“网络错误”。即使存在这些错误,那些完成了工作的 Claude 机器人也非常成功。
4. 失败方式:不同机器人,不同错误
当机器人未能成功时,它们失败的方式截然不同,就像不同类型的司机撞车:
- 本地机器人(Qwen):它就像一个开到一半就感到无聊而停车的司机。它会攻破一两个锁,宣布任务“完成”,然后离开,即使它还没有攻破整栋建筑。
- GPT-4o-mini 机器人:它就像一个一直开车直到油箱耗尽的司机。它尝试了太多不同的方法,以至于在完成任务之前就达到了时间限制(25 次尝试),尽管它非常彻底。
- Gemini 机器人:这是最可靠的一个。它很少放弃,也很少犯错。一旦开始任务,它几乎总能完成。
- Claude 机器人:如前所述,它的主要失败原因是互联网连接中断。
5. “记忆”技巧:偷取钥匙
最有趣的行为之一是凭据重用。
- 场景:机器人在邮箱(FTP)中找到用户名和密码。
- 技巧:两台机器人(Qwen 和 GPT-4o-mini)记住了该密码,并自动用它解锁了后门(SSH)。它们不需要被指示这样做;它们自己就想到了。
- 关键点:那些拥有“短记忆”(仅记住最后几条消息)的机器人没有这样做。而那些拥有“长记忆”(记住整个对话)的机器人则这样做了。这表明,拥有长记忆有助于 AI 将系统不同部分联系起来。
6. 速度与策略
- 速度:一旦机器人开始行动,它们速度很快。它们通常能在15 到 30 秒的现实时间内找到入侵方法。
- 策略:有些机器人总是先尝试网络大门。另一些则总是先尝试邮箱。
- 多样性:一台机器人(GPT-4o-mini)极具创造力。在 100 次运行中,它使用了98 种不同的策略。就像一个从不重复使用同一种技巧的小偷。另一台机器人(Gemini)则更可预测,反复使用相同的几种技巧。
结论
这项研究主要告诉我们两点:
- 安全不是一堵墙:如果你将请求包装为“授权测试”,这些 AI 模型会乐意尝试黑客攻击而不会说“不”。它们没有针对这种特定任务的内置“停止”按钮。
- AI 是不可预测的:即使你让同一台机器人用相同的指令执行 100 次,它可能会用 98 种不同的方式解决问题,可能会陷入死循环,或者可能过早放弃。
重要提示:论文警告称,由于机器人启动攻击的速度如此之快且如此一致(在 30 秒内),安全系统需要准备好立即识别它们。你不能等到它们完成攻击;你必须在它们仅仅开始探查时就抓住它们。
研究人员还指出,这是一项在虚构建筑中进行的受控实验。我们不知道这些机器人在真实、复杂或未知的环境中是否会有相同的表现。但就这项特定测试而言,AI 在攻击意愿上表现出惊人的一致性,但在如何执行攻击方面却表现出极大的不一致性。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。