Do Agents Dream of Root Shells? Partial-Credit Evaluation of LLM Agents in Capture The Flag Challenges
本文提出了名为 DeepRed 的开源基准测试,通过在隔离虚拟化环境中评估大型语言模型代理在真实 CTF 挑战中的表现,并引入基于检查点的部分评分机制,揭示了当前最先进的模型在平均检查点完成率上仅达 35%,且在需要非标准探索和长周期适应的任务中表现最为薄弱。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文就像是在给一群**“拥有超级大脑但缺乏实战经验的 AI 黑客”进行一场“模拟黑客马拉松”**。
想象一下,你有一群非常聪明的AI 实习生(大语言模型 Agent),它们读过互联网上所有的黑客教程,知道各种攻击理论。但是,把它们扔进一个真实的、复杂的黑客战场(CTF 夺旗赛),它们能真正干成事吗?
这篇论文的作者们(来自代尔夫特理工大学的团队)为了回答这个问题,设计了一个名为 DeepRed 的“模拟考场”,并发明了一套新的“评分规则”。
以下是用通俗语言和比喻对这篇论文核心内容的解读:
1. 为什么要搞这个测试?(背景)
现在的 AI 很厉害,能写代码、能聊天。但在网络安全领域,大家很担心:如果 AI 真的能独立当黑客,那既可能是好事(帮我们要找漏洞),也可能是坏事(被坏人利用)。
以前的测试太简单了,要么“做对了”,要么“做错了”(就像考试只有及格和不及格)。但现实很残酷,AI 往往**“做了一半就卡住了”**。如果只算“不及格”,我们就不知道它到底卡在哪一步,也不知道它离成功还有多远。
2. DeepRed 是什么?(考场设计)
作者们搭建了一个**“隔离的虚拟黑客实验室”**:
- 攻击者(AI):坐在一个装有 Kali Linux(黑客专用系统)的虚拟机里,手里有终端工具,还能上网查资料(但被过滤掉了直接的答案)。
- 目标(靶机):另一台虚拟机,里面藏着“旗帜”(Flag,即任务成功的标志)。
- 规则:AI 必须像真人黑客一样,通过敲命令、查漏洞、提权限,一步步攻破靶机。
- 安全:就像把 AI 关在一个完全封闭的玻璃房里,它无法越狱去攻击外面的真实网络。
3. 最聪明的创新:不再只算“及格/不及格”(部分积分法)
这是论文最精彩的部分。
以前的做法:
就像考试,只有“满分”和“零分”。如果 AI 破解了密码但没拿到最终文件,它就是 0 分。这太浪费了,因为 AI 其实已经做对了很多步。
DeepRed 的做法(部分积分):
作者们把每个黑客任务拆解成了**“里程碑”**(就像登山途中的营地):
- 发现目标服务器。
- 找到漏洞。
- 获取普通用户权限。
- 提权到管理员(Root)。
- 拿到旗帜。
评分逻辑:
AI 每到达一个“营地”,就得一分。
- 如果它只到了第一个营地,得 20% 分。
- 如果到了第三个营地,得 60% 分。
- 只有拿到旗帜才算 100%。
怎么打分?
作者们训练了一个**"AI 裁判”**。它先阅读 AI 的操作日志(就像看黑客的日记),然后总结它做了什么,最后对照“里程碑”打分。这比让人类专家一个个去翻日志要快得多,而且很准。
4. 测试结果:AI 们表现如何?
作者们找了10 个最流行的商业 AI 模型(比如 GPT-5.1, Gemini, Claude 等)来挑战10 个不同难度的黑客题目。
结果很扎心:
- 最好的 AI:平均只完成了 35% 的任务进度。也就是说,它连三分之一的路都没走完。
- 表现差异:有些 AI 擅长常见的套路(比如网页漏洞),但一旦遇到需要“灵光一闪”或者“长期规划”的奇怪题目(比如需要破解加密文件、处理特殊的 SSH 密钥),它们就彻底懵圈了。
- 常见问题:
- 缺乏耐心:试了几次不行就放弃了。
- 记性不好:忘了刚才试过的路,反复做无用功。
- 不会变通:死盯着一个方法,不知道换个思路。
5. 核心结论与启示
- 现状:目前的 AI 黑客更像是一个**“懂理论的初学者”,而不是“老练的专家”**。它们能做一些基础工作,但离完全独立搞定复杂的黑客任务还有很长的路要走。
- 价值:这套“部分积分”的评分系统非常有价值。它让我们能看清 AI 到底进步了多少,而不是只看它是否“通关”。
- 未来:要训练出真正的 AI 黑客,不能只靠让它背更多的书(训练数据),还得教它**“如何规划长远的步骤”、“如何记住之前的尝试”以及“如何在失败后调整策略”**。
一句话总结
这篇论文就像给 AI 黑客们发了一张**“登山成绩单”**,不再只问“登顶了吗?”,而是详细记录“你爬到了哪个海拔?”。结果显示,虽然它们爬得比想象中快一点,但离真正的“登顶”(完全自主黑客)还有很远的距离,而且特别容易在半山腰迷路或放弃。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。