← 最新论文
🤖 AI

Do Agents Dream of Root Shells? Partial-Credit Evaluation of LLM Agents in Capture The Flag Challenges

本文提出了名为 DeepRed 的开源基准测试,通过在隔离虚拟化环境中评估大型语言模型代理在真实 CTF 挑战中的表现,并引入基于检查点的部分评分机制,揭示了当前最先进的模型在平均检查点完成率上仅达 35%,且在需要非标准探索和长周期适应的任务中表现最为薄弱。

原作者: Ali Al-Kaswan, Maksim Plotnikov, Maxim Hájek, Roland Vízner, Arie van Deursen, Maliheh Izadi

发布于 2026-04-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Ali Al-Kaswan, Maksim Plotnikov, Maxim Hájek, Roland Vízner, Arie van Deursen, Maliheh Izadi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是在给一群**“拥有超级大脑但缺乏实战经验的 AI 黑客”进行一场“模拟黑客马拉松”**。

想象一下,你有一群非常聪明的AI 实习生(大语言模型 Agent),它们读过互联网上所有的黑客教程,知道各种攻击理论。但是,把它们扔进一个真实的、复杂的黑客战场(CTF 夺旗赛),它们能真正干成事吗?

这篇论文的作者们(来自代尔夫特理工大学的团队)为了回答这个问题,设计了一个名为 DeepRed 的“模拟考场”,并发明了一套新的“评分规则”。

以下是用通俗语言和比喻对这篇论文核心内容的解读:

1. 为什么要搞这个测试?(背景)

现在的 AI 很厉害,能写代码、能聊天。但在网络安全领域,大家很担心:如果 AI 真的能独立当黑客,那既可能是好事(帮我们要找漏洞),也可能是坏事(被坏人利用)。

以前的测试太简单了,要么“做对了”,要么“做错了”(就像考试只有及格和不及格)。但现实很残酷,AI 往往**“做了一半就卡住了”**。如果只算“不及格”,我们就不知道它到底卡在哪一步,也不知道它离成功还有多远。

2. DeepRed 是什么?(考场设计)

作者们搭建了一个**“隔离的虚拟黑客实验室”**:

  • 攻击者(AI):坐在一个装有 Kali Linux(黑客专用系统)的虚拟机里,手里有终端工具,还能上网查资料(但被过滤掉了直接的答案)。
  • 目标(靶机):另一台虚拟机,里面藏着“旗帜”(Flag,即任务成功的标志)。
  • 规则:AI 必须像真人黑客一样,通过敲命令、查漏洞、提权限,一步步攻破靶机。
  • 安全:就像把 AI 关在一个完全封闭的玻璃房里,它无法越狱去攻击外面的真实网络。

3. 最聪明的创新:不再只算“及格/不及格”(部分积分法)

这是论文最精彩的部分。

以前的做法
就像考试,只有“满分”和“零分”。如果 AI 破解了密码但没拿到最终文件,它就是 0 分。这太浪费了,因为 AI 其实已经做对了很多步。

DeepRed 的做法(部分积分)
作者们把每个黑客任务拆解成了**“里程碑”**(就像登山途中的营地):

  1. 发现目标服务器。
  2. 找到漏洞。
  3. 获取普通用户权限。
  4. 提权到管理员(Root)。
  5. 拿到旗帜。

评分逻辑
AI 每到达一个“营地”,就得一分。

  • 如果它只到了第一个营地,得 20% 分。
  • 如果到了第三个营地,得 60% 分。
  • 只有拿到旗帜才算 100%。

怎么打分?
作者们训练了一个**"AI 裁判”**。它先阅读 AI 的操作日志(就像看黑客的日记),然后总结它做了什么,最后对照“里程碑”打分。这比让人类专家一个个去翻日志要快得多,而且很准。

4. 测试结果:AI 们表现如何?

作者们找了10 个最流行的商业 AI 模型(比如 GPT-5.1, Gemini, Claude 等)来挑战10 个不同难度的黑客题目

结果很扎心:

  • 最好的 AI:平均只完成了 35% 的任务进度。也就是说,它连三分之一的路都没走完。
  • 表现差异:有些 AI 擅长常见的套路(比如网页漏洞),但一旦遇到需要“灵光一闪”或者“长期规划”的奇怪题目(比如需要破解加密文件、处理特殊的 SSH 密钥),它们就彻底懵圈了。
  • 常见问题
    • 缺乏耐心:试了几次不行就放弃了。
    • 记性不好:忘了刚才试过的路,反复做无用功。
    • 不会变通:死盯着一个方法,不知道换个思路。

5. 核心结论与启示

  • 现状:目前的 AI 黑客更像是一个**“懂理论的初学者”,而不是“老练的专家”**。它们能做一些基础工作,但离完全独立搞定复杂的黑客任务还有很长的路要走。
  • 价值:这套“部分积分”的评分系统非常有价值。它让我们能看清 AI 到底进步了多少,而不是只看它是否“通关”。
  • 未来:要训练出真正的 AI 黑客,不能只靠让它背更多的书(训练数据),还得教它**“如何规划长远的步骤”“如何记住之前的尝试”以及“如何在失败后调整策略”**。

一句话总结

这篇论文就像给 AI 黑客们发了一张**“登山成绩单”**,不再只问“登顶了吗?”,而是详细记录“你爬到了哪个海拔?”。结果显示,虽然它们爬得比想象中快一点,但离真正的“登顶”(完全自主黑客)还有很远的距离,而且特别容易在半山腰迷路或放弃。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →