← 最新论文
💻 computer science

Understanding Human-AI Collaboration in Cybersecurity Competitions

这项研究通过首次对现场 CTF 竞赛中 41 名参与者的实证分析,揭示了人机协作中人类提示与上下文指定是主要瓶颈,而具备自主规划能力的 AI 代理因此能超越大多数人类团队并位居第二,从而为未来 CTF 挑战设计及人机回环安全系统的构建提供了重要启示。

原作者: Tingxuan Tang, Nicolas Janis, Kalyn Asher Montague, Kevin Eykholt, Dhilung Kirat, Youngja Park, Jiyong Jang, Adwait Nadkarni, Yue Xiao

发布于 2026-02-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Tingxuan Tang, Nicolas Janis, Kalyn Asher Montague, Kevin Eykholt, Dhilung Kirat, Youngja Park, Jiyong Jang, Adwait Nadkarni, Yue Xiao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是在讲述一场**“人类黑客与 AI 助手”的联合大冒险**,同时也顺便给“纯 AI 黑客”做了一次大考。

为了让你轻松理解,我们可以把这场CTF(夺旗赛)想象成一场“超级密室逃脱”

1. 背景:为什么要研究这个?

以前的研究都在问:"AI 自己能不能解开密室?”
但这篇论文问了一个更现实的问题:“如果人类玩家带着 AI 助手一起进密室,会发生什么?是 1+1>2,还是互相拖后腿?”

研究者在一个真实的大学级别密室逃脱比赛(CTF)中,招募了 41 名玩家,给他们配备了一个叫 CTFriend 的 AI 助手,观察他们如何合作。同时,他们也让几个“纯 AI 机器人”在同样的密室里独自闯关,看看谁更厉害。

2. 核心发现:人类与 AI 的“爱恨情仇”

🧠 发现一:人类的“期望值”像过山车

  • 赛前: 大家觉得 AI 是“超级外挂”,能帮自己秒破难题。
  • 赛后: 大家发现 AI 经常**“一本正经地胡说八道”**(幻觉),或者给出的代码根本跑不通。
  • 结果: 大家的信任度下降了。很多人觉得:“算了,还是自己干吧,或者只让 AI 查资料,别让它直接解题。”
  • 比喻: 就像你雇了一个**“博学但有点迷糊的实习生”**。刚开始你觉得他无所不知,结果他给你指了一条死胡同,还信誓旦旦地说“绝对没错”。你后来就不敢全听他的了。

🤝 发现二:合作方式大反转

  • 理想状态: 大家原本计划像“师徒”一样,你问我答,一步步推导。
  • 现实状态: 在时间紧迫的压力下,大家变成了**“甩手掌柜”**。
    • 很多人直接把整个题目扔给 AI,说:“你搞定它!”
    • 高手 vs 新手:
      • 高手(懂行又懂 AI): 像**“老练的导演”**。他们给 AI 的指令非常精准(比如:“先检查这个文件的头,再运行这个脚本,注意报错信息”),AI 就能干出漂亮活。
      • 新手(不懂行或不懂 AI): 像**“乱按遥控器的孩子”。他们只会说“帮我解这个”,或者在 AI 给错答案时,像“老虎机玩家”**一样,不停地让 AI 重新生成,指望运气好能蒙对一次(这就是所谓的“答案购物”)。
  • 比喻: 高手是**“指挥家”,指挥 AI 这个乐团演奏出完美乐章;新手是“乱指挥的观众”**,对着乐团大喊“快弹!”,结果乐团弹了一堆噪音。

🏆 发现三:纯 AI 机器人竟然赢了人类?

这是最惊人的部分!研究者让 4 种不同的**“纯 AI 机器人”**(没有人类干预,自己读题、自己写代码、自己运行)去解同样的密室。

  • 结果: 最强的 AI 机器人团队,得分排在了所有人类队伍的第二名!
  • 效率: 它们只用了人类 1/5 的时间,就拿到了高分。
  • 为什么 AI 能赢?
    • 擅长: 像**“苦力”**一样的工作。比如快速读取大量文件、跑脚本、试错。在“密码学”和“取证”这类需要大量重复计算的关卡,AI 是神。
    • 不擅长: 需要**“灵活变通”**的关卡。比如“逆向工程”(拆解复杂程序)或需要和复杂环境交互的 Web 题。这时候 AI 容易死循环,或者因为环境不支持而卡住。
  • 比喻: AI 像是一个**“不知疲倦的超级打字员”**,写代码极快,但遇到需要“灵光一闪”或者“现场 improvisation(即兴发挥)”的难题,它就傻眼了。

3. 未来的最佳方案:人机“双人搭档” (Pair Hacking)

论文最后提出了一个完美的解决方案:“人机搭档”

  • 分工明确:
    • AI 负责“扫雷”和“搬砖”: 让它去跑成千上万次测试,快速筛选线索。
    • 人类负责“掌舵”和“刹车”: 当 AI 钻牛角尖(死循环)时,人类介入说:“停!换个思路”;或者当 AI 遇到环境限制(比如需要图形界面但只有命令行)时,人类帮忙解决。
  • 比喻: 就像**“自动驾驶汽车”**。AI 负责在高速公路上平稳驾驶(处理常规任务),但遇到修路、突发事故或需要变道时,人类司机必须立刻接手,做出关键决策。

4. 给不同人的启示

  • 给比赛组织者: 别只出那种 AI 能秒解的题。要出一些**“需要灵活互动”**的题(比如需要操作复杂的浏览器、处理突发状况),这样人类的优势才能发挥出来。
  • 给老师/教育者: 教学生用 AI 时,不能只教“怎么让 AI 给答案”,要教**“怎么向 AI 提问”**(提示词工程)。如果学生只会把题目扔给 AI,那他们永远学不会真正的黑客技术。
  • 给未来的安全专家: 未来的安全专家,不仅要懂**“网络安全”,还要懂“怎么指挥 AI"**。这两项技能缺一不可。
  • 给 AI 开发者: 别只追求让 AI 完全独立工作。最好的设计是**“人机回环”**(Human-in-the-loop),让人类在关键时刻能轻松介入,纠正 AI 的错误。

总结

这篇论文告诉我们:AI 不是来取代人类的,而是来当“超级副驾驶”的。
如果你懂得如何指挥它(像高手那样),它能带你飞得更高;如果你只是把它当“许愿机”(像新手那样),它可能会把你带进沟里。而最强大的组合,永远是**“人类的智慧 + AI 的算力”**。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →