← 最新论文
🤖 AI

CrackMeBench: Binary Reverse Engineering for Agents

本文介绍了 CrackMeBench,这是一个新颖的基准测试,旨在评估语言模型代理在自主执行二进制逆向工程以恢复验证逻辑并为教育性质的 CrackMe 风格挑战生成有效输入方面的能力,展示了不同模型在公开任务和生成任务上取得的不同程度的成功。

原作者: Isaac David, Arthur Gervais

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Isaac David, Arthur Gervais

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你有一个上锁的盒子。你没有钥匙,也没有锁的构造蓝图。你只有盒子本身。你的目标是弄清楚究竟需要什么样的数字、单词或动作组合才能让这个盒子打开。

这就是二进制逆向工程的核心挑战,而一项名为CrackMeBench的新测试正是为了解决人工智能面临的这一特定问题而设计的。

以下是用日常类比对这篇论文内容的简要拆解。

问题:“黑盒”测试

当今大多数人工智能编程测试,就像给学生一份食谱(源代码),让他们修正一个拼写错误或添加一种新食材。但在网络安全的现实世界中,你往往拿不到食谱。你只能拿到做好的蛋糕(编译后的程序)。

研究人员问道:人工智能能否观察一个已完成的、被锁定的程序,弄清楚“锁”是如何工作的,并制造出打开它的精确钥匙?

为了测试这一点,他们创建了CrackMeBench。你可以把它想象成一个为人工智能设计的巨型自动化“密室逃脱”。

  • 密室:一个安全、隔离的数字沙箱(Docker 容器),人工智能无法与外部互联网通信。
  • 工具:人工智能会获得一个特定的工具箱(如螺丝刀、放大镜或代码翻译器),并被告知它具体拥有哪些工具。它不能猜测;它必须使用列出的工具。
  • 目标:人工智能必须生成一把“钥匙”。这可能是一个密码、一个文件,或者一个能生成序列号的脚本。
  • 裁判:有一个隐藏的“神谕”(裁判)。人工智能如果写出一篇长文解释它认为锁是如何工作的,是得不到分数的。只有当它尝试钥匙时锁真的打开了,它才能得分。

测试:20 个不同的谜题

研究人员构建了一个包含 20 个不同“锁”(任务)的测试:

  1. 8 个公开谜题:这些就像人们以前解决过的经典、众所周知的谜语。它们充当“校准”工具,以确保测试公平且易于理解。
  2. 12 个新谜题:这些是由研究人员全新生成的。难度从“简单”(如在文本文件中寻找隐藏单词)到“困难”(锁在你观察时会改变形状,或者在开始运行之前隐藏其秘密)不等。

结果:谁赢得了密室逃脱?

研究人员将三个不同的人工智能模型放入这个限时5 分钟的密室逃脱中。每个模型有三次提交钥匙的机会。

以下是它们在12 个新的、更难的谜题上的表现:

  • GPT-5.5(表现最佳者):解开了12 个谜题中的 11 个。它就像一位精通机制、能迅速开锁的大师锁匠。
  • Claude Opus 4.7(中游水平):解开了12 个谜题中的 7 个。它表现不错,但有时在试图弄清楚锁的内部逻辑时会陷入困境。
  • Kimi K2(挣扎者):解开了12 个谜题中的 5 个。它经常花太多时间观察锁,却从未尝试转动钥匙。

“公开”谜题甚至更难
当人工智能尝试解决这 8 个经典的公开谜题时,所有人的得分都大幅下降。即使是最好的人工智能(GPT-5.5)也只解开了 8 个中的 3 个。这表明,虽然人工智能在这些任务上有所进步,但现实世界中混乱的谜题仍然非常困难。

为什么这很重要(根据论文所述)

论文强调了该测试与其他测试的几个关键区别:

  • 没有“废话”:在许多测试中,人工智能可以通过编造一个关于如何解决问题的极具说服力的故事来获得高分,即使这个故事是错误的。在这里,如果锁没打开,人工智能就失败了。这关乎结果,而非解释。
  • “密钥生成器”挑战:有些谜题不仅要求一个密码,还要求人工智能编写一个能为任何用户生成密码的机器。这就像要求人工智能建造一个制钥工厂,而不仅仅是打开一把锁。人工智能必须理解模式,而不仅仅是死记硬背一个答案。
  • “噪声”因素:较难的谜题包含了“噪声”,如虚假线索或运行时会变化的代码。表现最好的人工智能(GPT-5.5)更擅长忽略噪声,专注于真正的机制。

底线

CrackMeBench是一个新的、严格的人工智能记分牌。它证明,虽然人工智能在读取代码和修复软件方面变得非常擅长,但它仍在学习如何拆解一个已完成的、编译好的程序,并弄清楚如何将其破解打开。

论文得出结论:我们正在取得进展,但人工智能处理食谱(源代码)的能力与仅凭成品菜肴(可执行二进制文件)所能做到的能力之间,仍存在巨大差距。该测试提供了一种清晰、可复现的方法来衡量这一差距正在以多快的速度缩小。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →