The Next Challenge for Agentic Cybersecurity: A Realistic, Contamination-Free Reverse Engineering Benchmark
本文介绍了 SRE-Bench,这是首个用于评估智能体在二进制代码上进行逆向工程能力的、具有现实性且无污染的基准测试,它揭示了即使是最强大的前沿大语言模型,由于分析未见过的、受保护的二进制文件所带来的独特挑战,也难以达到人类水平的表现。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一名试图破解谜团的侦探。通常,当你调查犯罪时,你可以阅读嫌疑人的日记、他们的手写笔记和电子邮件。这就像是在查看源代码:即告诉计算机该做什么的原始、人类可读的指令。但在现实世界的网络安全领域,坏人不会把他们的日记公开摆放。他们会递给你一个密封的锁着的盒子,外面没有任何说明书。这就是二进制文件:一个由原始计算机字节组成的文件,在人类看来就像乱码。为了弄清楚里面有什么,你必须进行逆向工程——将盒子拆解开来,一件接一件地研究,以推测锁是如何工作的以及其中的内容是什么。
现在,想象一下我们建造了超级聪明的 AI 侦探(称为 AI 智能体),它们非常擅长阅读那些日记。它们能比人类更快地发现谎言和线索。但这些 AI 侦探能破解这些锁着的盒子吗?这是一个大问题。如果 AI 只能阅读日记却无法打开盒子,那么它就称不上是一个真正的网络安全英雄。我们需要知道这些数字侦探是否真的能够进行逆向工程这项艰苦的工作,还是说它们仅仅是在依赖其训练数据中看到的模式。
这篇论文介绍了一个全新的、超级困难的测试,叫做 SRE-Bench,旨在查明真相。研究人员从零开始构建了 19 个全新的、秘密的程序——就像是凭空创造了 19 款独特的、复杂的视频游戏和安全系统,且没有任何 AI 见过它们。然后,他们用 44 种不同类型的尖端安保人员(混淆技术)将这些程序锁了起来,使它们变得极其难以破解。他们使用来自 2026 年评估的包括 GPT-5.6-sol 和 Claude-Opus-5 在内的五个世界顶尖 AI 模型,针对这些锁着的盒子进行了测试。
结果敲响了警钟。即使是本研究中最强大的 AI —— GPT-5.6-sol,也仅能完全解决约 31.5% 的案例(在 262 个实例中获得了 80 个满分)。其他 AI 的表现更糟,有些甚至未能解决任何一个案例。研究发现,这些 AI 智能体的行为方式与人类专家非常不同。虽然人类会在代码优化(使代码高效但变得杂乱)等方面感到吃力,但 AI 几乎察觉不到这些障碍。相反,AI 高度依赖于看到代码中的名称和标签;当研究人员剥离这些名称时,AI 的表现便大幅下滑。最重要的是,这项研究证明了擅长阅读源代码并不意味着 AI 擅长破解二进制文件。这个“锁着的盒子”仍然是一个巨大的、尚未解决的挑战,而 SRE-Bench 是第一个用来衡量我们距离解决它还有多远的、现实且公平的测试。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。