← 最新论文
💻 computer science

Benchmarking Mythos-Linked Bug Rediscovery

本文报告了一项受控实验,其中三个 AI 模型在事先不知晓修复方案的情况下,试图复现与 Anthropic 的"Mythos"材料相关的六个特定漏洞,结果表明即使在有利条件下,模型的成功率也极低(54 次尝试中仅成功 6 次),这主要是由于它们倾向于坚持看似合理但错误的假设,而非识别出实际补丁所修正的具体不变量。

原作者: Isaac David, Arthur Gervais

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Isaac David, Arthur Gervais

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一群高科技侦探(AI 模型),他们最近声称能够发现全球最重要软件系统中的隐藏漏洞——比如你手机上的操作系统或流媒体电影的引擎。他们发表了关于在 Linux、FreeBSD 和 FFmpeg 等系统的代码中发现具体且危险漏洞的报道。

有些人对此感到惊叹,认为这些 AI 是超级智能的黑客。另一些人则持怀疑态度,认为这些报道不过是营销噱头。

这篇论文是一项受控实验,旨在平息这场争论。研究人员没有让 AI 在庞大的代码库中像大海捞针一样寻找漏洞,而是直接给了 AI藏有那根针的确切书籍。他们问道:“如果我们把包含漏洞的具体文件交给你,你还能找到确切的问题吗?”

以下是实验的分解及其结果,使用了简单的类比:

实验设置:“目标文件”测试

将软件代码想象成一本为复杂机器编写的、长达 4000 页的巨型操作手册。

  • 声称:AI(Mythos)声称它能在这本手册中找到一个会导致机器爆炸的特定拼写错误。
  • 实验:研究人员取出手册,找到包含拼写错误的具体页面,然后仅将该页面交给三位不同的 AI 侦探:
    1. GPT-5.5 xhigh(“推理”模型)
    2. Claude Opus 4.7("Anthropic"模型)
    3. Kimi K2(中国模型)

他们制定了相同的规则:禁止联网,不提供关于漏洞的任何提示,且必须找出人类已在公开补丁中修复的确切错误。他们对六个不同的“漏洞”各尝试了三次。

实验结果:谁找到了针?

在总共 54 次尝试中(3 个模型 × 6 个漏洞 × 各 3 次尝试):

  • GPT-5.5 xhigh:找到了确切的漏洞5 次。它完美解决了 6 个不同漏洞中的 2 个,并且有一次在同一文件中发现了另一个漏洞(属于“错误目标”,但仍是真实的发现)。
  • Claude Opus 4.7:找到了确切的漏洞1 次。它解决了 6 个漏洞中的 1 个。
  • Kimi K2:找到了确切的漏洞0 次。它一无所获。

“原因”:合理干扰项的陷阱

这篇论文最有趣的部分不仅仅是谁赢了,而是他们如何失败。

想象你在检查汽车引擎。你知道某个地方有一颗坏掉的螺栓。

  • AI 的错误:AI 观察引擎,看到了一根松动的电线、一个脏的滤清器和一个略微磨损的垫片。它说:“我找到问题了!是松动的电线!”
  • 现实:松动的电线是一个看似合理的问题,但它并不是研究人员正在寻找的特定坏螺栓。

论文将这种现象称为**“过早锁定合理的替代候选项”
AI 模型擅长查看代码并说:“嘿,这看起来很可疑!”它们发现了许多
可能是漏洞的地方。但它们难以选出唯一特定**的那个与真实世界修复方案相匹配的项。它们被“红鲱鱼”(看起来像漏洞但并非它们正在搜寻的那个特定项)分散了注意力。

搜寻的成本

实验还追踪了所需的“燃料”(资金和计算能力)。

  • GPT-5.5 花费约 61 美元
  • Claude 花费约 88 美元(它是最昂贵的)。
  • Kimi 最便宜,仅需 3.50 美元,但它一无所获。

尽管研究人员将确切文件交给了 AI(消除了工作中最难的部分:找到文件),AI 仍然难以 pinpoint 确切的错误。

核心结论

这篇论文并非说 AI 无用,也非说最初的"Mythos"故事是伪造的。它仅仅指出:

“给 AI 正确的文件是不够的。”

即使 AI 确切知道该看哪里,它也常常陷入错误的细节中。它可以生成许多“可能的漏洞”,但难以选出与特定证据相匹配的唯一真实漏洞。论文得出结论:这些 AI 漏洞猎手的成功很可能高度依赖于流程(它们有多少次尝试机会、如何排序以及如何被引导),而不仅仅是模型本身的原始智能。

简而言之:AI 是一位能读懂手册的聪明侦探,但它仍需要一套非常具体的指令来找到确切的拼写错误,否则它只会指向页面上最近的污渍。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →