← 最新论文
💻 computer science

AutoBaxBuilder: Bootstrapping Code Security Benchmarking

本文介绍了 AutoBaxBuilder,这是一个自动化流程,利用大语言模型快速且经济高效地生成高质量代码安全基准,在显著减少基准构建所需人工投入的同时,解决了数据污染和可扩展性问题。

原作者: Tobias von Arx, Niels Mündler, Mark Vero, Maximilian Baader, Martin Vechev

发布于 2026-05-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Tobias von Arx, Niels Mündler, Mark Vero, Maximilian Baader, Martin Vechev

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一位老师,正试图给一群非常 advanced 的学生(大型语言模型,或称 LLM)打分,这些学生正在学习编写计算机代码。问题在于,这些学生非常擅长编写那些看起来正确、却包含隐藏安全陷阱(如后门或薄弱锁)的代码,黑客可以利用这些陷阱。

为了测试他们,你需要一场“期末考试”(基准测试),不仅要检查代码是否运行正常,还要检查它是否安全。

问题:“人工评分”的瓶颈
此前,创建这些安全考试就像为每一位学生手工打造独一无二的复杂密室逃脱。这需要安全专家花费数小时设计场景、编写测试题,并构建特定的“黑客攻击”(漏洞利用)来测试代码是否会崩溃。

  • 弊端:等到专家完成一份考试的构建时,学生们可能已经背下了答案(因为考题泄露到了他们的训练数据中)。
  • 结果:我们新鲜、高难度的考试耗尽的速度,远快于我们编写它们的速度;而且,现有的考试对于最聪明的学生来说也变得过于简单。

解决方案:AUTOBAXBUILDER(“自我复制的考试工厂”)
作者构建了一个名为AUTOBAXBUILDER的新系统。你可以将其想象为一个由 AI 驱动的“考试工厂”,它能够从零开始自行构建安全测试,无需人类执笔。

以下是该工厂如何一步步运作,使用一个简单的类比:

1. 建筑师(场景生成)

首先,系统扮演建筑师的角色。它接到指令:“设计一个新的 Web 应用程序场景,比如徽章生成器或文件上传器。”它会发明一个前所未有的全新概念,确保学生无法通过死记硬背旧答案来作弊。

2. 建造者与检查员(功能测试)

接下来,系统要求几个不同的 AI“建造者”根据这个新构思来构建应用程序。

  • 转折:随后,系统扮演起严格的检查员角色。它编写一份检查清单(功能测试),以确认建筑物是否稳固。
  • 循环:如果建筑物倒塌,系统会告诉建造者:“修好它!”如果检查清单过于严苛(例如,规则只说了“要有一扇门”,清单却要求“门的宽度必须正好是 3.00 英寸”),系统会意识到清单有误并修正清单。它会不断打磨建筑物和清单,直到两者完美匹配。

3. 黑客(安全漏洞利用)

这是最关键的部分。一旦建筑物稳固,系统便戴上“黑客帽”。

  • 它审视建筑物并问道:“窃贼如何才能闯入?”
  • 它尝试闯入。如果成功,就记录该方法。
  • 关键检查:为了确保“黑客”不是在瞎猜,系统会构建该建筑物的第二个版本,即安全版本(加固的门、警报器)。它在安全建筑物上运行黑客的 trick。
    • 如果该 trick 能攻破安全建筑物,说明黑客错了(该 trick 过于宽泛)。
    • 如果该 trick 攻破了薄弱建筑物,但未能攻破安全建筑物,则该测试有效。
  • 此过程重复进行,直到系统找到一把能打开薄弱之门却打不开坚固之门的“钥匙”。

结果:更快、更便宜、更好的考试
作者利用该工厂创建了AUTOBAXBENCH,这是一个包含 40 个安全考试的大型新集合(数量超过此前最佳集合的两倍)。

  • 速度与成本:人类构建一份考试需要 3 小时,而该工厂在不到 2 小时内即可完成,成本低于 4 美元。它将人力投入减少了12 倍
  • 质量:当他们将工厂生成的考试与旧的人工考试进行比较时,工厂的测试同样出色,但往往更严格。它们发现了更多人类专家遗漏的安全缺陷。
  • 现实检验:当他们在这些新考试上测试全球最聪明的 AI 编程模型时,结果令人清醒。即使是最好的模型,也只能通过约*36%*的安全测试。这意味着,虽然 AI 在编写能运行*的代码方面表现出色,但在编写安全*的代码方面仍然非常糟糕。

总结
这篇论文提出了一种工具,可自动化生成 AI 代码的安全测试。它就像一位不知疲倦的安全警卫,能够发明新的迷宫、建造墙壁,然后立即尝试破坏它们,以确保墙壁足够坚固。这使得研究人员能够在无需等待人类手动编写每一个测试的情况下,持续用新鲜、高难度的挑战来测试 AI 模型。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →