← 最新论文
🤖 AI

s2n-bignum-bench: A practical benchmark for evaluating low-level code reasoning of LLMs

本文提出了首个专注于工业级底层加密汇编代码的机器可验证证明合成基准测试 s2n-bignum-bench,旨在评估大语言模型在 HOL Light 中生成形式化证明脚本的能力,从而弥补现有基准在现实世界实现验证方面的不足。

原作者: Balaji Rao, John Harrison, Soonho Kong, Juneyoung Lee, Carlo Lipizzi

发布于 2026-03-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Balaji Rao, John Harrison, Soonho Kong, Juneyoung Lee, Carlo Lipizzi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 S2N-BIGNUM-BENCH 的新“考试”,专门用来测试人工智能(大语言模型,LLM)在低层级代码推理方面的能力。

为了让你更容易理解,我们可以把这篇论文的内容想象成一场**“超级侦探考试”**。

1. 背景:AI 现在的水平如何?

目前的 AI 在解数学题方面表现很棒,就像是一个**“奥数天才”**。

  • 现状:现有的测试(比如 MiniF2F)主要考的是像奥林匹克数学竞赛那样的题目。AI 在这些题目上能拿高分,证明它们逻辑推理能力很强。
  • 问题:但是,会解奥数题,不代表能修好一辆真实的汽车,或者写出一段不会出错的银行安全代码。现实世界的工程问题(比如加密算法)充满了细节、硬件限制和复杂的“脏活累活”,这和纯粹的数学题很不一样。

2. 这个新考试考什么?(S2N-BIGNUM-BENCH)

这就好比我们不再考“奥数题”,而是给 AI 出了一套**“真实世界的维修手册”**。

  • 考试题目来源:题目来自 AWS(亚马逊云服务)实际使用的加密库(s2n-bignum)。这是一个用来保护数据安全的“金库大门”。
  • 考试形式
    • 这个金库的门是由汇编语言(计算机最底层的指令,就像机器的“摩斯密码”)写成的。
    • 人类专家已经用一种叫 HOL Light 的“超级验真器”证明了这些代码是绝对安全的。
    • 现在的任务:把题目给 AI,让它重新写出证明过程,告诉“超级验真器”为什么这段代码是安全的。
  • 核心挑战:AI 不能只靠“猜”或“背公式”。它必须理解计算机的寄存器、内存、指令集(比如 ARM 或 x86 芯片是怎么工作的),并一步步推导出代码在极端情况下也不会出错。

3. 为什么这个考试很难?(比喻)

  • 奥数题:就像在纸上解方程,只要逻辑对就行,不用管纸会不会破,笔会不会没水。
  • 这个考试:就像让你在显微镜下,一边操作精密的瑞士手表,一边解释为什么齿轮不会卡死
    • 你需要考虑:如果内存满了怎么办?如果芯片指令执行顺序变了怎么办?如果数据的大小端(Endian)搞反了怎么办?
    • 任何一个小错误,都可能导致整个证明失败,甚至让加密系统出现安全漏洞。

4. 他们是怎么防止作弊的?

为了防止 AI 只是“死记硬背”答案或者“偷看答案”,作者设计了一套严密的**“防作弊系统”**:

  • 打乱顺序:把题目中的变量名和类型标注变得非常啰嗦和混乱(就像把“苹果”改成“红色的圆形水果_编号 998"),让 AI 无法通过记忆之前的训练数据来直接匹配答案。
  • 禁止作弊工具:在考试规则里明确禁止使用“作弊卡”(比如 CHEAT_TAC,相当于直接说“我算不出来,但答案是对的”)。如果 AI 用了,系统会直接判零分。
  • 独立环境:AI 必须在隔离的房间里做题,不能联网查资料,也不能看人类专家原本是怎么写的证明。

5. 考试结果怎么样?

作者用了一个很厉害的 AI 模型(GPT-5.3-Codex)来试考:

  • 成绩:在 2,284 道题中,AI 只成功解出了 4.4% 到 5.3%
  • 结论:虽然 AI 在数学竞赛题上能拿满分,但在处理这种真实的、底层的、工业级的代码证明时,它目前还非常吃力。这就像是一个奥数冠军,第一次被要求去修飞机引擎,结果发现完全无从下手。

6. 这个研究的意义是什么?

  • 填补空白:这是第一个专门针对工业级加密汇编代码的公开测试基准。
  • 推动进步:它告诉研究人员,光让 AI 做数学题还不够,我们需要训练它们去理解真实的计算机硬件和复杂的工程代码。
  • 未来目标:如果 AI 能通过这些测试,意味着我们未来可以让 AI 自动帮我们写出绝对安全、没有漏洞的加密软件,这对保护我们的数字世界至关重要。

总结

简单来说,这篇论文说:“现在的 AI 很会做数学题,但还不会修‘机器心脏’。我们设计了一套高难度的‘机器心脏维修考试’,发现 AI 目前还考不过。但这正是我们未来需要努力的方向,因为只有通过了这种考试,AI 才能真正帮我们要构建安全的数字世界。”

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →