← 最新论文
💬 NLP

Formalize Once, Edit the Rest: Efficient Lean-Based Answer Selection for Math Reasoning

本文介绍了 BASE,这是一个基于“生成与编辑”的流水线,它利用一个专门的重写模型(LEANSCRIBE)来形式化单个候选答案,并通过原地编辑高效地推导出剩余的 K-1 个形式化陈述,从而在显著降低计算成本的同时,提高了基于 Lean 的数学推理中的答案选择准确率。

原作者: Ji Feng, Zhouxing Shi

发布于 2026-06-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Ji Feng, Zhouxing Shi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一位正在批改一叠由一名聪明但有时会犯糊涂的学生(即 AI)撰写的 8 篇不同数学论文的老师。每篇论文都试图解决同一个问题,但它们最终得出的答案略有不同。你的任务是找出哪一个是真正正确的。

传统上,为了检查一个答案是否正确,你可能会向一个非常严谨、可由机器检查的数学机器人(称为 Lean)请求验证每一篇论文。但问题在于,在机器人检查论文之前,你必须将学生凌乱的自然语言手写体翻译成机器人的严格计算机代码语言。这个翻译过程缓慢、昂贵且需要大量的计算能力。如果你有 8 篇论文,你就必须为 8 次昂贵的翻译付费。

这篇论文介绍了一种名为 BASE(Base-and-Edit,基础与编辑)的新方法,它改变了游戏规则。与其从头开始翻译所有 8 篇论文,BASE 做了一件聪明的事:

1. “基础”(Base)的发现

首先,系统按置信度顺序查看论文(从学生认为最可能正确的论文开始)。它只将其中一篇翻译成机器人的语言,并询问机器人:“这是否有意义?”

  • 如果机器人说“是的,这是一个有效的数学陈述”,那么这一篇就成为了基础(Base)
  • 如果机器人说“不”,它会尝试下一篇。
  • 通常,第一次或第二次尝试就会成功。因此,你只需支付一次昂贵的翻译费用。

2. “编辑”(Edit,神奇的技巧)

现在,与其从头开始翻译剩余的 7 篇论文,BASE 意识到它们与第一篇几乎完全相同。它们共享相同的题目结构;只是结尾处的数字或答案有所不同。

把第一篇翻译好的论文想象成一个饼干模具。其他 7 篇论文只是同一个饼干形状,但换了不同的“馅料”(即答案)。

  • 简单编辑: 如果答案的写法完全一致(例如“5”),BASE 只需更换数字。
  • 智能编辑 (LEANSCRIBE): 有时学生会以奇怪的方式书写答案(例如“13 的平方根乘以 3”)。机器人可能会将其翻译为一个复杂的代码块。BASE 使用一个名为 LEANSCRIBE 的特殊辅助模型来确定这个复杂代码块究竟在哪里,以及如何将其替换为新答案的代码。这就像拥有一位大师级厨师,他知道如何在不破坏整道菜的前提下,精准地更换食谱中的某一种食材。

结果:一种“帕累托改进”(Pareto Improvement)

论文声称这种方法是一种“帕累托改进”,这是一个高级说法,意思是:“我们在花费更少钱的同时,获得了更好的结果。”

  • 更便宜: 与其支付 8 次翻译费用,他们只需支付 1 次翻译和 7 次廉价的编辑。这使成本降低了约 5 倍(具体来说,平均降低了 5.4 倍)。
  • 更准确: 令人惊讶的是,这种方法找到正确答案的频率竟然比从头检查所有人还要。为什么呢?因为通过复用机器人已经认可的“基础(Base)”,该系统避免了从头翻译新的、凌乱的论文时容易产生的错误。这就像是使用一个经过验证、坚固的房屋蓝图并仅仅更改油漆颜色,而不是每次都试图从零开始建造一座新房子。

核心结论

作者构建了一个不再浪费时间重复翻译同一个数学问题的系统。它找到一个“好”的版本,将其锁定,然后仅针对其余部分进行微调。这使得使用 AI 检查数学答案变得更快、更便宜,而且出人意料地更加可靠。

他们并未声称:

  • 他们并没有说这能修复 AI 的数学能力;它只是有助于从列表中选出最佳答案。
  • 他们并没有声称这适用于所有类型的题目(仅适用于那些答案在结构上看起来相似的题目)。
  • 他们承认,虽然“翻译”过程得到了检查,但最终的“证明”(即逐步的逻辑推理)对于目前的机器人来说仍然很难快速完成,因此他们首先专注于检查答案在机器人的语言中是否“看起来”是正确的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →