Construction-Verification: A Benchmark for Applied Mathematics in Lean 4
本文介绍了 AMBER,这是一个针对应用数学的新型 Lean 4 基准测试,它强调在验证之前构建显式解,并揭示了通用推理模型优于专门的定理证明器,因为后者倾向于遭受阻碍复杂指令遵循的“策略过拟合”。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人做数学题。长期以来,我们给这个机器人的测试就像是在问它:“这个谜题是否存在解法?”机器人可以通过说“我知道它就在某处”来回答“是”,但它从未真正找到那个碎片,也从未向你展示如何将其组装起来。
这篇名为**《构建—验证》(Construction–Verification)的新论文指出,对于应用数学**(即用于建造桥梁、优化物流路线或分析数据的数学)而言,仅仅说“它存在”是不够的。你需要机器人先构建出解决方案,然后再去证明它是有效的。
以下是研究人员的工作内容及发现的简单拆解:
1. 问题所在:“魔杖” vs. “蓝图”
在传统的数学测试中,机器人可能会使用一根“魔杖”(非构造性证明)挥动一下,化解问题并宣布:“解是存在的!”然后就结束了。
- 旧方式: “我证明了一座桥可以被建造。”(但你并不知道如何建造它)。
- 新方式 (AMBER 基准测试): “这是蓝图和材料。请建造这座桥,然后向我证明它不会倒塌。”
研究人员创建了一个名为 AMBER(应用数学推理基准测试)的新测试。它强制 AI 遵循严格的两步工作流:
- 构建 (Construction): 你必须编写代码或公式来实际计算出答案。
- 验证 (Verification): 你必须证明你的答案是正确的。
他们在四个困难领域测试了 AI:
- 凸分析 (Convex Analysis): 在弯曲的山谷中寻找最低点。
- 优化 (Optimization): 制定最有效的计划。
- 数值代数 (Numerical Algebra): 处理巨型矩阵中的数字。
- 高维概率 (High-Dimensional Probability): 预测具有许多变量的结果。
2. 令人惊讶的结果:通用型选手击败了专业型选手
研究人员原以为专门训练成“数学证明者”的机器人会在这项测试中横扫对手。结果他们错了。
- 专家型选手(“战术过拟合”陷阱): 那些仅针对数学证明进行训练的机器人陷入了困境。它们过于习惯于仅仅证明事物的存在,以至于忘记了如何遵循指令去“构建”事物。这就像一位国际象棋大师,由于太擅长赢棋,以至于忘记了如何摆放棋盘。它们试图通过“证明”答案存在,而不是实际计算出答案,从而导致测试失败。
- 通用型选手(“瑞士军刀”): 接受过通用推理训练(如 DeepSeek 或 GPT)的机器人表现得好得多。因为它们习惯于在各种不同语境下遵循复杂的、多步骤的指令,所以它们能更好地做到:“好的,首先我需要定义这个函数,然后我需要证明它。”它们不会陷入“仅仅证明”的习惯中。
3. 测试的具体形式
论文描述了 AI 面临的三类挑战,这些挑战与标准的数学测试不同:
- 评估问题 (Evaluation Problems): 测试不再问“是否存在一个数字 满足此方程?”,而是问:“这是 的公式。请编写计算它的代码。”
- 算法设计 (Algorithm Design): 与其证明一个循环有效,不如要求 AI 亲自编写这个循环本身。这就像要求一位厨师不仅要证明蛋糕可以被烤出来,还要写出精确的食谱和搅拌说明。
- 表示转换 (Representation Transformation): 这就像将一个混乱的现实世界问题(例如“我们如何调度这些巴士?”)转化为一种干净的标准数学格式(例如“这是一个线性规划问题”)以便计算机求解。AI 必须扮演翻译者的角色,而不仅仅是求解者。
4. 机器人在哪里失败了
当研究人员观察机器人为何失败时,他们发现了四个主要原因:
- 幻觉 (47%): 机器人编造了并不存在的数学定理或库名称。它们听起来很自信,但实际上是在凭空捏造事实。
- 形式化错误 (33%): 它们知道正确的数学概念,但无法将其正确地转化为严谨的计算机语言 (Lean 4)。
- 半途而废 (15%): 它们开始了代码编写,但留下了未完成的部分,用“抱歉”(占位符)代替了完成最难的部分。
- 拼写错误 (5%): 简单的格式错误。
核心结论
论文得出结论:要让 AI 在应用数学领域真正发挥作用,我们不能仅仅训练它成为一台“证明机器”。我们需要能够先构建解决方案,再验证其正确性的系统。目前,通用型 AI 模型在执行这种“构建”任务方面比专门的数学模型表现更好,因为那些专家模型在思维上变得过于僵化。
研究人员建议,未来的 AI 需要是一种混合体:既要足够聪明,能够遵循复杂的指令去构建事物;又要足够严谨,能够证明其正确性。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。