Pessimistic Verification for Open Ended Math Questions
本文介绍了“悲观验证”(pessimistic verification),这是一种如果任何并行验证器检测到错误就会拒绝数学解法的智能体工作流,以及其增强型的“渐进式”(progressive)变体,该变体通过细粒度的证明分解,在具有挑战性的开放式数学问题上显著提升了现有方法的准确率和 Token 效率,同时揭示了由于标注错误,当前的基准测试可能会低估强模型的表现。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你是一名正在批改一叠数学试卷的老师。你的目标不仅仅是看最终答案是否正确,还要检查学生的逻辑是否严密。如果学生在第三步犯了一个错误,那么即使他们最后神奇地得到了正确的数字,整个证明过程也是错误的。
这篇论文介绍了一种让 AI 扮演这种老师角色的新方法。作者称之为**“悲观验证”(Pessimistic Verification)**。
以下是他们想法的简单拆解,使用了日常类比:
1. 问题所在:“乐观型”AI
目前的 AI 在尝试检查数学证明时,往往表现得像一个乐观的朋友。它读完整个证明后,心想:“嗯,看起来大体上没问题,”然后给出一个及格的分数。
- 缺陷: AI 很难发现隐藏的错误。它经常会漏掉微小的错误,因为它试图表现得“友善”,或者因为它被冗长、复杂的论证搞得应接不暇。
- 代价: 为了保险起见,目前的系统会尝试检查这个证明数十次。这就像请 64 个不同的朋友来读同一篇论文。这行得通,但极其昂贵且缓慢(就像为了请这些朋友喝咖啡而烧掉了大量的钱)。
2. 解决方案:“悲观型”AI
作者提出了一种**悲观(Pessimistic)**的方法。想象一个严厉、多疑的银行保安。
- 规则: “只要任何人发现哪怕一个瑕疵,整个东西就会立即被拒绝。”
- 运作方式: 你不是要求 AI 写一篇长文来论证为什么这个证明是好的,而是问它:“这里有错误吗?”
- 魔力所在: 寻找错误比证明某件事是完美的要容易得多。通过专注于寻找错误,AI 变得更加敏锐。如果它发现了错误,它会停下来并说:“错误(False)”。如果它尝试了几次后仍未发现错误,它才会说:“正确(True)”。
3. 三种变体(工具)
论文测试了三种应用这种“悲观”思维的方式:
简单悲观法(“重复”法):
- 类比: 你要求同一个保安连续读 10 遍整个证明。
- 结果: 比读一次要好,但仍然有点浪费,因为保安每次都要重新阅读整个内容。
垂直悲观法(“缩放”法):
- 类比: 与其读整本书,不如把证明切成小段落。你要求保安只看第 1 段,然后只看第 2 段。
- 结果: 这有助于发现那些在长篇阅读中容易被忽略的微小拼写或逻辑错误。但如果切分的段落过于细碎,速度会变慢。
渐进悲观法(“聪明侦探”法):
- 类比: 这是赢家。侦探首先快速扫描整个证明。如果他们没看到明显的重大错误,就会放大到特定的段落。如果他们仍然没看到,就会进一步放大到单个句子。
- 为何获胜: 它非常高效。它不会在那些显然没问题的部分浪费时间。它只在怀疑有问题的环节进行深度挖掘。它比其他方法能更快地发现错误,并且消耗更少的计算资源。
4. 大惊喜:“标准答案”竟然错了
论文中最有趣的发现之一是关于用于测试这些 AI 系统的“标准答案”的问题。
- 发现: 研究人员发现,测试数据集中的“正确”答案实际上是错误的。
- 类比: 想象一位老师的标准答案说某个学生的证明是“A+”。但新的“悲观型 AI”看了之后却说:“等等,这里的数学计算有误!”
- 结果: 研究人员进行了人工核查,发现 AI 是正确的。人类评分员(以及标准答案)确实漏掉了这些错误。
- 启示: 目前测试 AI 数学能力的测试集实际上低估了最聪明 AI 的水平,因为测试本身就包含错误。
5. 终极测试:解决真正的奥林匹克难题
作者不仅停留在评分阶段;他们还让他们的 AI 尝试去解决世界上最难的数学问题(如国际数学奥林匹克竞赛题)。
- 他们使用这种“渐进悲观法”在 AI 解决问题的过程中对其工作进行检查。
- 结果: 与之前的方法相比,该 AI 能够更正确地解决更多问题,并且使用的计算资源(token)更少。这就像拥有一支能比其他人更快、更廉价地破解谜团的侦探团队。
总结
论文认为,要验证数学,我们不应该试图追求完美,而应该学会怀疑。通过教 AI 积极地搜寻错误,并将证明拆解成更小、更易处理的块,我们可以让它们变得更聪明、更快、更可靠。在此过程中,他们还发现许多我们现有的“正确”数学答案其实并不正确。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。