Does the Proof Prove It That Way? Faithful Formalization of Elements Proofs
本文介绍了 Pistis,这是一个具有代理性(agentic)且由 Oracle 指导的系统,其采用了新颖的“OrderDecompose”搜索策略,通过将自然语言推理与形式化策略(tactics)进行严格对齐,为《欧几里得几何原本》生成忠实的 Lean 形式化证明,从而在速度、成功率以及人类/大语言模型偏好方面均超越了先前的基准模型,并能有效识别数学论证中的缺陷。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
数学一直以来都依赖于两种截然不同的语言。一种是我们用来解释想法、讲述故事和分享见解的自然语言;它灵活、富有上下文气息,并且经常跳过人类读者看来显而易见的步骤。另一种是证明辅助工具(proof assistants)的正式语言,它们是僵化的计算机系统,通过检查每一个逻辑步骤来确保结论是无可争议的真理。几十年来,研究人员一直致力于将第一种语言转化为第二种语言,这一过程被称为自动形式化(autoformalization)。其目标很简单:将人类编写的证明转化为计算机可以验证的代码。但一个关键问题始终存在:计算机生成的证明虽然在技术上是正确的,却往往与激发它的那个人类论证毫无相似之处。计算机可能会使用完全不同的路径来解决问题,将原始的推理过程隐藏在自动化捷径构成的围墙之后。这造成了真理与理解之间的鸿番。如果计算机的证明不遵循人类的步骤,我们就无法利用它来检查人类的推理是否真的严密,也无法信任它来教导我们论证是如何运作的。
一支研究团队现在通过一种新系统解决了这一差距,该系统旨在使计算机的证明忠实于人类原始的思想过程。他们将这个系统称为 Pistis,这个名字取自古希腊语中表示“信仰”或“信任”的词汇。研究人员将该系统应用于欧几里得《几何原本》的前三卷——这是一部写于两千多年前的基础几何文本。他们的工作证明,在不丢失原始逻辑的情况下,将这些古老的论证转化为现代计算机语言是可能的,同时还能发现该文本中延续数世纪未被察觉的隐藏错误。
该团队面临的核心挑战在于,自然语言和计算机逻辑运行在不同的节奏上。人类的证明可能会说:“让我们假设这是真的,”然后继续向下进行,期望读者能填补其中的空白。然而,计算机要求每一个步骤都必须被明确陈述并得到证明。以往的翻译尝试往往会让计算机用自己的逻辑来填补这些空白,从而有效地重写了论证,使其更容易被机器求解。其结果是,证明虽然成功编译,却未能反映出人类作者的原意。Pistis 的建立正是为了防止这种情况。它不是要求计算机寻找任何可能的途径来证明该命题,而是强制计算机按照人类特定的路径,逐句进行。
为了实现这一点,研究人员开发了一种将翻译过程分为两个不同阶段的方法。首先是映射阶段,它分析自然语言文本并将其拆分为一系列微小的、原子的步骤。它精确地识别出每一句话的主张以及它所依赖的假设。这创建了一个计算机必须遵循的严格模板。第二是填充阶段,它尝试单独证明这些微小的步骤。该系统使用了一种专门的搜索策略,防止计算机采取捷径或提前跳跃。如果计算机无法使用人类文本中提到的确切工具和引用来证明某个特定步骤,它不会简单地寻找另一种方式来解决问题,而是会标记出该问题,揭示出原始的人类论证可能存在漏洞或缺失环节。
这种方法在测试欧几里得几何时表现得异常出色。研究人员为前三卷中的 92 个命题生成了形式化证明。当他们将这些新证明与以往的尝试进行比较时,差异非常显著。新的证明编译速度快了三十三倍以上,这种效率上的显著提升表明,新方法避免了旧系统那种沉重且缓慢的计算。更重要的是,评审证明的人类专家更倾向于新系统的输出。在一项盲测研究中,评审人员发现新证明具有更高的透明度,并且能更好地代表原始教科书的论证。一个经过训练以评估翻译质量的人工智能评判员也一致认为,新证明优于旧证明,比例超过五比一。
除了单纯地翻译文本外,该系统还充当了一个严谨的检查器,暴露了源材料中的真实缺陷。由于系统坚持遵循人类的逻辑,它无法掩盖错误。在一个案例中,系统识别出了现代译本中关于欧几里得的一个引用错误。文本引用了一个关于平分线段的命题,但引用的位置却指向了一个关于平分角度的命题。系统标记了这种不匹配,显示出该翻译将错误的观点关联到了错误的步骤上。在另一个案例中,系统发现了欧几里得自身推理中的一个缺口,即某个特定场景未被处理。研究人员能够通过形式化手段证明原始论证是不完整的,如果没有这样一个严格遵循原始结构的工具,这种发现将很难实现。
Pistis 的成功表明,忠实的正式化不仅是一项技术练习,更是验证人类知识的强大工具。通过迫使计算机走与人类相同的路径,该系统可以确认推理是否成立,或者在哪里失效。研究人员发现,他们的方法可以接受有效的论证,驳斥无效的论证,并精准定位证明出错的位置。这种能力可以扩展到几何学之外;该框架旨在处理任何以自然语言编写的数学论证。这项工作表明,我们不必在人类解释的灵活性与机器验证的严密性之间做出选择。只要引导机器去尊重人类原始的声音和逻辑,我们就可以兼得两者。
研究还强调了当前技术的局限性。虽然该系统在处理欧几里得前三卷时表现良好,但如果没有额外的人类指导,它无法处理后续书籍中的每一个命题。某些命题涉及到的几何概念是底层计算机系统尚未掌握如何处理的概念,例如测量曲线长度。研究人员指出,他们的系统依赖于人类或高级人工智能作为“先知”(oracle),来验证初始文本映射的正确性。这意味着该过程目前尚未实现完全自动化,但与以往的方法相比,它显著减少了手动操作的工作量。
最终,这篇论文为人工智能时代的数学证明互动设定了新标准。它超越了“计算机能否证明一个定理”的问题,转向了更深刻的“计算机是否理解该论证”的问题。通过确保形式化证明能够逐步镜像自然语言论证,研究人员创造了一个能够验证结论背后的推理过程,而不只是验证结论本身的工具。这使得数学家和学生能够相信,计算机不仅仅是在寻找一个解,而且是在真正遵循编写证明的人的逻辑。这项工作提供了一条路径,让人的洞察力与机器的精确性协同工作,在利用现代验证能力的同事,也保留了数学发现的完整性。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。