← 最新论文
🤖 AI

Aria: An Agent For Retrieval and Iterative Auto-Formalization via Dependency Graph

该论文介绍了 Aria,一种基于检索的智能体,它采用两阶段思维图(Graph-of-Thought)过程和基于定义的评分器,在 Lean 中实现研究数学猜想级自动形式化方面达到了最先进的准确率,有效地克服了大型语言模型常见的幻觉和语义失配等局限性。

原作者: Hanyu Wang, Ruohan Xie, Yutong Wang, Guoxiong Gao, Xintao Yu, Bin Dong

发布于 2026-07-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Hanyu Wang, Ruohan Xie, Yutong Wang, Guoxiong Gao, Xintao Yu, Bin Dong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是关于论文《ARIA:一种基于依赖图的检索与迭代自动形式化智能体》的解释,已将其转化为通俗易懂的语言并辅以创意类比。

核心问题:“翻译丢失”的鸿沟

想象你有一位精通“人类数学”(自然语言,如英语)的天才数学家,以及一台只说“计算机数学”(一种名为 Lean 的严谨编程语言)的超级严格的计算机。这台计算机功能极其强大,可以证明定理且绝不出错。但它有一个巨大的问题:除非人类数学被完美地翻译,否则它无法理解人类的数学。

如果翻译过程哪怕出现一点点偏差,计算机都会拒绝执行。目前的 AI 模型(LLers)就像是热情高涨但缺乏经验的翻译官。它们经常会:

  1. 幻觉(Hallucinate): 凭空捏造计算机字典里并不存在的词汇或规则。
  2. 误解含义: 用对了词,但顺序错了,导致意思完全改变。
  3. 面对难题时放弃: 当面对全新的、复杂的科研问题时,由于记忆中没有预设答案,它们会陷入僵局。

解决方案:认识 Aria

作者构建了一个名为 Aria 的新 AI 智能体。不要把 Aria 看作是一个翻译员,而要把它看作是一位首席建筑师,负责在“人类数学”与“计算机数学”之间架起一座桥梁。

Aria 不仅仅是在靠直觉猜测翻译,它使用一个三步走的流程来确保这座桥梁稳固可靠:

1. “依赖图谱”(思维图谱/Graph-of-Thought)

类比: 想象你在建造一座摩天大楼。你不能直接浇筑顶层的混凝土;你必须先打好地基,架好钢梁,铺设好管道。
Aria 的做法: Aria 不会试图一次性翻译整个数学问题,而是将其拆解。它绘制一张图(图谱),展示每个概念是如何相互依赖的。

  • 例子: 要理解“Cohen-Macaulay 模”,你首先需要理解“Noetherian 环”,而理解“Noetherian 环”又需要理解“理想”,进而需要理解“环”。
  • Aria 从底层向上构建这座桥梁,确保在进入下一层之前,每一块砖都已正确铺设。

2. “图书馆侦探”(检索增强生成/Retrieval-Augmented Generation)

类比: 想象一名参加考试的学生,他被允许使用图书馆,但不允许背诵书本。如果学生试图编造规则,就会被识破。
Aria 的做法: 数学库(如 Mathlib)在不断更新规则。旧的 AI 模型依赖于多年前记忆中的内容,这些内容往往已经过时或错误。

  • Aria 扮演着侦探的角色。在写下第一行代码之前,它会搜索当前的库,以找到所需术语的精确、官方定义。
  • 如果库中没有某个新概念的定义,Aria 知道自己必须从头开始创造一个,但它会根据刚刚找到的规则进行严谨的自我检查。

3. “自我修正循环”(迭代反思/Iterative Reflection)

类比: 想象一位雕塑家在雕刻石像。他们不会只雕刻一次就指望大功告成。他们会凿下一块,退后一步观察,发现瑕疵,然后再继续凿刻。
Aria 的做法:

  • Aria 编写一段代码。
  • 它将代码运行在计算机编译器(这位严厉的法官)中。
  • 如果计算机报错“Error”,Aria 不会惊慌。它会阅读错误信息,找出出错的原因,然后尝试修复。
  • 它重复这种“尝试—失败—修复”的循环,直到代码能够完美编译。

“真相检测器”:AriaScorer

即使代码可以编译(运行不崩溃),它表达的意思仍可能错误。这就像是一个句子语法完美,却说“天空是绿色的”。

作者构建了一个名为 AriaScorer 的特殊工具来检查“含义”。

  • 旧方法: 之前的工具只比较文字。如果人类说的是“环(Ring)”,代码写的也是“环”,它们就认为匹配成功了。
  • Aria 的方法: AriaScorer 是一个深度调查员。它会查找计算机库中“环”的实际定义,并将这个深层定义与人类的意图进行对比。
  • 它能捕捉到细微的陷阱,比如 AI 调换了食谱中原料的顺序。它确保计算机的版本在数学意义上与人类的想法完全一致,而不仅仅是看起来相似。

成果展示:Aria 有多强?

团队在三个难度等级上对 Aria 进行了测试:

  1. 本科数学(ProofNet): Aria 正确完成了 68.5% 的高难度翻译,击败了所有之前的模型。
  2. 博士水平数学(FATE-X): 这是其他模型通常折戟的地方。Aria 的正确率为 44.0%,而排名第二的模型仅为 24.0%
  3. 真实研究猜想(“不可能”测试): 团队给了 Aria 14 个来自真实数学家的全新、未解数学问题。
    • 其他 AI 模型: 成功率为 0%。它们甚至无法开始。
    • Aria: 成功率为 42.9%。它成功地将近一半从未见过的全新问题翻译成了计算机可以理解的形式。

总结

Aria 是一个让 AI 在处理高级数学时不再“信口开河”的系统。它不再靠猜测,而是通过:

  1. 绘制依赖关系图(如同蓝图)。
  2. 搜索官方库以获取当前规则(如同侦探)。
  3. 迭代并修复自身的错误(如同雕塑家)。
  4. 验证深层含义,而非仅仅是表面文字(如同真相检测器)。

这使得它能够处理以往 AI 系统根本无法触及的复杂研究级数学问题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →