Evaluating SageMath-Augmented LLM Agents for Computational and Experimental Mathematics
本文提出并评估了一种将大语言模型与 SageMath 及最新文档相结合的 ReAct 式智能体框架,证明了这种由计算机代数系统(CAS)增强的智能体在处理 RealMath 基准测试中的研究级数学问题时显著提升了性能,同时缩小了开源权重模型与闭源模型之间的差距。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
核心理念:给数学机器人一个计算器
想象你有一个才华横溢但偶尔会健忘的学生(AI),他正在尝试解决非常困难的研究级数学问题。这个学生擅长阅读和思考,但由于缺乏合适的工具,他们经常会出现计算错误或陷入僵局。
长期以来,研究人员一直在教这些 AI 学生如何编写形式化证明(就像为数学事实编写一份法律合同)。但本论文提出了一个不同的问题:如果我们给 AI 一个功能强大的、现实世界的计算器(称为 SageMath),并让它进行实验,会发生什么?
研究人员建立了一个“实验室”,让 AI 可以:
- 思考一个问题。
- 编写一段计算机代码来测试一个猜想。
- 在一个安全、隔离的沙盒中运行该代码。
- 查看结果,意识到错误,然后重试。
他们称之为“ReAct”循环(推理 + 行动)。这就像一名侦探,不仅是猜测谁是罪犯,而是实际出门检查不在场证明,并带着证据回来。
实验设计:15 名学生,133 道题
团队在 133 道取自近期研究论文的真实数学问题上,测试了 15 种不同的“前沿”AI 模型(目前最智能的模型)。他们通过两种方式进行测试:
- “纯大脑”模式: AI 必须仅凭其内部知识来解决问题,就像学生在不使用计算器的情况下参加考试。
- “工具使用者”模式: AI 可以使用 SageMath 计算器和一个文档助手(Context7)来运行代码并检查自己的工作。
实验结果:工具让每个人都变得更强(但程度不同)
研究结果非常明确:给予 AI 一个计算器帮助每一个模型解决了更多的题目。 平均而言,成功率提升了近 10 个百分点。
以下是简单解释的关键结论:
1. “弱者效应”
原本数学能力较弱的 AI 模型(“开源权重”模型)进步最为显著。这就像给一个在算术方面挣扎的学生一个计算器;由于工具弥补了他们的最大弱点,他们的成绩飞速提升。
- 示例: 其中一个模型 Qwen,从解决 42% 的问题跃升到了 70%——这是一个接近 28 个百分点的巨大跨越。
- 顶尖模型(如 GPT-5.5)本身已经很优秀了,所以进步相对较小(从 67% 提升到 75%),但它们最终仍然是表现最好的。
2. 效率悖论
你可能会认为使用计算器会让速度变快或消耗更少的能量。但在本文中并非如此。
- 有些模型过度使用工具,导致“陷入细节泥潭”,为了获得一个稍好一点的答案,运行了数千行代码并消耗了巨大的计算资源(token)。
- GPT-5.5 是最优秀的“运动员”。它解决了最多的问题(75.2%),同时使用的计算能力最少。它准确地知道何时该使用工具,以及何时该停止。
3. “双模态”行为
研究人员注意到 AI 使用工具时的一种有趣模式。AI 的行为呈现出双峰分布(两种截然不同的模式):
- 模式 A(专家型): 强大的模型会思考片刻,仅使用一两次计算器来验证其答案,然后结束任务。它们将工具当作拼写检查器。
- 模式 B(挣扎型): 较弱的模型会反复使用计算器,试图通过暴力破解来解决问题。它们会耗尽时间或内存,往往因为试图通过计算而非思考来获取答案而失败。
4. “幻觉”修复
AI 模型经常会编造关于如何使用软件的事实(例如发明一个不存在的函数)。研究人员添加了一个“文档工具”(Context7)来帮助 AI 查询正确的指令。
- 结果: 大多数模型并没有频繁使用这个工具。顶尖模型已经对该软件非常熟悉。较弱的模型虽然尝试使用它,但经常仍然出错。
现实案例:纽结侦探
论文包含了一个案例研究,其中 AI 需要解决一个关于“扭转环面纽结”(一种复杂的数学形状)的问题。
- 传统方式: AI 需要根据记忆来猜测公式。
- 新方式: AI 使用计算器绘制了纽结的小型版本,测量它们,并寻找规律。它注意到随着纽结变大,某个特定数值以可预测的方式增长。它利用这个模式来推测最终的公式。
- 结果: AI 不仅仅是“知道”答案;它是通过一次微型实验“发现”了答案,就像人类数学家一样。
总结
这篇论文证明了,对于复杂的数学,AI 不应仅仅是一个“思考者”;它需要成为一个“实验者”。
当给予 AI 一个可靠的计算机代数系统(SageMath)时,它不再只是猜测,而是开始验证。这使 AI 从一个自信的猜测者转变为一个严谨的研究者。虽然最好的模型已经很出色,但这个工具有助于较弱的模型实现赶超,从而缩小了“廉价”开源模型与昂贵的闭源模型之间的差距。
作者总结道,这是迈向自动化发现的重要一步,即 AI 代理不仅可以解决已知问题,还可以通过运行无数可靠的实验,潜在地帮助人类发现新的数学真理。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。