← 最新论文
🤖 AI

Failure Modes of Large Language Models on Research-Level Mathematics: A Taxonomy and an Empirical Characterisation

本文提出了大型语言模型在研究级数学推理中的四种失效模式的分类法,并从经验上证明了“前提走私”(即对基本主张未经证实的断言)是一种普遍存在、且难以通过引用验证来检测的缺陷,这使得采取推理时预防策略而非事后检测变得必要。

原作者: Arnesh Banerjee, Ayushi Bhattacharjee

发布于 2026-06-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Arnesh Banerjee, Ayushi Bhattacharjee

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你要求一位才华横溢、充满自信的学生去解决一个非常困难、全新的数学问题,甚至连他们的教授们都还没能解开。这位学生并没有说“我不知道”,而是写出了一篇排版完美、格式精美的论文,看起来就像一个完美的证明。但如果你仔细观察,整个论证过程其实是建立在一个谎言之上的。

这篇论文研究的正是这样一种场景。它探讨了为什么先进的人工智能模型(称为大语言模型)在面对真正的、前沿的数学问题时会失败。研究人员发现,这些 AI 不仅仅是犯些小错误;它们会自信地构建起一整套论证,但由于几个隐藏的、未经证实的假设,整个论证过程会彻底崩塌。

以下是该论文研究结果的拆解,使用了简单的类比:

AI 出错的四种方式

作者创建了一个包含四种特定 AI 证明失败方式的“菜单”:

  1. 虚假引用 (F1): AI 捏造了一个来源。这就像一个学生在写论文时引用了一本并不存在的书,或者引用了一位从未写过那本书的著名科学家。他们通过编造证据来支持自己的主张。
  2. 隐蔽前提 (F2): 这是论文关注的核心重点。AI 并没有在“信息的来源”上撒谎;它是在“它假设什么为真”这件事上撒谎。它把一个复杂且未经证实的观点,用一种耳语般的方式植入其中,说:“众所周知,这是个基本事实”,而实际上并没有对其进行证明或引用来源。这就像一位厨师说:“我们都知道这个秘密配料能让汤更好喝”,而实际上那个配料会毁掉汤的味道。AI 将这种错误的假设悄悄植入论证中,由于它听起来如此自信,使得剩下的证明过程看起来逻辑严密,尽管它其实是建立在沙堆之上的。
  3. 无声调包 (F3): AI 解决了一个不同且更容易的问题,并假装解决了原本那个难题。这就像被要求在汹涌的河流上架一座桥,而 AI 却在一条干涸的小溪上架了一座桥,然后把蓝图递给你说:“这是你的桥。”
  4. 局部与全局的脱节 (F4): AI 每一个微小的步骤都做对了,但却忘了检查这些步骤是否能拼凑成一个整体。想象一个拼图,每一块碎片本身的形状都非常完美,但当你试图把它们组合在一起时,却发现无法连接,因为边缘对不上。AI 构建了一个完美的局部社区,却无法将其与整座城市连接起来。

实验:检查 AI 的作业

作者在一个名为 Gemini 2.5 Flash 的 AI 模型上测试了三个此类难题。他们生成了八个不同的“证明”,并构建了两个专门的工具来检查它们:

  • 工具 1(图书管理员): 这个工具检查 AI 是否引用了真实的图书或论文。
  • 工具 2(前提审计员): 这个工具扫描文本中的短语,如“众所周知”或“基本结果”,以查看 AI 是否在偷偷植入未经证实的说法。

令人惊讶的结果

这篇论文中最令人不安的发现是:“虚假引用”问题几乎不存在。

当作者检查这些证明时,他们发现 AI 实际上引用了真实存在的论文。“图书管理员”工具基本是满意的。

然而,“前提审计员”在每一份(共八份)证明中都发现了问题。在所有案例中,AI 都将一个错误的假设伪装成常识植入其中(即“前提走私”)。

为什么这对于“修复”AI 至关重要

目前有一种流行的观点认为,解决 AI 在数学上撒谎的方法是使用 RAG(检索增强生成)。其理论是:“如果我们只是给 AI 一个真实的数学论文库供其查阅,它就不会捏造虚假的引用。”

作者认为这种修复是不完整的。

  • RAG 修复了“虚假引用”问题: 如果 AI 必须查阅书籍,它就无法凭空捏造一本不存在的书。
  • RAG 无法修复“隐蔽前提”问题: 即便 AI 有一个真实的图书馆,它仍然可以看着一本真实的书,忽略其中的实际数学内容,然后自信地宣称:“正如这本书所说,X 是成立的”,而书中实际表达的意思可能恰恰相反。AI 并不是在关于“来源”上撒谎;它是在关于“含义”上撒谎。

结论

论文得出结论,我们不能仅仅依赖于检查引用或给 AI 一个图书馆。真正的问题在于,这些模型太擅长在尚未证明的事情上表现得自信满满。

作者建议,未来 AI 数学研究的目标不应仅仅是事后捕捉这些错误。相反,我们需要构建能够防止 AI 做出这些“隐蔽”假设的系统,迫使它证明每一个步骤,而不是仅仅猜测某一步是“显而易见”的。

简而言之: AI 不仅仅是在捏造虚假的来源;它正在自信地在看不见的基石上建造城堡。给它一个更好的图书馆,并不能阻止它在看不见的地面上盖楼。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →