← 最新论文
🤖 machine learning

Evaluating the Architectural Reasoning Capabilities of LLM Provers via the Obfuscated Natural Number Game

本文介绍了混淆自然数游戏作为评估“架构推理”(即仅利用局部公理合成证明而不依赖语义线索的能力)的基准,并表明尽管通用大语言模型在混淆条件下性能下降,但专用推理模型仍能保持其准确性,从而将真正的逻辑推理与模式匹配区分开来。

原作者: Lixing Li

发布于 2026-05-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Lixing Li

原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一名学生解一道数学谜题。通常,这类谜题会附带诸如“加法”、“乘法”或“后继”等有用的标签。一个聪明的学生可能实际上并不理解游戏规则;他们可能只是认出了“加法”这个词,并回忆起了以前见过的某个记忆技巧。

这篇论文提出了一个棘手的问题:这些 AI 模型究竟是在做数学,还是仅仅擅长识别词语?

为了找出答案,研究人员创建了一个名为“自然数游戏”(Natural Number Game)的著名数学游戏的“蒙眼”版本。以下是他们如何操作以及发现了什么,用简单的方式解释如下:

实验:“外星人”游戏

研究人员选取了一个标准数学游戏,其中每条规则和每个数字都有清晰的名称(如 addzero)。然后,他们对它运行了一个“混淆器”。他们将每个有意义的名称替换为随机的、无意义的字符串,例如 x9zq22b7a

  • 原始游戏: 你看到 add,就知道它代表加法。
  • 混淆后的游戏(混淆版 NNG): 你看到 x9z,完全不知道它是什么意思。你无法猜测;你必须观察各部分如何组合的逻辑,才能弄清楚 x9z 的作用。

这测试了作者所称的“架构推理”(Architectural Reasoning)。这是一种仅利用结构蓝图(即逻辑)来构建解决方案的能力,而忽略门上那些有用的标志(即名称)。

结果:“延迟税”

研究人员在原始游戏和混淆游戏上测试了多个顶级 AI 模型。他们发现了两点主要结果:

1. “通用延迟税”(所有人都变慢了)
当名称被混淆后,每一个 AI 模型解决问题所花费的时间都变长了。

  • 类比: 想象你开车去一家熟悉的咖啡店。你认识那些标志、街道名称和地标。现在,想象有人涂掉了所有标志,并用随机字母重新命名了街道。你仍然知道如何开车,但你必须停下来,查看地图,并更费力地思考每一个转弯。你最终会到达,但需要花费更长的时间。
  • 发现: AI 模型必须对每个问题都进行这种“心理地图重构”。它们不能仅仅依赖记忆;它们必须处理原始逻辑,这使它们付出了时间代价。

2. “推理与死记”的分化
虽然所有人都变慢了,但模型的准确率分成了两个截然不同的群体:

  • “通用”模型(例如 GPT-4o、Claude): 这些模型就像擅长记忆闪卡的学生。当名称被混淆后,它们感到困惑。它们的成功率显著下降。
    • 这意味着: 它们依赖“标志”(即名称)来解谜。当标志消失后,它们就找不到路了。
  • “推理”模型(例如 DeepSeek-R1、GPT-5、DeepSeek-Prover-V2): 这些模型就像真正理解游戏规则的学生。即使名称被混淆,它们的成功率保持完全不变
    • 这意味着: 它们不需要标签。它们观察逻辑结构(即“架构”),并像以前一样准确地找出解决方案。

结论

该论文得出结论:仅仅匹配模式(例如识别单词"add")的 AI 与能够真正通过逻辑结构进行推理的 AI 之间存在真实差异。

  • 通用模型就像需要带有名称的导游手册的游客。如果你拿走导游手册,它们就会迷路。
  • 推理模型就像能够阅读蓝图的建筑师。即使建筑物没有任何标志,它们仍然能够弄清楚墙壁和梁是如何组合在一起的。

这项研究证明,虽然所有 AI 模型在被迫在没有标签的情况下思考时都会变得“更慢”,但只有真正的“推理”模型才能在这种“外星人”环境中保持高准确率。这表明,为了让 AI 在未来发现新的数学(那里还没有名称或标签),我们需要这些专注于推理的模型,而不仅仅是那些擅长模式匹配的模型。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →