← 最新论文
🤖 AI

Reasoning Structure of Large Language Models

本文介绍了一种可扩展的基准测试和流水线,用于将非结构化推理轨迹转换为可验证的图,从而实现对推理结构和效率的定量分析,以便在传统的准确率和标记计数指标之外,更好地诊断失效模式并比较模型行为。

原作者: Frédéric Berdoz, Luca A. Lanzendörfer, Fabian Farestam, Roger Wattenhofer

发布于 2026-06-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Frédéric Berdoz, Luca A. Lanzendörfer, Fabian Farestam, Roger Wattenhofer

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在观察两位厨师尝试烤制完全相同的蛋糕。最后,两位厨师都交给你了一个完美、美味的蛋糕。如果你只看最终成品,你可能会认为他们做的是同样的工作。但如果其中一位厨师遵循了精确的、一步一脚印的食谱,而另一位厨师在厨房里闲逛,尝试了十种不同的原料,烤焦了几批蛋糕,最后只是偶然撞到了正确的配方呢?

长期以来,当我们测试 AI “推理”模型时,我们只看最终的蛋糕(答案)或者它们用多少词来描述过程(Token 数量)。这篇论文认为,这就像仅凭蛋糕的味道来评判一位厨师,却忽略了他们是真的懂得烹饪,还是仅仅运气好。

以下是研究人员如何揭开幕后真相的简单解释:

1. 谜题游乐场

研究人员没有要求 AI 写文章或解决模糊的谜语,而是给了它们 21 个不同的逻辑谜题(比如“帐篷”谜题,你必须根据严格的规则将帐篷放置在树木旁边)。这些谜题就像是脑力的受控健身房。它们有明确的规则,且无法作弊;你要么解开它,要么解不开。研究人员让这些谜题变得越来越难,就像在杠铃上增加重量一样。

2. 将文字转化为地图

当 AI 解决一个谜题时,它通常会写下一长串的思想流(即“痕迹”)。研究人员构建了一个特殊的工具,可以将这种杂乱的文本流转化为一张视觉地图(图表)。

  • 节点(点): 每个点代表 AI 提出的一个事实或主张(例如,“这个位置有一棵树”)。
  • 边(线): 线条连接各个点,展示一个事实是如何引导出另一个事实的(例如,“因为这里有一棵树,所以那里必须有一个帐篷”)。

这把一段文字变成了一个可以被测量的结构化图表。

3. 新的评分卡:“推理效率”

研究人员引入了一个新的指标,称为效率 (η\eta)。你可以把它理解为衡量 AI 思考有多“专注”。

  • 高效率(激光): AI 的地图看起来像一条笔直、狭窄的隧道。它收集必要的材料,并直接走向解决方案,没有徘中环顾。
  • 低效率(迷雾): AI 的地图看起来像一个杂乱的蜘蛛网。它探索许多死胡同,反复重复同样的事实,并在(可能)找到答案之前在问题的边缘徘徊。

4. 他们的发现

通过使用这张地图和效率得分,他们发现了一些旧有的“最终答案”评分所忽略的惊人事实:

  • 词数多 \neq 思考更好: 仅仅因为一个 AI 使用了更多的词(Token),并不意味着它在进行更好的思考。事实上,研究人员发现,多出来的词往往只是 AI 在“自我检查”或是在原地打转,而不是在真正解决问题。
  • “弥散”问题: 一些模型虽然得到了正确答案,但它们的地图非常杂乱、分散。它们就像一个侦探,虽然找到了罪犯,但在此之前先采访了 50 个无辜的人。而其他模型则是“专注型”的,能以清晰、直接的路径找到答案。
  • 难度之墙: 随着谜题变得越来越难,AI 模型开始出现失败。即使研究人员允许它们使用海量的词汇(计算能力),这些模型仍然无法解决最难的谜题。事实证明,仅仅给 AI 更多的时间去“思考”(更多的 Token)并不能修复根本性的推理缺陷。
  • 结构至关重要: “效率”得分可以区分出一个模型是聪明且专注,还是仅仅在靠猜测和尝试,即便两者的最终得分相同。

核心结论

这篇论文为我们观察 AI 思考提供了一种新方式。我们不再仅仅问:“它得到正确答案了吗?”我们现在可以问:“它是如何得到答案的?”

这就像是一个背诵答案表的学生与一个真正理解数学原理的学生之间的区别。研究人员构建了一个工具来观察其中的“理解”部分,通过绘制逻辑步骤的地图,证明了 AI 如何推理与它回答了什么同样重要。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →