← 最新论文
🤖 AI

How Well Do LLMs Perform on the Simplest Long-Chain Reasoning Tasks: An Empirical Study on the Equivalence Class Problem

本文对大语言模型在等价类问题上的表现进行了实证评估,揭示出尽管推理模型显著优于非推理模型,但两者均难以胜任该任务,其中非推理模型在连通性相变点处表现最差,而推理模型则在图直径最大时面临最大困难。

原作者: Chun Zheng, Lianlong Wu, Bingqian Li, Lvting Liu, Yi Zhou

发布于 2026-05-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Chun Zheng, Lianlong Wu, Bingqian Li, Lvting Liu, Yi Zhou

原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图弄清楚谁属于同一个秘密俱乐部。你有一系列规则,比如“爱丽丝和鲍勃在同一个俱乐部”以及“鲍勃和查理在同一个俱乐部”。如果你知道这两条规则,你就可以推断出爱丽丝和查理也在同一个俱乐部,即使没有人明确说过这一点。这就是等价类问题:一个关于连接线索的简单逻辑谜题。

本文提出了一个非常具体的问题:当连接链条变得非常长时,现代人工智能模型(大语言模型)能否解决这些谜题?

研究人员测试了两类人工智能:

  1. “非推理”模型:标准的、快速的人工智能,它基于模式猜测下一个词(如 DeepSeek-V3)。
  2. “推理”模型:较新的、会“思考”的人工智能,它在回答之前会暂停并制定逐步计划(如 DeepSeek-R1)。

以下是他们的发现,通过简单的类比进行解释:

1. “单步”壁垒(针对标准人工智能)

将标准人工智能想象成一位非常聪明但目光短浅的游客

  • 好消息:如果你问“爱丽丝和鲍勃在同一个俱乐部吗?”(直接链接),这位游客几乎每次都能答对。
  • 坏消息:如果你问“爱丽丝和戴夫在同一个俱乐部吗?”,而你需要通过鲍勃和查理才能找到答案(三步链条),这位游客就会完全迷路。
  • 结果:一旦链条超过一步,标准人工智能的表现就会崩溃。它将“爱丽丝 → 鲍勃 → 查理”视为三个独立、不相关的事实,而不是一个连贯的故事。它立即撞上了“推理壁垒”。

2. “精疲力竭的徒步者”(针对推理人工智能)

“推理”人工智能就像一位手持详细地图和指南针的徒步者

  • 好消息:这位徒步者要出色得多。他们能够成功追踪那些会让游客困惑的漫长连接链条。他们不会仅仅经过一步就迷路。
  • 坏消息:即使是最好的徒步者也会感到疲惫。研究人员发现,随着连接链条变得越来越长,徒步者开始犯更多的错误。这不像游客那样突然崩溃,而是错误率缓慢地呈指数级上升。
  • 结果:虽然这些模型要优越得多,但它们仍然无法完美解决每一个长链条问题。链条越长,它们出错的可能性就越大。

3. “混乱区”

研究人员注意到模型在何处失败存在一些有趣的现象。

  • 想象规则就像连接人们的蜘蛛网。
  • 对于游客(标准人工智能):当网络处于“混乱过渡”状态——即刚刚变成一团巨大的乱麻时,他们的失败最为严重。他们完全无法处理这种结构复杂性。
  • 对于徒步者(推理人工智能):当他们必须行走的路径达到绝对最长时,他们的失败最为严重。他们的挣扎不在于网络的混乱程度,而在于他们必须追踪的旅程的长度

4. 为什么“提示”没有帮助

研究人员尝试通过以下方式帮助人工智能:

  • 提供明确的规则(如规则手册)。
  • 先展示如何解决类似谜题的示例。
  • 要求它尝试多次并选择最佳答案。

令人惊讶的是:这些技巧都没有解决核心问题。

  • 给游客一本规则手册并不能帮助他们看到长链条。
  • 给徒步者展示示例并不能阻止他们在长路上感到疲惫。
  • 结论:问题不在于人工智能不知道规则,而在于它们的内部“引擎”无法一次性在脑海中保持长链条的逻辑。这是一种结构性限制,而非缺乏指令。

底线

该论文得出结论,虽然“推理”人工智能是一个巨大的飞跃,但它尚未解决完美、长链条逻辑的问题。

  • 标准人工智能就像一个一次只能做一次加法的计算器。
  • 推理人工智能就像一个能做长加法的计算器,但如果加法太长,它就开始丢失数字。

作者警告说,我们不应假设这些模型已经“解决”了逻辑推理问题。如果你需要人工智能保证完美的逻辑链条(例如在复杂的法律或安全关键情况下),这些模型仍然可能失败,尤其是当问题变得更大、更复杂时。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →