← 最新论文
💬 NLP

RELIC: Evaluating Complex Reasoning via the Recognition of Languages In-Context

本文介绍了RELIC,这是一个通过测试大语言模型在上下文环境中识别上下文无关语言的能力来评估其复杂推理能力的框架,揭示出即使是最先进的模型也无法根据任务难度扩展推理计算量,并且随着复杂性的增加,它们往往从算法推理转向猜测。

原作者: Jackson Petty, Michael Y. Hu, Wentao Wang, Shauli Ravfogel, William Merrill, Tal Linzen

发布于 2026-04-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Jackson Petty, Michael Y. Hu, Wentao Wang, Shauli Ravfogel, William Merrill, Tal Linzen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在聘请一位非常聪明、博览群书的助手来解决一个谜题。你交给他们一本全新的规则手册(即“语法”)和一个特定的句子(即“字符串”)。你的问题很简单:“这个句子是否符合书中的规则?”

这正是论文 RELIC 所探讨的内容。它提出了一种新方法,用于测试大型语言模型(LLM)——即 ChatGPT 等工具背后的 AI 大脑——在即时获得新指令时,究竟能在多大程度上真正“思考”并解决复杂的多步骤问题。

以下是用简单类比对该论文发现的拆解:

1. 测试: “规则手册谜题”

研究人员设计了一个游戏,让 AI 扮演语法侦探的角色。

  • 设置:他们生成了数千本独特的、虚构的规则手册。这些不是英语或西班牙语,而是抽象的规则集合(例如"A 之后必须是 B",或"C 会变成 D")。
  • 任务:AI 看到规则手册和一个由随机符号组成的句子(如 t43 t51 t66)。它必须回答“是”(该句子符合规则)或“否”(该句子违反规则)。
  • 转折:他们通过增大规则手册的规模和延长句子的长度,使谜题变得更加困难。

2. 预期: “登山”类比

将解决这些谜题想象成登山。

  • 小山(简单谜题):如果规则手册很小且句子很短,AI 可以轻松登顶。它会使用逻辑地图(算法)来检查每一步。
  • 大山(困难谜题):随着规则手册变得巨大且句子变长,山势变得更加陡峭。为了正确解决它,AI 需要消耗更多的脑力(更多的“思考令牌”)来检查每一个可能性。这就像攀登更高的山峰需要更大的背包和更多的水一样。

3. 发现: “安静辞职”

这是该论文最令人惊讶且关键的发现。研究人员原本预期,随着谜题变难,AI 会通过使用更多的思考能力来“更加努力地尝试”。

相反,AI 开始“安静辞职”了。

  • 类比:想象一名员工被要求解决一个简单的数学问题。他们拿出计算器并完成了工作。但是,当你给他们一个巨大且复杂的方程时,他们并没有拿出超级计算器并花更长时间工作,而是直接猜测。他们停止尝试进行数学运算,转而基于直觉编造答案。
  • 证据
    • 当谜题变难时,AI 并没有使用更多的思考时间;实际上它使用的更少
    • AI 停止了使用逻辑的、逐步的推理(如构建可能性树),转而依赖糟糕的捷径(启发式方法)。
    • 即使是最先进的“推理”模型(那些旨在深度思考的模型)也出现了这种情况。它们起初会有一个好的计划,但在感到不知所措后,会默默地切换到猜测模式。

4. 结果: “出于错误的原因而正确”

论文发现,当 AI“安静辞职”时,它经常碰巧得到正确的答案,但理由却是错误的。

  • 示例:AI 可能会仅仅因为句子“太长”而拒绝它,即使规则实际上允许长句子。它得到了正确的“否”的答案,但其逻辑完全崩溃。
  • 问题:如果你无法看到 AI 的思考过程(这对许多商业模型来说是事实),你可能会因为它答对了而认为它很聪明。但实际上,它只是在猜测,并且在下一个难题上会失败。

5. 结论:脆弱的“大脑”

该论文得出结论,当前的 AI 模型是脆弱的。

  • 当任务简单时,它们能理解任务的概念
  • 但它们无法调整努力程度以匹配问题的难度。
  • 它们没有一个可靠的“内部引擎”会说:“这很难,我需要花更多时间在上面。”相反,它们放弃并猜测。

总结

该论文将 RELIC 引入作为 AI 推理的压力测试。它表明,即使是当今最聪明的 AI 模型,也像是那些能解决简单作业的学生,但一旦面对困难的考试,就会停止尝试解决问题,只是随机填涂选项。它们在困难任务上“安静辞职”,这使得它们在需要它们真正遵循规则而非仅仅猜测的复杂现实世界推理中变得不可靠。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →