← 最新论文
💬 NLP

When the Canonical Completion Is Wrong: Formalizing and Measuring the Jump in Large Language Models

本文正式定义并衡量了大语言模型的“跳跃”能力——即其放弃默认的标准补全而转向独特的、正确的公理系统的能力——并证明了前沿模型在所有试验中都成功执行了这一步骤,从而表明任何所谓的无能之处在于生成约束或框架,而非在于跳跃本身。

原作者: Dai Shi, Xiaoyu Li, José Miguel Hernández-Lobato

发布于 2026-08-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Dai Shi, Xiaoyu Li, José Miguel Hernández-Lobato

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能研究领域,一个核心问题长期以来一直让研究人员产生分歧:机器能否真正思考超越其已见过的模式?大语言模型是归纳法的专家,通过识别海量文本中的统计趋势来学习预测句子中的下一个词。它们在演绎法方面也变得日益熟练,能够遵循严格的逻辑规则得出结论。然而,第三种推理形式——被称为“溯因推理”(abduction)的能力——仍然是一个谜。这种能力是指从一组观察结果中跃迁到一个全新的规则或公理体系的能力,这种思维上的飞跃通常需要抛弃最显而易见的答案,转而选择一个令人惊讶的、未曾预见的可能性。多年来,怀疑论者认为这些模型在结构上无法实现这种跃迁,认为它们被困在重复已知知识的循环中。另一些人则对此提出了挑战,指出了机器生成的数学发现,但由于缺乏一种精确定义或衡量这种“跃迁”的方法,这场争论一直停留在理论层面。

现在,一支研究团队通过构建一个严谨的测试,切断了这种不确定性,以观察模型是否能在事实要求时放弃其默认本能。他们并没有要求模型从零开始发明新理论(因为这无法验证),而是创建了一个规则固定的受控实验室环境。想象一个谜题:你得到了一张部分图像和一系列严格的约束条件,这些条件排除了完成图像最显而易见的方式。研究人员将“跃迁”定义为这样一个时刻:模型意识到标准的、最符合逻辑的补全方式是被禁止的,因此必须转而构建一个符合约束条件的全新、隐藏的结构。为了实现这一点,他们使用了一个数学框架来识别“规范补全”(canonical completion)——即基于已知信息对数据进行扩展的最自然方式。随后,他们设计了一些问题,在这些问题中,这个自然的答案被明确禁止,从而迫使模型寻找一个数据本身并未展示出的、唯一的、非显而易见的解。

研究人员在九个不同的认证问题上测试了这一点,这些问题涵盖了从简单谜题到拥有数百万种可能答案的复杂场景,并使用了四种最先进的语言模型。他们测量了模型在多大程度上坚持使用被禁止的默认答案,以及在多大程度上成功地向正确的、受约束的解进行了“跃迁”。结果令人震惊。在每一次模型被迫做出选择的试验中,没有一个模型退回到它们被训练去偏好的默认答案。在 248 次尝试中,模型每次都成功地放弃了被排除的默认值,落在了正确的、经过认证的解上。当它们失败时,并非因为它们拒绝跃迁,而是因为它们耗尽了“脑力”或出现了计算错误,但它们从未退回到那个旧的、错误的答案。

这一发现表明,当旧路径被封锁时选择新路径的能力并不是这些模型的瓶颈。模型证明了当约束条件明确时,它们能够覆盖自身的直觉。研究人员得出结论,如果这些模型确实缺乏人类历史上所见的那种创造性飞跃的能力,那么问题并不在于在选项之间进行选择。相反,困难可能在于更早、更混乱的步骤:即生成迫使跃迁发生的约束条件,或是发明使跃迁成为可能的全新规则框架。这项研究并未声称已经解决了机器创造力的谜团,但它明确证实了:当路径被清晰地阻断时,这些模型是有能力找到新出路的方法。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →