← 最新论文
🤖 machine learning

Behaviour Is an Incomplete Measure of Reasoning Development: Cross-surface pre-arrival accessibility and the limits of developmental inference in a recurrent-depth reasoner

本文表明,在循环深度推理器中,内部隐状态探测可以在推理能力表现为可观测行为之前很久就将其检测出来,从而揭示了行为阈值和解码器可访问性是衡量实际推理发展时间线的不同且不完整的指标。

原作者: Simon Lam-Muir

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Simon Lam-Muir

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能这一快速发展的领域中,研究人员经常面临一个根本性的问题:机器究竟何时才算真正学会了某种知识?多年来,标准的答案一直是行为主义的。如果一个计算机程序能够正确回答一个它从未见过的问题,我们就假设它已经获得了完成该任务所需的推理能力。我们观察输出结果,即最终答案,并据此宣布该能力已存在。然而,这种方法将机器的心智视为一个黑盒,假设在正确答案出现的那一刻,其内部的思考过程必然已经发生。本文通过观察机器在学习过程中的状态来挑战这一假设,探讨这种解决问题的能力是否在机器能够在外部表现出来之前,就已经在内部存在。研究人员不仅是在观察机器的行为,他们还在测量机器所掌握的知识,即便机器当时还无法证明这一点。

为了理解其中的利害关系,想象一下你在学习一门新语言。你可能花了数月时间记忆词汇和语法规则,却仍然无法进行对话。一个只观察你的言语的老师可能会认为你什么也没学到。但如果你能窥视你的大脑,你可能会发现,语言的神经通路已经在形成,正等待着最后的火花将它们连接起来。这正是研究人员调查的差距。他们构建了一个专门的计算机模型,旨在解决涉及关系链的逻辑谜题,例如理清家族树中谁与谁有亲缘关系。他们使用两种不同的方法来训练这个模型:一种是使用抽象、无意义的符号来描述关系,另一种是使用类似英语的句子来描述相同的关系。其目标是观察信息的呈现方式是否改变了模型的学习速度,以及模型的内部状态是否揭示了其行为本身未能体现的知识。

结果是令人震惊且违反直觉的。当模型接受抽象符号训练时,它仅用了七十个训练周期就掌握了三步逻辑谜题。而当完全相同的模型、使用完全相同的训练计划,接受英语式句子的训练时,它花费了超过一万三千个周期才达到同样的胜任水平。这是超过一百八十倍的差异。然而,一旦经过句子训练的模型破解了三步谜题,它只需八个周期就能解决四步版本的谜题。这表明,该模型在经历了一个看似毫无进展的艰难阶段后,突然间解锁了解决更难问题的能力。如果研究人员仅仅观察最终答案,他们会看到一台在失败了很长时间后突然成功的机器,从而错过了在挣扎过程中发生的整个隐藏的内部发展历程。

为了观察那些漫长且艰难的周期中发生了什么,研究人员观察了模型的隐藏状态——即机器用于思考的数据内部表示。他们使用了一种简单的工具,即线性探测器(linear probe),它充当解码器的角色,用以检查在模型能够自主给出正确答案之前,正确答案是否已经存在于机器的思维之中。在经过句子训练的表面层面上,这种探测器可以在模型能够正确回答之前,就检测到未来答案的身份,并呈现出微弱但可靠的信号。探测器发现,信息在内部是可获取的,尽管模型当时还无法表达出来。这种内部可获取性并非偶然;当研究人员切换回抽象符号时,他们发现模型在处理过程中的特定点上也存在同样的早期可获取性模式。机器在内部持有关于答案的信息,等待着合适的时机将其释放。

然而,这项研究也揭示了我们在尝试衡量这类学习时的一个重大局限性。研究人员想要精确追踪这种内部知识随时间增强的过程,从而绘制出机器的学习曲线。然而,他们很快意识到,这种特定的测量在准确执行上是不可能的。问题在于,机器正在接受测试的问题组一直在发生变化。随着机器的学习,它变得擅长回答某些问题,而这些问题便从测试组中被移除了。这意味着,衡量机器进步的行为本身正在改变正在被测量的题目群体。这就像试图通过只计时那些运动员尚未跑完的赛道来衡量其进步速度;随着他们变得更快,赛道也在变化,使得无法在时间维度上进行公平的比较。研究人员证明,这种特定类型的测量在当前语境下存在根本性的缺陷,这并非因为机器没有学习,而是因为追踪它的方法失效了。

论文总结道,我们不能依赖单一的方式来了解机器学到了什么。行为上的成功(即给出正确答案的能力)只是一个可观察的事实。内部可获取性(即在机器内部检测到答案的能力)是另一个事实。而随时间推移的实际发展过程则是第三个事实,如果测量方法本身改变了条件,这个过程往往无法被直接测量。研究人员发现,机器可以从内部拥有某种能力,远早于它在外部展示出这种能力,并且问题的呈现方式不同,通往该能力路径也会大相径庭。最重要的是,他们表明,仅仅观察机器,无论观察得多么仔细,都是不够的。要真正了解机器学到了什么,我们必须超越观察,开始进行干预,直接测试机器的内部状态,以观察它们是否是其行为的真实原因。在此之前,这些系统的内部生活仍然是部分隐藏的,即便它们最终给出了正确的答案。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →