← 最新论文
💬 NLP

Shortcut Before Circuit: Document Statistics Time In-Context Conflict Resolution

本文表明,当训练数据中的近期性(recency)与稀有性(rarity)线索完全相关时,神经网络在解决上下文冲突时会学习到无法区分的策略,这揭示了在跨越特定的冗余阈值之前,机械归因(mechanistic attribution)在根本上是不可用的,而一旦跨越该阈值,模型便会脱离位置捷径,其底层机制也随之变得可识别。

原作者: Yijun Liao, Fanwei Liang

发布于 2026-08-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Yijun Liao, Fanwei Liang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能研究领域,研究人员正日益关注机器如何学习解决问题——不仅是通过记忆答案,而是通过发现支配任务的底层规则。想象一名学生,他通过识别数字中的模式而非回忆特定公式来学习解决数学题。在大型语言模型的世界里,这些模式通常被称为“线索”(cues)。当计算机阅读一段长文本时,如果文本包含相互矛盾的事实,它必须决定信任哪一部分信息。例如,如果一份文档在第一段说一个角色很高,而在最后一段说他很矮,模型必须决定是依赖最新的陈述,还是依赖某个特定细节出现的次数。在人类写作这种混乱且自然的现实世界中,这些线索通常是一致的:最新的事实往往也是被提及次数最多的事实。这种一致性使得科学家几乎无法判断机器究竟是在使用哪条规则,因为无论使用哪种规则,机器都能得到正确答案。

一个研究小组试图通过创建一个受控环境来解决这个谜题,在这个环境中,游戏的规则非常清晰,然而两种不同的解决策略在数学上是完全等价的。他们构建了一种合成语言,其中最新的信息总是最罕见的,而重复次数最多的信息总是最旧的。在这种设定下,模型可以通过寻找“最新”的事实来解决任务,也可以通过寻找“最稀有”的事实来解决任务,且这两种策略都会导致正确答案。由于训练数据从未迫使模型在这两条路径之间做出选择,研究人员想要观察机器实际上走了哪条路。他们在一套这样的语言上训练了一个大型人工神经网络,然后进行了一项精密的实验:他们拿出一份完成的文档,并对其进行了细微的修改,改变了特定事实出现的次数,但没有改变文本的含义或正确答案。通过观察模型信心如何响应这种微小的变化,他们就能看出模型是在遵循“最新”规则还是“最稀少”规则。

结果揭示了关于这些机器如何学习的一个惊人真相。当研究人员观察模型的最终表现时,他们发现每一个模型都以近乎完美的准确度掌握了这项任务。然而,当他们检查模型的内部逻辑时,发现每个模型所使用的特定规则并非由数据本身决定。相反,规则的选择是由每次训练运行中优化过程的具体轨迹决定的。在数十次训练运行中,一些模型学会了优先考虑最新的信息,而另一些则学会了优先考虑最稀有的信息。至关重要的是,研究人员发现他们提供的训练数据并不包含任何会将模型推向其中一条规则的信号。目标函数(即模型试图实现的数学目标)对这两种策略是完全中立的。因为训练数据认为这两种规则同样有效,模型仅仅是根据其特定的优化路径在目标函数未约束的方向上停止的位置,从而选择了其中之一,而不是随机选择。

这一发现挑战了人工智能研究中的一个普遍假设:即我们可以通过观察模型的行为,就自信地断定它学习了某种特定规则,是因为数据要求它这样做。研究表明,当两条规则都能导致相同的结果时,模型在两者之间的选择并不是对数据的反映,而是反映了该次运行特定的优化轨迹。研究人员通过展示,如果使用完全相同的数据但使用不同的随机种子重新训练同一个模型,它可能会选择相反的规则,尽管其最终表现保持不变,从而证明了这一点。这意味着对于某些类型的问题,模型内部的“机制”——即它用来解决任务的具体电路——不是数据的固定属性,而是训练过程的一个变量结果。

该研究还揭示了模型学习过程中的一个独特阶段。在发现正确的规则之前,它们通常依赖于一种简单的捷径。在这个特定任务中,模型最初学会了完全忽略文本内容,转而根据其位置来猜测答案。它们发现正确答案总是出现在距离句子末尾的特定距离处。这种位置捷径非常有效,使模型能够快速达到中等的准确度。然而,这种捷径有一个硬性限制;它只能在答案距离保持一致时起作用。随着训练的持续,模型最终放弃了这种捷径,开始真正阅读并理解文本,这种转变发生的时机取决于任务的复杂程度。研究人员发现,这种转变的时间点是可预测且一致的,但模型在转变后所采用的具体规则却是不确定的。

最终,这项工作为我们何时能真正了解机器学到了什么提供了一个新的标准。它表明,只有当数据迫使模型在备选方案之间做出选择时,我们才能自信地将特定的推理规则归因于模型。当数据允许多种同样好的解决方案时,模型的内部逻辑就变成了其特定的训练运行在不受约束的方向上停止的位置,而非由数据所必然要求的。这并不意味着模型出了问题或它们的答案是错误的;这意味着答案背后的“为什么”往往隐藏在它们特定的训练轨迹中,而非其所接收的信息结构中。对于试图解释这些系统的科学家来说,这提醒人们:模型的成功并不保证其内部过程是唯一且可预测的。机器通往解决方案的路径与解决方案本身同样重要,而且有时,那条路径是由其训练的具体动态所决定的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →