← 最新论文
🤖 machine learning

The Algorithm Is Not the Behavior: Learned Priors Override Look-Ahead in a Chess-Playing Neural Network

这项研究表明,在 Leela Chess Zero 中,神经网络内部的算法前瞻能够正确解决国际象棋谜题,但这些解法在最终输出中被习得的安全先验系统性地覆盖,从而证明了算法结构的出现并不保证算法行为的实现。

原作者: Elias Sandmann, Sebastian Lapuschkin, Wojciech Samek

发布于 2026-06-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Elias Sandmann, Sebastian Lapuschkin, Wojciech Samek

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心思想:大脑知道答案,但嘴巴却说了别的话

想象一下你正在参加一场非常困难的数学考试。你是个天才,已经苦读多年。在解题的过程中,你的大脑正确地计算出了答案:42。你百分之百确定。你完成了计算,检查了步骤,逻辑完美无缺。

但就在你要写下答案的前一刻,脑海中有一个声音在低语:“嘿,写 42 太冒险了。万一老师生气了怎么办?不如就写‘10’吧。这样更稳妥,不会出乱子。”

于是,你写下了 10

这篇论文研究的是一个超级聪明的 AI 国际象棋引擎——Leela Chess Zero。研究人员发现,这个 AI 也遇到了完全相同的问题。它经常在“大脑”(它的中间层)深处计算出了完美的、致胜的一步,但随后却忽略了这个答案,转而走了一步平庸、保守的棋。

侦探工作:“Logit Lens”(逻辑透镜)

他们是如何知道 AI 其实知道答案的呢?他们使用了一个叫做 “Logit Lens” 的工具。

把 AI 的大脑想象成一栋有 15 层楼的建筑:

  • 底层: AI 观察棋盘。
  • 中间层: AI 开始思考、计算并探索不同的走法。
  • 顶层: AI 做出最终决定并选择走法。

通常情况下,我们只能看到顶层发生了什么。Logit Lens 就像一副特殊的眼镜,让研究人员能够窥视 AI 在思考过程中,每一层楼上正在记录的笔记。

当他们通过这副眼镜观察时,看到了令人震惊的一幕:

  1. 中间层,AI 正自信地大喊:“把皇后移到这里!这是将死!我们赢定了!”
  2. 但随着信号向顶层传输,那个自信的声音逐渐变小了。
  3. 等到信号到达顶层时,AI 已经改变了主意,变成了一个微弱且保守的念头,比如:“把国王往后退一点点。”

研究人员将这些现象称为 “被遗忘的谜题” (Forgotten Puzzles)。AI 找到了解决方案,却随后“忘记”了去使用它。

为什么会发生这种情况?“安全保镖”

研究人员问道:是 AI 没算对吗?还是它没看到将死的情况?

他们检查了“计算过程”(前瞻机制),发现它运行得非常完美。AI 确实 看到了未来的走法。它 确实 知道那条致胜路径。

那么,是什么阻止了它?

他们发现 AI 产生了一种 “安全偏见” (Safety Bias)
想象一下,AI 的训练数据是一个巨大的图书馆,里面包含了数百万局国际象棋比赛。在大多数这类比赛中,打得稳健、不丢子力是一种好的策略。AI 完美地学习了这一点,以至于这成了它的习惯。

在网络的最后几层中,一个 “安全保镖” 介入了。这个保镖看着那个令人兴奋、带有风险的致胜招式(比如为了赢棋而牺牲皇后),然后说:“不,不,不。那太危险了。我们不想丢掉棋子。还是稳妥一点吧。”

保镖用这种保守的本能覆盖了天才般的计算。

证据:推开保镖

为了证明这就是问题所在,研究人员尝试去“引导”这个 AI。想象一下,他们轻轻把手搭在“安全保镖”的肩膀上,低声说:“嘿,放松点。这次冒险也没关系的。”

他们通过数学手段,将 AI 的内部想法从“安全”转向“激进”。

结果是:

  • 当他们这样做时,AI 突然记起了那些它原本遗忘的致胜招式。
  • 它找回了原本失败掉的谜题中 61.7% 的解法。
  • 这证明了 AI 一直都拥有答案;它只是需要得到“允许”去说出来。

总结

这篇论文的主要教训简单却深刻:仅仅因为一台计算机在其大脑内部拥有正确的答案,并不意味着它会把它大声说出来。

这个 AI 并不“笨”或“坏掉了”。它实际上非常聪明。但它的“性格”(关于安全的学习习惯)有时比它的“逻辑”(计算获胜的能力)更加强大。

这很重要,因为它表明当我们观察 AI 时,不能仅仅信任最终的输出。AI 可能会在这一层层谨慎的外壳下隐藏其真实的实力。如果我们想要了解 AI 真正的能力,我们就必须深入观察它的内部层级,去看它在“思考”什么,而不只是看它在“做”什么。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →