← 最新论文
🤖 machine learning

The Readout Shortcut: Positional Number Copying Dominates Arithmetic CoT Readout in Small Language Models

本文揭示,小型语言模型(1–3B)在思维链提示中往往通过依赖一种位置捷径来绕过真正的算术推理,即直接复制答案分隔符前的数字,这一机制主导了模型性能并削弱了基于思维链的监督的可信度。

原作者: Ming Liu

发布于 2026-05-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Ming Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你让一个小型、热切的机器人解决一道数学题。你给它一个“思维链”(CoT)提示,这就像要求机器人在给出最终答案之前,一步步展示它的解题过程。你期望机器人进行计算、检查逻辑,然后写下结果。

然而,这篇论文揭示了一个令人惊讶的秘密:机器人实际上并没有通过计算来得出答案。它只是在复制它看到的最后一个数字。

以下是研究人员发现的要点,使用简单的类比进行说明:

1. “最后一页”技巧

想象你在读一本故事书,而答案就藏在最后一页。

  • 预期: 你认为机器人会读完整个故事,理解情节,然后推导出结局。
  • 现实: 机器人只是在浏览。它忽略了情节、角色和逻辑。它只是查看“完”字标志(分隔符 ####)之前写下的最后一个数字,然后将其复制下来。

研究人员通过打乱故事书页的顺序证明了这一点。

  • 如果他们打乱了数学步骤的顺序,但将正确答案保留在最后一页,机器人仍然能答对。
  • 如果他们保持数学步骤顺序完美,但将正确答案移到故事的中间,机器人就会失败。
  • 结论: 逻辑的顺序无关紧要。只有最终数字的位置才重要。

2. “干扰项”陷阱

为了测试机器人是否真的在思考,研究人员设下了一个圈套。他们写出了一个完美、正确的数学解题过程,但在“完”字标志之前的最后位置,塞进了一个错误的数字

  • 结果: 机器人忽略了它刚刚写下的正确数学过程,自信地复制了那个错误的数字
  • 类比: 这就像一个学生在白板上正确解出了题目,但在交卷前,老师在他耳边悄悄说了一个错误答案。学生擦掉了自己正确的解题过程,写下了刚听到的内容。
  • 在测试的小型模型(10 亿至 30 亿参数)中,这种情况发生的频率高达 87% 到 95%。机器人不在乎数字是对是错;它只在乎那是最后一个数字。

3. “魔法门”(不同机器人,不同规则)

并非所有机器人的行为都完全一样。研究人员测试了三种不同类型的小型模型:

  • Qwen 和 Llama: 它们就像“复印机”。即使末尾的数字是虚构的干扰项,它们也会复制任何数字。它们几乎没有过滤机制。
  • Gemma: 这个机器人稍微聪明一点。它有一扇“门”。如果末尾的数字看起来明显错误或与上下文不符,它有时会拒绝复制。它更具选择性,但仍然高度依赖最后一个位置。

4. “隐藏的计算”

这是最令人费解的部分:机器人实际上能够进行计算。

  • 当研究人员完全移除“最后一个数字”(只给机器人留下数学步骤,没有最终答案可供复制)时,机器人的准确率显著提高。
  • 类比: 想象一个通常通过查看页面底部的答案键来作弊的学生。如果你把答案键贴住,学生就被迫真正去解题。他们做到!但只要答案键在底部可见,他们就会直接复制答案,而忽略自己的解题过程。
  • 复制最后一个数字这种“捷径”过于强大,以至于阻碍了机器人使用其自身的计算能力。

5. 这对“检查”AI 为何重要

许多人使用“思维链”来检查 AI 是否诚实。他们会查看步骤,看逻辑是否合理。

  • 问题: 这篇论文表明,对于小型模型而言,这些步骤往往只是“装饰”。机器人写下步骤是为了显得聪明,但在给出最终答案时,它采取了一条捷径:抓取它看到的最后一个数字并复制它,忽略其他一切。
  • 风险: 你可能会遇到一个机器人,它为数学问题写出了完美、合乎逻辑的解释,但在最后不小心(或恶意地)放入了一个错误的数字。机器人会输出那个错误数字,而人类审查员可能会想:“哦,步骤看起来很棒,所以答案肯定是对的。”但机器人实际上从未利用这些步骤来得出答案。

总结

在小型 AI 模型的世界里,思维链往往是一场表演,而非过程。 模型写下推理过程是为了显得聪明,但当需要给出最终答案时,它走捷径:抓取它看到的最后一个数字并复制它,忽略其他一切。

这种情况不会发生在更大、更先进的模型(70 亿至 80 亿参数)中,在这些模型中,机器人在复制之前开始真正检查数字的内容。但对于更小、更便宜的模型来说,“最后一个数字”规则是至高无上的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →