← 最新论文
🤖 AI

Cliff Tokens: Identifying Single-Token Failure Triggers in LLM Mathematical Reasoning

本文引入了“悬崖标记”(cliff tokens)作为大语言模型数学推理失败的精确单标记触发器,提出了这些标记的分类法,并证明通过 Cliff-DPO 对其进行优化可以显著提高模型在各种基准测试中的准确率。

原作者: Jaeyong Ko, Pilsung Kang, Yukyung Lee

发布于 2026-06-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Jaeyong Ko, Pilsung Kang, Yukyung Lee

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,一个大型语言模型(LLM)尝试解决数学问题,就像一名登山者试图登上山顶。大多数时候,登山者沿着一条清晰、安全的路径走向顶峰。然而,有时即使是在同一座山上,拿着同样的地图,登山者也会走错路,最终坠入山谷,永远无法到达顶峰。

长期以来,研究人员知道这些“错误的转向”确实存在,但他们并不清楚登山者究竟是在哪里偏离了路径。是一个错误的段落?一个错误的句子?还是仅仅因为一个特定的词改变了一切?

这篇论文引入了一个新概念,称为**“悬崖标记”(Cliff Token)**。

悬崖隐喻

将登山者的旅程想象成沿着悬崖边缘的小径。在旅程的大部分时间里,地面都是坚实的。但随后,会出现一个特定的脚步,地面突然塌陷,坠入深渊。一旦登山者踏出那一步,通往顶峰的路径就消失了。无论他们之后如何努力想要爬回去,都无法到达顶峰。

作者将这一个灾难性的步骤称为**“悬崖标记”**。

他们是如何发现悬崖的

此前,研究人员观察的是整个旅程的大块部分(如整个句子),或者等到登山者已经迷路后才去查看出了什么问题。这篇论文使用了一种更精确的工具:一个统计学上的**“跳板”**。

他们模拟登山者从每一个单词开始,在每一步都进行 64 次不同的路径尝试。如果在某个特定单词之后,到达顶峰的概率显著下降(就像掉下悬崖一样),他们就会将该单词标记为“悬崖标记”。他们使用一种特殊的数学测试(z-检验)来确保这是一个真实的跌落,而不仅仅是随机的波动。

重大发现:一个词就能毁掉一切

研究人员在七个不同的 AI 模型和三个数学基准测试上进行了测试。他们发现了一些令人惊讶的事实:

  • 触发器: 在许多失败的尝试中,恰好有一个单词导致模型迷失了方向。
  • 修复方法: 如果你删除这个“悬崖标记”,并要求模型从该单词之前的那个词重新开始,模型几乎总是能再次找到正确答案(在他们的测试中实现了 100% 的恢复)。
  • 陷阱: 如果你强迫模型保留这个坏词,即使你让它尝试 64 次去恢复,它通常仍然会失败。这一个词将模型锁死在了死胡同里。

三种类型的“悬崖”

研究人员将这些坏词分为三类,就像不同类型的危险地形一样:

  1. 自信悬崖(确定性): 模型 100% 确定这是正确的词,但实际上它是错的。这就像登山者因为以为那是座桥,而自信地踏向悬崖边缘。这发生是因为模型存在根深蒂固的习惯或偏见。即使你换成更大、更聪明的模型,它也会犯完全相同的错误。
  2. 不确定悬崖(不确定性): 模型感到困惑。它站在一个分叉路口,不知该往哪走,然后选错了路。这发生是因为模型缺乏特定的知识。更大的模型可能不会犯这种错误,因为它们知道得更多。
  3. 运气好猜悬崖(采样偏差): 模型知道正确的路径,但被大脑中的随机噪声分散了注意力,偶然选了一个奇怪且不太可能的词。这就像登山者被一颗松动的石头绊倒了。这纯粹是运气不好。

修复登山者(Cliff-DPO)

作者不仅发现了这些悬崖,还尝试修复它们。他们专门针对如何避免这些“悬崖标记”来教导 AI 模型。

  • 有效的方法: 教导模型避免不确定型运气好猜型悬崖,使模型的数学能力大幅提升。这就像教导登山者在困惑时要更加仔细观察,或者忽略随机的干扰。
  • 无效的方法: 教导模型避免自信型悬崖并没有起到作用。由于这些是根深蒂固的习惯,仅仅告诉模型“不要那样做”不足以改变其本质属性。

核心结论

这篇论文表明,AI 的数学推理失败并不总是因为模型整体“笨拙”。通常,是因为单个单词充当了陷阱。通过识别并移除仅仅这一个词,或者通过专门训练模型来避开这类陷阱,我们可以显著提高这些 AI 系统解决问题的能力。

这项研究仅限于数学问题,并且需要大量的计算能力来寻找这些“悬崖”,但它提供了一种非常具体的新方法,来理解并修复 AI 何时会陷入困境。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →