← 最新论文
💬 NLP

Emergent retokenization symmetry in large language models: phenomenology and applications

本文表明,大型语言模型在训练过程中部分发展出了对语义等价分词序列的涌现对称性,揭示了“重分词”(即用替代的有效分词序列替换规范的分词序列)不仅可以作为衡量组合理解能力的纯净探测手段,也是一种能够找回传统方法所遗漏解的新颖推理时采样策略。

原作者: Kanishk Jain, Matthew Day, Tankut Can

发布于 2026-06-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Kanishk Jain, Matthew Day, Tankut Can

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在读一本书,但书里的文字并不是以完整的单词呈现,而是被印成了一种奇怪的代码,每个单词都被切成了大小不一的块。有时“probable”是一个整体块;而有时,它会被切成两块:“prob”和“able”。

在大型语言模型(LLM)的世界里,它们正是这样阅读的。它们看到的不是字母,而是“标记”(tokens,即文本块)。通常情况下,计算机有一个严格的规则手册(分词器/tokenizer),规定:“始终将 'probable' 切分为 'prob' 和 'able'。”这就是**规范的(canonical)**方式。

这篇论文提出了一个引人入胜的问题:如果我们打破规则会怎样? 如果我们把完全相同的句子喂给模型,但用不同的方式进行切割(例如:“pro” + “b” + “able”)?模型会感到困惑吗,还是它依然能理解其中的含义?

作者将这个过程称为重分词(Retokenization)。以下是他们发现的研究结果,通过简单的解释呈现如下:

1. 模型的“秘密语言”

研究人员发现,尽管模型被训练成始终以“标准”方式阅读单词,但它在秘密地理解那些“非标准”的方式。

  • 类比: 想象一位厨师接受过专门训练,负责将洋葱切成完美的、均匀的正方体块。如果你递给他一堆切得形状不一、奇形怪状的洋葱,他可能仍然能做出汤。他明白“洋葱”就是“洋葱”,无论形状如何。
  • 发现: 模型并非对这些奇怪的形状完全“盲目”。它仍然可以进行数学计算、编写代码或回答问题。然而,它也并非完全不受影响。这些奇怪的形状会让模型的内部“大脑”(隐藏状态)运作方式发生轻微变化。这就像那位厨师在处理奇形怪状的洋葱时会感到稍微有些压力,尽管最后的汤味道依然不错。

2. 一种“掷骰子”的新方式

当我们要求 AI 解决一个问题时,我们通常会让它尝试几次,并从中选出最好的答案。这被称为温度采样(Temperature Sampling)。这就像是通过掷骰子来决定 AI 下一步要说什么。

作者发现了一种获取不同答案的新方法:重分词采样(Retokenization Sampling)

  • 类比: 想象你正在尝试走出迷宫。
    • 标准采样: 你走着同样的路径,但在每次遇到岔路口时,你通过抛硬币来决定向左还是向右。
    • 重分词采样: 你走着同一条路径,但你稍微改变了“地图”。也许你重新绘制了墙壁,或者改变了转弯处的标签。尽管目的地没变,但新的地图迫使你的大脑采取不同的路线到达终点。
  • 结果: 有时,这种“新地图”能帮助 AI 找到它在“标准地图”下会错过的解决方案。这就像是通过从不同的角度观察蓝图,从而发现了一扇隐藏的门。

3. 哪里有效(以及哪里无效)

论文在三类任务上进行了测试:

  • 数学题 (GSM8K): 模型的表现还可以。奇怪的切割并没有带来太多帮助,但也没有让模型崩溃。
  • 多选题 (MMLU): 模型在这里非常敏感。改变切分方式会使其更有可能答错。
  • 编程 (HumanEval): 这是最令人兴奋的地方。编程有很多种解决同一个问题的方法。研究人员发现,通过改变代码的切分方式,AI 有时能找到完全不同的、正确的程序编写方式,而这些方式在常规情况下是无法被发现的。

4. 创造力的代价

这里有一个代价。

  • 类比: 想象你正试图更快地阅读一本书。
    • 标准方式: 你正常地阅读单词。
    • 重分词方式: 你必须在阅读之前,先停下来重新切分每一个单词。
  • 发现: 因为模型必须处理这些“被奇怪切分”的单词,所以获取答案需要消耗更多的计算能力(和时间)。它不像标准方式那样高效。论文结论指出,虽然这种方法是探索“新”解法的酷炫工具(尤其是在编程领域),但它并不是取代标准 AI 使用方式的“灵丹妙药”,因为它更慢且更昂贵。

总结

这篇论文表明,AI 模型比我们想象的要聪明。它们不仅仅是死记硬背一种阅读单词的方式,它们拥有一种灵活的理解力,能够处理不同“切分方式”下的文本。

通过刻意将文本切分成奇怪的块,研究人员可以迫使 AI 以略微不同的方式进行思考,从而有时能挖掘出那些它原本会错过的正确答案(尤其是在编程中)。这是一个探索 AI 如何思考的新工具,证明了我们向计算机输入信息的方式,与信息本身一样重要。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →