← 最新论文
💬 NLP

Comparing Transformers and Hybrid Models at the Token Level

本文通过使用 Olmo 3 和 Olmo Hybrid 分析了纯 Transformer 模型与混合语言模型在 Token 级别的性能差异,揭示了混合模型在预测语义内容和通过循环层追踪状态方面表现出色,而 Transformer 在语法括号匹配和 nn-gram 复制任务上则更具优势。

原作者: Yanhong Li, William Merrill

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Yanhong Li, William Merrill

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教两种不同类型的学生如何写出故事的下一句话。一位是超级阅读者(Transformer),另一位是带着笔记本的超级阅读者(混合模型/Hybrid model)。

论文提出了一个问题:那个带着笔记本的学生,究竟在什么时候比那个仅仅依赖记忆所读内容的学生做得更好?

以下是利用简单的类比对研究结果进行的拆解:

1. 两种学生

  • 超级阅读者 (Transformer): 这个学生对刚刚读到的所有内容都有惊人的记忆力。如果你说,“猫坐在……”他们能立刻想起三句话前提到了“垫子”。他们非常擅长模仿模式并完成符合严格规则的句子(比如用 ) 来匹配 ()。
  • 带着笔记本的超级阅读者 (Hybrid): 这个学生同样拥有良好的记忆力,但他们还随身携带一个笔记本,在阅读过程中记录下故事的“状态”。他们追踪谁拥有什么、谁正在做什么,以及情节是如何演进的。

2. “笔记本”学生胜出的时刻

研究发现,当故事需要追踪变化中的情境时,那个带着笔记本的学生(Hybrid)在预测下一个词方面表现得更出色。

  • “内容”优势: 当需要预测实词(如名词、动词和形容词)时,混合模型表现优异。这些是句子的“肉感”部分,承载着新的意义。
    • 类比: 想象一个侦探故事。如果文本说,“侦探发现了一个红色的**……**”,超级阅读者可能会根据常见短语猜“帽子”或“汽车”。但混合学生因为在笔记本里记录了嫌疑人之前穿着红色外套,所以更有可能猜出“外套”,因为他在追踪“故事状态”,而不仅仅是眼前的词汇。
  • “状态”优势: 在需要跨越长距离记住某个角色或物体的任务中,混合模型表现更好。
    • 例子: “利亚姆是小提琴手。娜奥米是飞行员。……(很多词之后)……那位小提琴手审查了报告。” 即使中间隔了很长一段距离,混合模型也能通过更新其内部状态,更好地记住“小维琴手”指的是利亚姆。

3. “记忆”学生胜出的时刻

令人惊讶的是,在某些答案就在眼前的情况下,那个没有笔记本的学生(纯粹的 Transformer)反而表现得更好。

  • “闭合”优势: 当文本需要闭合一个结构时,Transformer 胜出。
    • 类比: 如果文本有一个左括号 (,Transformer 知道对应的右括号 ) 应该是多少。它不需要笔记本来记住 ( 需要一个 ),它只需观察可见的文本即可。混合学生有时会在这里感到困惑,可能是因为他们太忙于追踪“故事状态”,从而忽略了简单的结构规则。
  • “复制”优势: 如果文本正在重复一个长句(比如复制粘贴错误或重复列表),Transformer 是无敌的。
    • 类比: 如果文本说,“敏捷的棕色狐狸跳过了那只懒狗。敏捷的棕色狐狸跳过了……”,Transformer 直接复制它眼前看到的模式即可。混合学生试图去理解这种重复背后的“意义”,这属于不必要的额外工作,因此表现较差。

4. “虚词”之谜

论文还研究了像“the”、“is”、“and”或“to”这类微小且枯燥的词(虚词)。

  • 混合模型的表现仅有轻微提升。
  • 原因: 因为这些词就像是一个很小的、封闭的列表。一旦你知道了类别(例如:“这是一个介词”),就没有太多空间让笔记本来帮助你猜测具体是哪一个了。当存在成千上万种可能性(如名词和动词)且需要语境来挑选正确选项时,笔记本的优势才会显现。

5. 核心结论

论文得出结论:混合模型并不只是“在所有方面都更好”。 它们在特定领域更强:

  1. 追踪情节: 追踪谁拥有什么、代码中变量是如何设置的,或者当前的主题是什么。
  2. 预测新想法: 预测故事或代码中的下一个“实词”。

然而,它们在以下方面并不更强:

  1. 简单复制: 重复刚刚说过的话。
  2. 结构闭合: 匹配已经打开的括号或标签。

这为什么对未来很重要

作者建议,如果我们想要构建更聪明的 AI,我们不应该只看“平均分”。相反,我们应该观察 AI 答对了哪些词。

  • 如果一个 AI 在“闭合括号”方面表现糟糕,我们就知道它在处理结构方面遇到了困难。
  • 如果一个 AI 在“追踪谁拥有什么”方面表现糟糕,我们就知道它在处理内部笔记本(状态追踪)方面遇到了困难。

通过逐词拆解结果,研究人员可以看清 AI 究竟是在使用哪种“大脑”(记忆还是笔记本),并针对性地修复其薄弱环节。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →