← 最新论文
💬 NLP

Zonkey: A Hierarchical Diffusion Language Model with Differentiable Tokenization and Probabilistic Attention

Zonkey 是一种新型的分层扩散语言模型,它通过利用可微分词器和概率注意力机制,引入了一个从原始字符到文档级表示的全可训练流水线,从而实现端到端优化以及无需固定分词器的自适应且具有语言学意义的文本生成。

原作者: Alon Rozental

发布于 2026-01-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Alon Rozental

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在试图教一个机器人写故事。通常,我们教机器人时会给它们一个固定的词典“块”(比如单词或音节),并告诉它们:“如果你看到空格,就开启一个新单词。”这就像是给机器人一套固定的乐高积木,这些积木只能以一种特定的方式拼合在一起。如果机器人遇到一种新型的积木或者一堆乱七八糟的沙子,它就会感到困惑,因为它的规则不再适用。

这篇论文介绍了一个名为 Zonkey 的新种类的机器人,它不使用固定的词典。相反,它学会了在进行的过程中构建自己的“块”,从单个字母开始,逐步弄清楚单词和句子自然在哪里开始和结束。它通过一种特殊的“扩散”(diffusion)过程来实现这一点,这个过程就像是从一块大理石雕刻出雕像,而大理石在过程中会慢慢变成尘埃,然后再变回石头。

以下是 Zonkey 的工作原理,分为几个简单的部分:

1. “概率注意力”(概率性注意力/软过滤器)

传统的机器人观察一个句子时会说:“这部分存在,那部分不存在。”它们使用硬性的切割。Zonkey 则更像是一个调光开关。它为文本的每一部分分配一个“存在的概率”。

  • 类比: 想象你在看一个起雾的窗户。有些部分很清晰(高概率),而有些部分非常模糊(低概率)。Zonkey 不仅仅是切掉模糊的部分;它学会了如何“看穿”这些雾气。它理解一个单词可以是“基本存在”或“几乎不存在”的,这使得它能够处理任何长度的句子,而不会被固定的大小所困。

2. “段落分割器”(自我学习的审查员)

通常,计算机需要人类告诉它:“在这里加个空格来开始一个新单词。”Zonkey 有一个名为 段落分割器(Segment Splitter) 的特殊模块,它可以自主学习这一点。

  • 类比: 想象一串长长的、未断开的字母,如 thequickbrownfox。普通的计算机需要一本规则手册才知道在哪里切割。Zonkey 则像是一把聪明的剪刀,它能学会:“嘿,我觉得在 'the' 后面切一刀比较好,因为这样能组成一个更好的单词。”它不需要规则手册;它通过发现这样做有助于稍后更好地重建故事,从而自主发现了“单词”和“句子”的概念。

3. “压缩器”与“扩散”(总结者与雕塑家)

一旦 Zonkey 将文本切分成若干块,它会将每个块压缩成一个微小的、紧凑的摘要(一个向量)。

  • 类比: 想象将一整个段落缩减成一颗单一且致密的弹珠。
  • 扩散部分: 为了生成文本,Zonkey 从纯噪声(静态噪声)开始。然后,它通过逐渐“去噪”这个块,将静态噪声转化为清晰的图像(或文本)。
  • 转折点: 大多数扩散模型在处理文本时会遇到困难,因为文本是离散的(你不能拥有“半个”字母)。Zionkey 使用了一种 混合模型 (DDMM)。它就像一位雕塑家,知道何时该采取细小、谨慎的步伐来完善细节,何时该采取大步、果敢的跨越来塑造整体轮廓。这有助于它创建长而连贯的句子,而不至于迷失方向。

4. “缝合器”(女裁缝)

因为 Zonkey 使用重叠的块来处理文本,所以它必须将它们重新组合在一起。

  • 类比: 想象将两块布料缝合在一起。普通的机器人可能只是把它们并排贴在一起,留下明显的、难看的接缝。Zonkey 的 缝合器(Stitcher) 则是一位大师级的女裁缝。它会观察两块布料重叠的部分,并将它们平滑地融合在一起,让你看不出其中一个在哪里结束,另一个在哪里开始。如果其中一块有一个错误(例如把“经典力学”说成了“量子力学”),缝合器会利用重叠的部分在缝合之前轻轻地纠正这个错误。

5. 结果:一个完全可训练的机器人

该论文最大的主张是 Zonkey 中的一切都是“可微的(differentiable)”。

  • 类比: 在普通的机器人中,如果你想改变它切割单词的方式,你必须手动重写代码。在 Zonkey 中,整个系统就像一个单一的、巨大的、有弹性的橡胶圈。如果机器人犯了错,“错误”会一路向后传播,经过缝合器、扩散过程、压缩器,一直传回到分割器。这会告诉分割器:“嘿,你切错地方了;下次试着换个地方切。”

Zonkey 能做什么(根据论文)

  • 从噪声生成文本: 它可以从随机的静态噪声开始,并逐渐将其转化为关于维基百科主题的连贯句子。
  • 填空: 如果你给它一个中间部分缺失的句子(例如,“Bob 是 NBA 中的一名 [空白] 球员”),它可以填补这个空缺(“篮球”),而不需要从左到右地书写整个句子。它可以修复中间部分,同时保持开头和结尾不变。
  • 适应任何数据: 因为它学习自己的“单词”和“句子”,所以它比拥有固定词典的机器人能更好地处理杂乱或异常的文本。

它目前还不能做什么

论文非常诚实地说明了它的局限性。目前,Zonkey 是一个在单台计算机上使用维基百科数据训练的“概念验证”。

  • 它可以编写连贯的句子,但尚未经过测试是否能编写整本书或复杂的文档。
  • 它没有固定的词汇表,因此无法使用衡量其他 AI 模型(如计算“困惑度/perplexity”)的标准测试。
  • 论文并不声称它能进行医疗诊断、法律建议或任何现实世界的应用;它纯粹是迈向一种新型语言模型的研究性步骤。

简而言之,Zonkey 是一个实验,旨在探索我们是否可以构建一种语言模型,让它完全从底层开始,在不需要人类预先定义规则的情况下,自主学习阅读、写作以及理解语言的结构。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →