← 最新论文
💻 computer science

Adaptive Targeted Dynamic Chunking for Tokenization-Free Hierarchical Model

本文介绍了自适应目标动态分块(ATDC),这是一种基于课程学习的机制,能够在无标记分词的分层模型中动态优化压缩比率,从而在 FineWeb-Edu 100B 数据集上实现稳定的训练和具有竞争力的性能。

原作者: Thang Dang, Akira Nakagawa, Kenichi Kobayashi, Koichi Shirahata

发布于 2026-05-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Thang Dang, Akira Nakagawa, Kenichi Kobayashi, Koichi Shirahata

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个机器人阅读并理解一个庞大的图书馆藏书。

旧方法:“子词”翻译器

传统上,我们教机器人阅读时,会先将单词拆解为更小的、预定义的块,称为“令牌”(tokens)。这就像一位只掌握有限一组代码词的翻译员。

  • 问题所在: 如果机器人遇到一个从未见过的单词(比如拼写错误、新的俚语或另一种语言中的名字),这位翻译员就会卡住。它可能会将单词拆解成毫无意义的碎片,或者干脆拒绝阅读。这就像试图阅读一个缺失了某些单词的句子,而翻译员只是猜测其余部分。

新想法:直接读取原始字节

本文的研究人员提出了一种不同的方法:无令牌化模型。他们不是使用翻译员,而是教机器人直接读取原始的“字节”(文本的数字构建块)。

  • 类比: 想象机器人是通过观察屏幕上单个像素来学习阅读,而不是识别完整的字母。这种方式非常灵活,可以轻松处理拼写错误或奇怪的字体,因为它看到的是原始数据。
  • 局限性: 逐像素读取极其缓慢且低效。如果你有一整本小说,机器人必须一个接一个地处理数百万个微小的像素。它会不堪重负。

解决方案:“自适应目标动态分块”(ATDC)

为了解决速度问题,研究人员创建了一个名为ATDC的智能系统。你可以把它想象成一个智能编辑器,位于原始像素和机器人“大脑”之间。

1. “课程学习”方法(训练营)
想象你在教一名学生总结一本书。

  • 第一阶段(初学者): 在开始时,你告诉学生要仔细阅读每一个句子。他们不能跳过任何内容。这有助于他们在不感到困惑的情况下掌握基础知识。
  • 第二阶段(专家): 随着学生变得更聪明、对故事理解更深,你告诉他们:“好吧,现在你可以开始将句子分组为段落了。你可以跳过显而易见的部分,专注于核心思想。”
  • 论文的主张: ATDC 系统正是这样做的。它起初对文本的压缩非常少(几乎阅读所有内容),并随着模型对数据的理解能力增强,逐步教导模型进行更多压缩(将字节分组为更大的块)。

2. “智能编辑器”(动态分块)
ATDC 系统不像强制机器人将文本分组为固定大小的块(例如“总是将 6 个字节分组在一起”)那样运作,而是像一个灵活的编辑器。

  • 类比: 想象阅读这样一个句子:"The quick brown fox jumps."(那只敏捷的棕色狐狸跳了起来。)
    • 固定编辑器可能会奇怪地将其切断:"The qu" | "ick bro" | "wn fox" | " jumps." 这破坏了句子的含义。
    • ATDC 编辑器则关注含义。它看到 "The quick brown fox" 是一个完整的思想,因此将其保持在一起。它只在含义真正改变的地方分割文本。
  • 结果: 模型保持了重要单词的完整性(例如将"checking"作为一个整体单元保留),而不是在中间将其切碎。

他们发现了什么?

研究人员将这种新系统(称为H-Net with ATDC)与旧的基于令牌的模型(如 Llama 3.2)以及其他字节级模型进行了测试。

  1. 更好的理解能力: 即使新系统的“脑细胞”(参数)更少,它在语言学习方面(通过“每字节比特数”衡量)也比基于令牌的模型表现更好。
  2. 卓越的韧性: 当用充满拼写错误、奇怪大小写或随机字符删除的杂乱文本测试这些模型时,新系统依然运行良好。而旧的基于令牌的模型则陷入混乱并失败。
    • 类比: 如果你写了一个带有拼写错误的句子,比如"Helo",旧模型可能不知道"Helo"是什么。而新模型只需看到字母 H-e-l-o,就能理解它是"Hello"。
  3. 更智能的分组: 他们可视化了模型如何分组单词。新系统将像"checking"这样的单词保持在一个块中,而旧的固定系统则将其切碎为"ch"和"ecking"。

总结

这篇论文介绍了一种方法,使“原始数据”读取模型变得更快、更智能。通过使用课程(从简单开始,逐渐变难)和一个智能编辑器(根据含义而非固定规则对文本进行分组),他们创造了一个模型,该模型:

  • 比原始数据模型读取得更快。
  • 比传统模型更能理解杂乱的文本。
  • 通过随着变得更聪明而调整其压缩策略,从而更高效地学习。

作者得出结论,这种方法是将 AI 模型推向更稳健、更灵活、更高效的重要一步,而无需依赖僵化的预定义词汇表。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →