← 最新论文
💬 NLP

Tokenisation via Convex Relaxations

本文介绍了 ConvexTok,这是一种新颖的标记化算法,它将词汇构建表述为可通过凸优化求解的线性规划问题,从而在内在指标和语言模型效率方面优于传统的贪婪方法,同时提供了其接近最优解的认证边界。

原作者: Jan Tempus, Philip Whittington, Craig W. Schmidt, Dennis Komm, Tiago Pimentel

发布于 2026-05-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Jan Tempus, Philip Whittington, Craig W. Schmidt, Dennis Komm, Tiago Pimentel

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用通俗语言和生动类比对论文《通过凸松弛进行分词》的解释。

宏观图景:打包行李箱

想象一下,你正试图将一座庞大的图书馆塞进一个行李箱(计算机内存)里,以便寄给朋友。为了高效地做到这一点,你需要一个分词器

在人工智能领域,分词器就像一套定制的邮票。分词器不是发送每本书的每一个字母(这既慢又占空间),而是将字母组合成“块”或“词元”(token,如完整的单词或常见短语),然后发送这些组合。其目标是在确保到达后能完美还原书籍的同时,尽可能让行李箱变小(高压缩率)。

问题所在:“贪婪”的打包者

目前,大多数 AI 模型使用一种称为BPE(字节对编码)的方法。可以将 BPE 想象成一个贪婪的打包者

  • 工作原理:打包者查看书籍,找出两个最常连续出现的字母(如"t"和"h"),将它们粘合成一张新邮票("th"),然后重复这个过程。
  • 缺陷:因为打包者只关注当下的下一步(局部最优),他们可能会粘合两个看似此刻有帮助的字母,但最终却形成了一个奇怪且低效的形状,导致无法很好地放入行李箱。他们做出了一系列看似不错的小决定,却导致了糟糕的整体结果。他们从未退后一步去审视“全局”。

解决方案:“建筑师”方法(ConvexTok)

这篇论文的作者 Jan Tempus 及其同事决定停止使用贪婪打包者。相反,他们建造了一位建筑师

他们意识到,找到完美打包行李箱的方法是一个数学难题,计算机通常会放弃解决它(因为它是"NP 难”问题)。然而,他们发现了一个巧妙的技巧:凸松弛

  • 类比:想象试图在山脉中找到最低点来建造房屋。贪婪的打包者只是沿着下坡走,直到撞上一个小小的山谷就停下来,以为那就是底部。
  • 建筑师的技巧:作者将崎岖的山脉平滑成一个完美的、光滑的碗状(即“凸”形状)。在这个光滑的碗中,从数学上很容易找到绝对的最低点。
  • 结果:他们使用一种称为**线性规划(LP)**的工具解决了这个平滑且简单的版本问题。这为他们提供了完美打包的“蓝图”。

棘手之处:从蓝图到现实

他们从光滑碗中获得的蓝图存在一个问题:它建议使用“半张邮票”。例如,它可能会说:“使用 0.7 张'th'邮票和 0.3 张'ing'邮票。”实际上你无法打印半张邮票。

为了解决这个问题,他们发明了三种将这些数字四舍五入为整张邮票的方法(例如将 0.7 向上取整为 1):

  1. 确定性(Det):直接选取得分最高的前 KK 张邮票。
  2. 有偏(Bias):选取短小且高效的邮票,即使它们的得分略低。
  3. 整数(Int):只选取蓝图有 99% 把握的邮票。

他们的发现(结果)

团队将新的ConvexTok方法与标准的贪婪 BPE 方法进行了测试。结果如下:

  1. 更好的打包:ConvexTok 行李箱始终比 BPE 行李箱更小(压缩率更好)。这意味着 AI 模型可以使用更少的“词元”来读取相同数量的文本。
  2. “近乎完美”的保证:他们数学中最酷的一点是提供了一个“下界”。这就像一张证书,上面写着:“我们知道完美的行李箱尺寸至少有这么小。”他们发现,他们的 ConvexTok 行李箱与那个完美的理论尺寸相差仅在**1%**以内。换句话说,它们几乎达到了数学上可能的最佳水平。
  3. AI 性能:当他们使用这些新行李箱训练 AI 模型时:
    • 模型在理解文本方面略有提升(通过“每字节比特数”衡量)。
    • 在复杂的推理任务(如回答逻辑谜题)上,结果喜忧参半。有时 ConvexTok 更好,有时 BPE 更好,但 ConvexTok 从未显著更差。
  4. 稳定性:贪婪的 BPE 方法非常稳定;如果你给它稍有不同的书籍,它会生成相同的邮票。而新的 ConvexTok 方法对所见书籍的细微差别更为敏感,这意味着如果改变训练数据,生成的邮票可能会略有不同。

总结

这篇论文认为,我们长期以来一直使用“贪婪”的方法来教导 AI 如何阅读。通过使用高级数学(凸优化)一次性审视整个问题,他们创造了一种名为ConvexTok的新分词器。

这就像是从一个盲目粘合最常见字母的人,转变为一位一次性设计整个行李箱布局的建筑师。其结果是一种更高效的文本压缩方式,让我们更接近这些 AI“行李箱”可以缩小的理论极限。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →