Rate-Utility Frontiers for Language Encodings: Comparing Tokens, Bytes, and Pixels Under Controlled Linguistic Content
本文确立了没有任何单一的语言编码方式(标记、字节或像素)具有普遍优势;相反,最优选择取决于由特定任务、语言混合比例和容量机制所决定的率-效用权衡,这一点通过在受控条件下比较它们在形式特征保持、跨语言对齐以及主题分类方面的表现得到了揭示。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图给你的朋友发送一条秘密信息,但你有一个非常严格的规则:你的信息必须装进一个微小的魔法盒子里。这个盒子的尺寸是固定的,一旦信息进入其中,就不能再增加任何空间。现在,想象你有三种不同的方式来书写这条信息。你可以用一种把常用词缩短为单个字母的秘密代码来书写(比如用“u”代表“you”)。你可以逐个字母地写出来,使用字母表中的每一个字符。或者,你可以把单词画成纸上的图画,然后发送这张画作。
这就是语言模型(Language Models)的世界,即驱动聊天机器人和翻译工具的超智能计算机程序。在这些计算机理解一个句子之前,它们必须将文本转化为一种它们可以处理的格式,这有点像将人类语言翻译成计算机语言。通常,这些计算机使用“秘密代码”法(称为标记/tokens),但一些研究人员正在尝试“逐个字母”法(字节/bytes)甚至“图片”法(像素/pixels)。一个大问题是科学家们一直在问的:“哪种书写方式才是最好的?”但问题在于,如果你不小心进行比较,你可能会是在拿苹果和橘子做比较。一种语言中简短的句子在一种代码中可能会占用巨大的空间,但在另一种代码中却占用很少的空间。这篇论文就像是一个裁判,确保每个人都遵循完全相同的规则,以看看到底谁才是真正的赢家。
研究人员,来自哥本哈根大学的 Ingo Ziegler、Martin Krebs 和 Desmond Elliott,决定用一个非常公平的实验来解决这场争论。他们采用了完全相同的句子,涵盖了 13 种不同的语言和 5 种不同的书写系统(脚本),并尝试用所有三种方法(标记、字节和像素)将它们挤进这个微小的魔法盒子里。他们不仅仅观察哪种方法最短,还观察了在挤压过程中保留了多少信息。他们测试了三个特定的目标:计算机能否记住句子的确切样子?它能否将英语句子与其印地语翻译进行匹配?以及它能否猜出句子的主题(例如“体育”或“健康”)?
以下是他们的发现,而且这有点令人惊讶:并没有单一的赢家。 这完全取决于你在做什么以及挤压得有多紧。
如果你的目标是记住文本的确切外观和感觉——比如如果你以后需要完美地重现这个句子——那么像素(图片)是冠军。它们比任何其他方式都能更好地保留表面细节,尤其是在盒子尺寸适中时。这就像发送一张手写便条的照片;你可以完美地看到那些环绕和曲线。
如果你的目标是翻译——将一个语言的句子与其在另一种语言中的双胞胎进行匹配——那么字节(原始字母)夺得了桂冠。它们在保持不同语言之间的意义对齐方面最可靠,特别是当这些语言使用相似的字母表时。这仿佛字母本身持有一张秘密地图,帮助计算机找到正确的翻译,即使在盒子非常小时也是如此。
然而,如果你的目标是理解主题——弄清楚一个句子是在讲“烹饪”还是“政治”——那么标记(秘密代码)是明显的赢主。它们最擅长保持核心意义完整,即使在盒子非常小的时候也是如此。这就像是一个删减了所有废话并只保留主要思想的摘要。
论文还表明,书写句子的“成本”会根据语言的不同而变化。例如,在英语中,秘密代码(标记)通常是最短的。但在中文里,秘密代码占用的空间实际上比原始字母或图片还要多!这意味着,如果你只是为所有语言选择一种方法,你可能会无意中给某些语言一个更大的盒子,这并不公平。
最后,作者建议我们不应该仅仅选择一种方法并永远坚持下去。相反,我们应该根据任务本身来选择我们的“书写风格”。如果你正在构建一个读取图像文本的工具,请使用像素。如果你正在构建一个翻译器,请仔细观察字节。如果你正在构建一个需要理解主题的聊天机器人,标记仍然是王者。最好的选择不在于哪种方法最短,而在于哪种方法能为你所关心的特定任务保留最多的有用信息。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。