Token-Native Storage: Read and Write in your Agent's Language
本文倡导“Token 原生存储”这一范式,即文本直接以 BPE Token ID 的形式而非 UTF-8 字符进行存储,并认为这种方法通过消除重复的转换与重新分词过程,显著降低了存储体积并加速了 AI 智能体的读写操作。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
机器的语言 vs. 人类的语言
想象一下,你正试图教一个超级聪明的机器人阅读一座图书馆。书里是用人类语言编写的,使用的是我们能看见并理解的字母和单词。但机器人并不“看”字母;它看的是数字。对机器人来说,“cat”这个词根本不是一个单词,而是一个特定的代码,就像一个秘密 ID 数字。这就是现代人工智能的工作方式:它通过将文本分解成被称为“token”(标记)的微小块,并为每个块分配一个唯一的数字来处理文本。
几十年来,计算机一直以人类书写的方式存储文本:即作为字母字符串(如 UTF-8)。这对我们来说很棒,但对机器人来说有点笨拙。每当机器人想要阅读图书馆里的一本书时,它都必须把人类的字母翻译成它自己的秘密数字,完成工作,然后再把数字翻译回字母展示给我们看。这个翻译过程既耗时又占空间,就像每次只想读一页书,就得先把整本书翻译成外语一样。随着机器人开始在我们的数字世界中承担更多的阅读和写作任务,这种不断的翻译正在成为一个瓶颈,拖慢了速度并占用了额外的空间。
论文的核心观点:停止翻译,开始说“机器人语”
这篇题为《Token 原生存储》(Token-Native Storage)的论文认为,我们不应该再强迫机器人在每次访问数据库时都去翻译人类文本。相反,作者建议我们应该直接按机器人看到的方式来存储文本:即作为一个 token 数字列表。他们称之为“Token 原生存储”。
可以这样想:目前,我们的数字图书馆就像一座博物馆,每一幅画作都被包裹在人类可读的标签里。为了向机器人展示这幅画,我们必须拆开包装,把标签翻译成机器人代码,让机器人观看,然后再重新包装起来。作者提议建立一种新型博物馆,其中的画作已经以机器人的母语悬挂好了。当机器人走进博物馆时,它可以立即欣赏艺术品,无需任何拆包或翻译。
他们的发现:
研究人员测试了这个想法,并发现将文本存储为 token 数字不仅更快,而且比存储为字母更节省空间。
- 速度: 当机器人从这种新型存储中读取数据时,它完全跳过了翻译步骤。论文测量显示,根据任务的不同,这比旧方法快了大约 10 到 600 倍。这就像是等待翻译员说完一句话与直接听到思想本身之间的区别。
- 空间: 由于 token 数字是小的整数(如 1, 2, 3)而非长串的字母,它们天生更加紧凑。即使不使用任何高级压缩技巧,仅仅将这些数字打包在一起就能节省空间。在处理英文文本时,仅靠这种原始打包方式就比标准文本存储小了 2.25 倍。当他们加入一个简单的压缩技巧(重新排列数字,使最常见的数字最小)时,他们可以进一步缩小数据规模,达到比标准文本小 3.30 倍 的效果。
他们反对什么:
论文明确反对在机器人作为主要阅读者和编写者的系统中,继续沿用存储人类可读字母(UTF-8)的标准。他们指出,保持文本的人类格式会迫使系统在每一次读写操作中都要支付“翻译税”。他们还反对认为我们需要复杂的、沉重的压缩算法来节省空间;他们发现,仅仅通过改变 token 数字的排序方式(按频率而非按发现顺序),就可以实现非常快速的解码,而不需要缓慢且复杂的解压工具。
他们的结论有多可靠?
作者对他们的测量结果非常有信心。他们并非凭空猜测,而是使用了包括英文文章、计算机代码和印地语文本在内的真实世界数据进行了测试。他们将这种新方法与现有的最佳压缩工具(如 zstd 和 gzip)进行了对比,发现他们的 token 原生方法在速度和体积上始终能胜过或匹配这些工具。他们以微秒(百万分之一秒)为单位测量了数据的读写时间,证明了这种速度差异是真实且显著的。
“频率排序”的小技巧
论文中最巧妙的部分之一是关于 AI 实验室应该如何组织其 token 列表的建议。目前,token 数字的分配在某种程度上是随机的,取决于 AI 在训练过程中发现它们的先后顺序。作者发现,如果你简单地重新排列这些数字,让最常见的词获得最小的数字(如 1, 2, 3),而让罕见的词获得较大的数字,你就能更好地压缩数据。
他们称之为 “+freq” 方法。这就像整理衣柜:如果你把最常穿的衣服放在最容易拿到的架子上(较小的数字),就能节省时间和空间。通过这样做,他们可以获得几乎所有复杂压缩带来的好处,同时解码速度却快了 7 倍。他们要求 AI 公司以这种“频率顺序”发布其 token 列表,以便所有人都能从这个免费的速度提升中受益。
障碍:说同一种语言
论文承认存在一个巨大的挑战。要让这个系统完美运行,系统中的每个机器人都需要说同一种“token 语言”(使用相同的词汇表)。目前,不同的 AI 模型通常使用不同的字典。如果一个机器人使用的字典里 “cat” 是数字 500,而另一个机器人使用的字典里 “cat” 是数字 12,它们就无法轻松共享存储。
作者建议,解决方案是标准化,类似于我们现在都同意使用相同的字母表(ASCII)或相同的字符编码(UTF-8)来处理人类文本。如果 AI 界能够达成共识,使用一个共享的“Token 字母表”,那么这种 token 原生存储就可以成为新的标准,从而为运行它的机器人使我们的数字基础设施变得更快、更便宜。
简而言之,论文建议,随着机器人接管越来越多的数字阅读和写作任务,我们应该停止以人类格式存储它们的数据,而是开始以它们天生就能阅读的格式进行存储。这只是改变文件保存方式的一个小变动,但在未来,它可能会节省大量的成本和时间。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。