Can Released LLM Vocabularies Support Token-Level Estimation of Hidden Corpora?
本文介绍了分位数引导密度估计(Quantile-Guided Density Estimation, QGDE),这是一种利用已发布的 BPE 分词器中稳定的 Token ID 比例分布,来准确估计隐藏预训练语料库在 Token 级别和类别级别组成比例的方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你刚刚买了一个全新的、超级智能的机器人厨师。它能写诗、解数学题,甚至还能编写视频游戏。但有一个问题:它用来学习烹饪的食谱被锁在一个保险库里。你可以看到机器人的最终菜肴,你甚至可以看到它可能使用过的食材清单,但你完全不知道实际的食材配比是什么。在人工智能的世界里,这个“食谱”被称为预训练语料库(pretraining corpus),而“食材清单”则是分词器词表(tokenizer vocabulary)。
当公司发布一个新的 AI 模型时,它们通常会分享最终的权重(机器人的大脑)和词表列表(食材字典),但会对其精确的食谱保密。这是一个问题,因为了解 AI “吃了什么”有助于我们理解为什么它擅长某些事情而拙劣于另一些事情。多年来,科学家们一直试图通过观察机器人的行为或它将单词切分成碎片的规则来猜测食谱。但这些猜测往往过于粗略,就像是在说“它可能吃了很多水果”,却不知道是苹果还是香蕉。一个大问题是:我们能否仅通过观察食材字典,就推断出机器人摄入的每一种食材的确切比例?
这篇论文说:“是的,我们可以,方法如下。”研究人员发现,这些字典中单词被切分和编号的方式并非随机,而是遵循一种隐藏且稳定的模式,就像任何语言中单词出现的频率遵循某种可预测的曲线一样。他们意识到,如果你知道一个“已知”食谱(我们可以获取的语料库)的模式,你就可以将该模式迁移到用来猜测“隐藏”食谱上。他们构建了一个名为 QGDE(分位数引导密度估计,Quantile-Guided Density Estimation)的巧妙工具。把它想象成一个侦探,他不只是看一个线索,而是使用一整套“如果……会怎样”的情景(分位数趋势),并根据线索所在区域的拥挤程度(局部密度权重)进行加权。
结果出人意料地精确。在测试中,QGDE 猜测特定单词比例的误差率仅为 3.00%。当他们将这些单词归类为更大的类别,如“网页”、“数学”或“代码”时,误差仍仅为 3.08%。这比以往的方法有了巨大的进步,以前的方法就像是通过观察单朵云来猜测天气。论文还通过一个名为 SmolLM 的真实发布的 AI 模型进行了测试,该模型的实际食谱是已知的。即便在那种情况下,QGDE 依然优于其他方法,证明了食材字典确实掌握着食谱的秘密。然而,作者也谨慎地指出,虽然这在他们的模拟实验和 SmolLM 上表现良好,但我们仍然无法在像 ChatGPT 或 Qwen 这样的巨型模型上测试它,因为它们的完整训练食谱仍然处于锁定状态。但就目前而言,这表明下次当你看到一个 AI 的词表时,你看到的可能正是通往其隐藏饮食的地图。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。