Are you going to finish that? A Practical Study of the Partial Token Problem
本文研究了“部分标记问题”(partial token problem),证明了在现实提示词以标记中途结束的情况下——特别是在没有空格的语言、复合语言以及代码中——会导致大型语言模型出现严重的概率失真,且这种现象并不会随规模扩大而改善,同时验证了精确推理时解决方案的有效性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在玩一个“完成句子”的游戏,对手是一个非常聪明但有点刻板的机器人。你输入一个句子,然后机器人应该猜出紧接着的下一个词。
通常情况下,这运作得非常完美。但这一论文发现了一个特定的故障,机器人之所以感到困惑,并不是因为它不知道这些词,而是因为它是如何计数的。
这里是问题的拆解、证据以及解决方法,使用了简单的类比。
1. 核心问题:“半块砖”故障
把机器人的大脑想象成一个图书馆,这里的每一本书都是由砖块(token,即词元)组成的。
- 用户的视角: 你看到的是单词(比如 "apple" 或 "is")。
- 机器人的视角: 它看到的是砖块。有时,一块砖覆盖一个完整的单词。有时,一块砖覆盖两个单词。有时,一块砖是被切成两半的。
部分词元问题(The Partial Token Problem) 发生在当你正好在其中一块砖的中间停止输入时。
- 类比: 想象机器人预期单词 "processing" 是一个单一、完整的砖块。
- 错误: 你输入了 "process" 就停下了。
- 困惑: 机器人看到了 "process" 并且心想:“等等,我知道 'process' 这个砖块。但我同时也知道 'processing' 这个砖块。如果我接下来只加上 'ing',我就违反了自己的规则,因为 'processing' 本该是一个不可分割的完整砖块!”
因为机器人接受的训练是只看完整的砖块,所以它会对按照你的预期去完成这个单词感到恐惧。它会想:“如果你在 'process' 这里停下了,那你可能并不想在后面接 'ing';你可能想要完全不同的东西。”
2. 这会发生在哪些地方?(三个陷阱)
研究发现,这不仅仅是英语中罕见的故障。在以下三种“单词”与“砖块”无法对齐的情况下,这种情况经常发生:
- 没有空格的语言(如中文): 在英语中,空格告诉机器人单词在哪里结束。在中文里,没有空格。机器人必须猜测一个词在哪里结束,下一个词在哪里开始。
- 例子: 短语 "is a" 可能是一个单一的砖块。如果你输入 "is" 就停下了,你就把这个砖块切成了一半。机器人会陷入恐慌。
- 通过拼接单词的语言(如德语): 德语经常将两个单词组合成一个巨大的单词(比如用 "Eigelb" 表示蛋黄)。
- 例子: 如果机器人看到了 "Ei"(蛋)并在那里停下,但机器人认为 "Eigelb" 是一个砖块,它会对接下来该出现什么感到困惑。
- 计算机代码: 代码使用像
()或:这样的符号。通常,一整块符号就是一个砖块。- 例子: 如果你输入
def main()然后停下,但机器人认为():是一个单一的砖块,它就会卡在尝试猜测下一个符号上。
- 例子: 如果你输入
3. 情况有多糟?(“无声崩溃”)
研究人员用许多不同的机器人(AI 模型)进行了测试。结果令人震惊:
- 概率下降: 当机器人被迫在“半块砖”之后进行猜测时,它对自己应该给出正确答案的信心下降了 1,000 到 10,000 倍。这就像一个学生明明知道答案,但因为太害怕老师的评分规则而拒绝写下答案。
- 准确率下降: 机器人60% 到 95% 的时间无法给出正确的答案。它可能会跳过一个字母、增加一个奇怪的空格,或者给出一个完全错误的词。
- 规模并不能解决问题: 你可能会想:“如果我们让机器人变得更聪明(更大的模型),它就会修复这个问题。” 不。 论文发现,更大的、更聪明的机器人实际上在这方面表现得更差。它们如此专注于自己特定的“砖块”规则,以至于在不打破规则这件事上变得更加固执。
4. 解决方案:如何修复故障
研究人员测试了两种在“思考”阶段(推理阶段)修复此问题的方法:
方法 A:“词元修复”(Token Healing,即“撤退”法):
- 运作方式: 如果你输入 "process" 导致机器人困惑,这种方法会告诉机器人:“好吧,忘掉最后一部分。假装你只看到了 'pro'。”
- 结果: 它有时会有帮助,但效果好坏参半。这就像试图通过切掉花瓶的顶端来修复破碎的花瓶;它可能凑合能用,但并不完美。
方法 B:"ByteSampler"(地图法):
- 运作方式: 它不再仅仅是进行猜测,而是绘制一张包含所有可能的阅读方式的地图。它找到一条与你的文本完全匹配的路径,然后从那里继续。
- 结果: 它完美地解决了问题。 在测试中,即使提示词是在砖块中间被切断的,这种方法也能让机器人100% 地给出正确答案。这就像拥有一个 GPS,在你走错路时能立即重新计算路线,确保你依然能到达目的地。
总结
论文得出结论:虽然 AI 模型在理解语言方面非常出色,但它们也是它们被教导的特定“计数方式”(分词/Tokenization)的奴隶。如果用户停止输入的方式不符合机器人的内部计数规则,机器人的信心就会崩溃。
好消息是?我们不需要重建机器人。我们只需要在它们思考时使用一个更聪明的“GPS”(比如 ByteSampler),以确保它们不会被自己的计数规则绊倒。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。