Mind the Cap: Output-Budget Regimes Change the Measured Multilingual Reasoning Gap
本文表明,固定的输出标记上限充当了隐藏的实验变量,人为地夸大了或反转了测得的多语言推理差距,并指出评估必须报告在不同输出预算范围内的准确率,而非仅在单一上限下进行,从而将真实的推理缺陷与截断伪影区分开来。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图测量两名不同跑步者的比赛完成速度。其中一名跑步者所使用的语言单词短促有力,而另一名则使用长而华丽的词汇。如果你告诉这两名跑步者:“你们必须在正好走完100步时停止跑步。”你不仅仅是在测试他们的速度;你还在秘密测试他们的语言需要多少步才能表达同样的意思。那位使用长单词的跑步者可能会在句子中途被截断,这并不是因为他跑得慢,而是因为终点线对于他特定的步幅设置得太早了。这就是现代人工智能的核心谜题:当我们要求人工智能模型用不同的语言解决数学问题时,我们经常发现它们在母语中的表现甚至不如先将问题翻译成英语后再进行解答的表现。科学家们称之为“多语言推理差距”(multilingual reasoning gap)。但这种差距究竟是表明人工智能在母语方面真的变“笨”了,还是仅仅因为我们设定游戏规则的方式所导致的测量误差?
这篇题为《注意上限》(Mind the Cap)的论文研究了那个著名的差距是否实际上是测量尺子的一个陷阱。研究人员为两个流行的人工智能模型(Qwen 和 Lata)设计了一场比赛,让他们用德语、泰语和斯瓦希里语解决数学问题。他们比较了两种策略:让人工智能用母语思考并回答(NATIVE),以及将问题翻译成英语,用英语思考,然后再用母语回答(TRANSLATE-ACT)。转折点在于,他们不仅观察最终得分,还观察了比赛如何一步步进行,并改变了“Token上限”——即人工智能被允许用来编写答案的最大数字构建块(token)数量。
作者发现,这个“差距”并不是一个固定的事实;它是一个完全取决于“绳索”勒得有多紧的移动目标。当上限非常紧(例如128个token)时,母语往往表现得很糟糕,这并不是因为人工智能无法进行推理,而是因为它根本没有足够的空间来完成它的句子。然而,随着他们放宽上限,差距缩小了,有时甚至消失了。事实上,在1,024个token的特定预算下,其中一个模型(Qwen)的差距几乎完全消失了,这表明人工智能并非缺乏推理能力;它只是需要更多的呼吸空间。
研究还发现了一些令人惊讶的事情:在人工智能开始之前告诉它限制是多少,可以改变它的行为。当他们告诉泰语原生模型:“你只有128个token”时,它的表现实际上比告诉它“你有2,048个token”时更好,尽管硬性限制在两种情况下是相同的。看起来,当人工智能认为自己在赶时间时,它会尝试变得更加高效。
最终,这篇论文认为,“推理差距”往往只是一个“预算伪影”(budget artifact)。如果你给人工智能足够的空间来完成它的想法,母语通常会追上来。研究人员通过预先冻结实验并运行数千个新的、独立的测试来验证这一点。他们发现,虽然在紧凑预算下差距是真实存在的,但一旦允许人工智能写出完整的答案,差距往往会消失。他们还测试了“词汇扩展”——给人工智能提供新的、更短的母语单词——但发现这只有在预算仍然紧凑到足以截断人工智能句子的程度时才会有帮助。一旦人工智能有了足够的空间,额外的单词就不再起作用了。
核心结论是,我们不应该把token限制视为一个背景设置。它是一个会改变结果的变量。如果我们想知道人工智能是否真的能在一种语言中进行推理,我们不能只看一个带有单一限制的单一分数。我们必须观察整场比赛,从发令枪响到冲过终点线,并意识到有时候,人工智能并不是在思考失败,它只是在完成失败。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。