Predictable Emergence: An Empirical Analysis of Whether Sharp Capability Jumps Follow from Smooth Per-Token Scaling Laws
本文表明,在多位数整数加法中观察到的精确匹配准确率(exact-match accuracy)中剧烈的“涌现”跳变并非模型能力的真实不连续性,而是由单标记准确率(per-token accuracy)遵循幂律规律的平滑提升,结合要求所有数字均正确的非线性效应所共同导致的、完全可预测的人为产物。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在观看一场魔术表演,魔术师从帽子里变出兔子的技术,随着帽子变得越来越大而不断进步。多年来,科学家们注意到,当我们把 AI 大脑(称为“Transformer”)做大并喂给它们更多数据时,它们会以一种非常可预测且平滑的方式变得更聪明。这就像汽车发动机一样,每增加一个气缸,动力就会稍微增强一点;这种进步是稳步进行的,并遵循一个清晰的数学规则。但随后,人们开始注意到一件怪事:有时,这些 AI 模型似乎会在一夜之间突然“觉醒”,并学会一项全新的技能。前一天它们还不会做简单的数学题,到了第二天,仅仅因为体积增加了一点点,它们就能完美地解决复杂问题。这种突然的跳跃被称为“涌现”(emergence),这令人感到恐惧,因为如果技能是凭空出现的,我们就无法预测 AI 何时会突然变得危险或极其聪明。
核心问题在于:这些技能是真的凭空出现的,还是仅仅由我们衡量它们的方式所造成的幻觉?想象一下你在给学生评分。如果你用“是否每一道题都答对了?”(即及格/不及格的评分标准)来评分,他们看起来可能在很长一段时间内都表现得很差,然后突然及格。但如果你看“平均答对了几道题?”(即平滑的分数),你会发现他们其实一直在缓慢进步。这篇论文在问:这种“突然跳跃”是真的,还是仅仅是我们使用的测试方法所制造的诡计?
伟大的数学魔术
一位名叫亚历山大·梅明(Alexander Memming)的研究员决定利用一个非常具体且受控的实验来调查这个谜团。他并没有训练任何新的 AI 模型;相反,他使用了许多现有的、公开的 AI 模型(称为 Pythia 和 OPT),这些模型的规模从非常小到相当大。他要求它们完成一个简单的任务:将两个大数字相加。陷阱在于,他可以精确控制答案需要有多长(从 1 位数到 6 位数)。
当他使用“平滑”的衡量方式(检查它猜对每个单独数字的频率)来观察 AI 的表现时,结果是极其枯燥且可预测的。随着模型变大,它们猜对每个数字的概率会略微提高,遵循一条平滑、温和的曲线。这里没有任何突然的跳跃。这就像看着一名跑者在一次又一次的里程中慢慢变快。
然而,当他切换到“尖锐”的衡量方式(检查整个答案是否完美)时,故事发生了变化。对于短答案,AI 表现尚可。但对于长答案,AI 看起来在很长一段时间内都表现得一塌糊涂,然后——砰的一声——它突然开始获得完美的得分。这看起来完全就是大家都在讨论的著名的“涌现”跳跃。
秘密成分:一个简单的公式
梅明意识到,这种“跳跃”并不是魔术;它纯粹是数学。他建立了一个简单的模型来解释这个现象。想象一下你正在尝试猜一个 6 位数的密码。如果你猜对任何单个数字的概率是 90%,这听起来很棒。但如果你需要猜对所有六个数字才能获胜,那么你的胜算就会降至大约 53%。如果你的单位数字猜对概率只有 50%,那么你猜对整个密码的概率几乎为零。
论文显示,随着 AI 模型变大,它们的“单数字”准确率会缓慢爬升,从 50% 增加到 90%。因为测试要求必须拿到每一个数字都正确,所以最终得分在很长一段时间内都接近于零,直到单数字准确率达到足够高时,分数才会迅速飙升到 100%。并不是 AI 突然学会了某种超能力,而是“全或无”的测试方式让缓慢、稳定的进步看起来像是突然的爆发。
预测未来
最酷的部分是,梅明证明了你可以在这些“跳跃”发生之前预测它们。他拿出了最小的 AI 模型(这些模型当时仍无法完成长数学题),并测量了它们在单数字上的缓慢、平滑的进步。通过使用一个考虑了答案包含多少位数的简单公式,他能够精确预测较大的模型何时会突然开始通过测试。他的预测极其准确,预测的“跳跃点”误差极小。
他还检查了是否存在任何数学无法解释的隐藏“超能力”行为。他寻找了 AI 在跳跃瞬间是否在做某些特别之事的迹象,但没有发现任何异常。这种“涌现”完全可以用小部分的平滑进步累积成大结果来解释。
结论
那么,这意味着什么?对于大数字相加这一特定任务,这篇论文表明,AI 能力中那些可怕的“突然跳跃”很可能是由我们测试它们的方式所造成的幻觉。AI 并不是突然打开了一盏灯;它只是在缓慢地调高一个调光开关,而我们的“及格/不及格”测试让它看起来像是灯突然亮了。
这并不意味着 AI 永远不会有突然的惊喜,但这给了我们一个强大的工具:如果我们能测量小部分的平滑、稳定的进展,我们就能预测那些大规模、令人恐惧的跳跃何时会发生。它将一个谜团变成了一个数学问题,表明至少目前来看,AI 的未来比我们想象的要更具可预测性。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。