CurveShift: Is Agent Progress Scalar? Separating Level from Shape
本文认为,尽管 AI 向更难任务进阶的大多数表象变化是由于天花板效应和整体能力的提升所致,但在通过 LiveCodeBench 基准测试控制了脚手架混淆因素后发现,在 2024 年 9 月之后发布的模型中,解决最难竞争性编程问题方面出现了明显的、真实的进步。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在观看一个电子游戏的排行榜,玩家们正试图解决难度不断增加的谜题。多年来,故事一直很简单:“玩家变得更强了。”我们用一个单一的数字来衡量这一点,比如平均分或“待破纪录时间”指标。这就像是在说一名跑步者变快了,因为他们的平均比赛时间下降了。但如果这个跑步者并不是在所有方面都变快了呢?如果他只是在那些极其困难的山路赛道上变快了,而在平坦路面上速度却完全没有变化呢?或者更糟,如果这种“变快”只是一种错觉,因为他在简单的路面上已经足够优秀,以至于无法再进步多少,从而使得他在面对困难任务时的进步看起来比实际情况更大?
这正是科学家们试图用人工智能(AI)解决的谜题。我们拥有这些庞大的 AI 模型,它们理应每天都在变得更加聪明。研究人员经常用一个单一的“标量”数字来总结这种进步——一个随时间上升的简单分数。但一个数字会隐藏很多秘密。它无法告诉我们 AI 是在全面变得更聪明,还是仅仅在简单任务上稍有进步,同时突然掌握了最难、最复杂的难题。这篇论文提出了一个至关重要的问题:AI 的进步仅仅是普遍的“等级提升”,还是在任务变得极其困难时,发生了一种特殊的、奇特的转变?
这篇论文的作者们是一群来自顶尖大学的研究人员,他们决定使用一种被称为“曲线偏移”(CurveShift)的巧妙技巧来进行调查。他们想要将“等级”(Level,即 AI 普遍有多聪明)与“形状”(Shape,即其性能随任务难度变化的规律)区分开来。把这想象成一个电子游戏角色。如果你赋予这个角色更多的生命值和力量(一种“等级偏移”),他们能更好地击败各种难度的敌人。但如果你赋予他们一种特殊的“困难模式技能”,这种技能只对 Boss 有效,那么他们会碾压 Boss,但在面对弱小的哥布林时几乎没有任何进步。核心问题在于:我们的 AI 模型仅仅是在整体变强,还是已经解锁了一种秘密的“杀 Boss”技能?
研究人员首先观察了大量以往 AI 测试的数据。他们发现,流行的说法——即 AI 突然在最难的任务上表现得好得多——可能大部分只是一个幻觉。当他们使用一种标准的数学模型(称为 Rasch 模型,该模型假设 AI 只是随着时间推行而变得普遍更聪明)时,该模型实际上能够完美地预测出那种“在困难任务上的进步”。事实证明,当你已经在简单任务上达到了 99% 的完美程度时,你就无法再进步多少了。因此,你在困难任务上看到的任何微小进步在对比之下都会显得巨大。这就像是一种“天花板效应”:你无法比天花板更高,所以你只能在地面上看到进步。论文认为,大多数向更难任务转移的增益只是这种统计学上的伪影,而非某种神奇的新能力。
然而,故事并没有到此结束。在剥离了这种“普遍进步”的幻觉后,研究人员发现了一个微小但真实的残留效应。他们专注于一种特定类型的测试,叫做 LiveCodeBench,这就像是一场竞争性编程比赛,人类编写题目,而 AI 尝试解决它们。至关重要的一点是,这个测试不使用任何“脚手架”或额外工具;它仅仅是原始的 AI 在尝试编写代码。这一点非常重要,因为在其他测试中,新的 AI 模型通常会与更新、更好的工具配套使用,这使得人们无法分辨是 AI 变聪明了,还是工具变好了。LiveCodeBench 隔离了 AI 的原始大脑能力。
他们的发现令人惊讶。即使在考虑了新模型普遍更聪明这一因素后,2024 年 9 月之后发布的模型在解决绝对难题方面的表现,仍高于其在简单和中等问题上的表现所能预期的水平。这并非巨大的飞跃,但确实是一个真实的跳跃。研究人员估计,在他们最保守的假设下,这种“难题增益”(hard-item gain)约为 +0.40 logits(概率的一个特定测量单位)。这意味着最难问题的解决率从大约 18% 跳升到了 25%。
但这里有一个陷阱:这种效应是非常特殊的。它只在 AI 独自工作、没有“支架”或工具团队协助的情况下才会清晰显现。在 AI 智能体使用工具(如浏览网页或逐步运行代码)的测试中,研究人员无法判断这种进步是来自 AI 还是来自工具,因为新的 AI 模型总是伴随着新的工具出现的。这种“难题项”的提升主要由最强的“推理”模型(即那些设计为进行步进式思考的模型)引领,并且似乎对那些需要短时间内深度思考的任务最有帮助,而不是对长期的自主任务。
那么,结论是什么?论文表明,关于 AI 突然变成能够处理任何困难任务的“超智能”的叙事,大多是由我们衡量进步的方式所导致的统计幻觉。AI 确实在普遍变得更聪明,这解释了大部分的炒作。但确实存在着一抹微小、真实的、全新的火花:一种超越单纯“普遍变聪明”的、专门应对最难、最复杂逻辑谜题的能力。这并不是解决一切问题的万能钥匙,但它是这些模型处理最艰难挑战时一种真实且可衡量的思维转变,前提是允许它们在没有额外帮助的情况下工作。作者们谨慎地指出,这只是针对编程谜题的一个特定发现,并不一定意味着 AI 已经准备好独立运营一家公司或管理复杂的长期项目。这是在“困难模式”思考领域迈出的一个微小而真实的进步,隐藏在宏大的普遍进步之下的深处。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。