← 最新论文
🤖 machine learning

The Growing Pains of Frontier Models: When Leaderboards Stop Separating and What to Measure Next

本文提出了一种诊断框架,将前沿模型的性能分解为群体耦合趋势和单次发布残差,以揭示编码与推理能力如何相互作用、因实验室而异并随时间演变,最终在当前排行榜趋于饱和时,为选择下一个最具信息量的基准测试提供战略指南。

原作者: Adil Amin

发布于 2026-05-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Adil Amin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,AI 模型的世界就像一个规模宏大、 stakes 极高的体育联盟。每当有新选手(模型)发布时,媒体和粉丝都会关注两项核心数据:它们的代码能力如何?(好比球员的打击率)以及它们的推理能力如何?(好比他们的战略智商)。

传统上,我们只是单独看待这些数据。“选手 A 的打击率很高!选手 B 的智商很高!”但这篇论文认为,孤立地看待这些数据会错过真正的故事。作者 Adil Amin 提出,最重要的问题不是“谁在获胜?”,而是"在代码能力变强的同时,它们的推理能力会受到怎样的影响?"

以下是用简单类比对论文发现的拆解:

1. “团队化学反应”的发现

该论文分析了来自 10 个不同实验室(如 Google、OpenAI、Anthropic 等)的 34 种不同 AI 模型。他们发现了一个令人惊讶的趋势:代码与推理是最佳拍档。

  • 发现: 当一个模型的代码能力变强时,它的推理能力几乎也会随之变强。它们“协同合作”。
  • 类比: 这就像去健身房的人。通常,如果你举重力量变强了,你的跑步能力也会变好。你不必二选一;提升一项能力有助于另一项。论文将这种现象称为协同耦合(Cooperative Coupling)

2. “指纹”(h-field)

尽管它们互相促进,但每个实验室都有独特的“风格”或“指纹”。有些实验室训练模型成为代码机器,而另一些则专注于将它们打造成超级聪明的推理者。

  • 工具: 作者创建了一个名为h-field的简单分数。你可以将其视为一个“偏差计”。
    • 如果模型正好位于平均线上,它就是“平衡的”。
    • 如果读数为负,该模型就是代码专家(代码能力出色,但相对于趋势,推理能力可能略弱)。
    • 如果读数为,该模型就是推理专家(超级聪明,但可能在代码上投入稍少)。
  • 戏剧性变化: 论文显示,实验室并非一成不变。
    • DeepSeek 曾经是一个推理天才,但随后突然转向成为代码专家。这就像一支曾经以防守闻名的篮球队,突然决定只打进攻。
    • Anthropic 就像一个钟摆。他们猛烈地摆向代码,然后摆回推理,再摆回去。他们正在“振荡”。
    • Google 则是稳健之手。他们持续构建的模型,每一代在推理能力上都略高于平均水平。

3. “挤压”(饱和)

这里是棘手之处:你不可能永远在所有方面都变得更强。

  • 问题: “代码”数据(SWE-bench)正在触及天花板。排名前 5 的代码模型彼此如此接近,以至于很难区分它们。这就像一场比赛,前 5 名选手的完赛时间都在 0.01 秒之内。该数据已失去区分胜负的能力。
  • 解决方案: 当一项数据失效时,“比赛”会转向新的数据。论文预测,虽然“代码”停滞不前,但名为HLE(人类最后考试,一项极难的测试)和指令遵循的新数据正成为区分模型的新方式。
  • 类比: 想象一款电子游戏,其中“速度”属性曾是唯一重要的因素。但现在,所有人都快得让速度不再重要。游戏设计师必须引入一个新的属性,比如“魔法力量”,来决定谁能赢得下一关。

4. “级联”式过渡

论文指出,AI 的发展是以“波浪”或“级联”形式发生的。

  • 第一波: 在较小规模下,代码和推理可能会互相冲突(如果你在某一方面变强,另一方面就会变弱)。
  • 第二波: 随着模型变大(约 300 亿至 720 亿参数),它们突然又开始互相促进。
  • 第三波(当前前沿): 我们现在处于旧数据(代码)已饱和,而新数据(推理/复杂考试)正在接管的阶段。

5. 未来的“战术手册”

作者为所有关注这些模型的人提供了一份三步指南:

  1. 定位: 查看两项分数(代码和推理)。你的模型是专家型还是平衡型?
  2. 诊断: 模型是否突然改变了性格?(它是否从推理转向了代码?)
  3. 轮换: 如果当前的数据过于接近而无法区分(饱和),就停止关注它们,转而测量下一个难题(如 HLE 或指令遵循)。

总结

论文认为,我们需要停止仅仅查看排行榜并问“谁是第一?”,而应该关注技能之间的关系

  • 好消息: 代码和推理通常会互相促进。
  • 坏消息: “代码”数据的增长空间已所剩无几。
  • 接下来是什么: 前沿正在转移。下一个重大突破将不再是关于谁代码写得最好,而是关于谁能处理最复杂、最像人类的推理任务。

作者甚至构建了一个实时仪表盘(数字工具),你可以输入两项分数,立即看到该模型是“代码专家”、“推理专家”,还是仅仅在随大流。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →