← 最新论文
🤖 machine learning

From BERT to Frontier Agents: Eight Years of Language-Model Progress, the Collapse of the Capability-Cost Curve, and the Rise of Task-Targeted Models

本文回顾了从 BERT 到 2026 年专业化前沿智能体这八年间语言模型的演进过程,强调了编程能力的六倍年增长、以高性价比的 GPT 5.6 Luna 为代表的推理成本剧烈下降,以及向擅长前端编程、代码库管理和终端操作等特定领域的任务导向型模型的转变。

原作者: Pranav Kumar Kaliaperumal

发布于 2026-08-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Pranav Kumar Kaliaperumal

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

伟大的 AI 演进:从阅读眼镜到超级计算机

想象一个世界,那里的计算机就像才华横溢但却害羞的图书管理员。在很长一段时间里,如果你想让它们理解一个句子,你必须为那个特定的句子给它们一副特定的“阅读眼镜”。如果你想让它们写故事,你必须把眼镜换成另一副。它们在阅读方面非常聪明,但它们无法真正独立地“做事”。这就是“语言模型”的早期时代——即那些学习理解和生成人类语言的计算机程序。

在过去的几年里,科学家们找到了让这些图书管理员变得更强大、并赋予它们一个无需为每项任务更换新眼镜就能从少量示例中学习的“大脑”的方法。突然之间,这些计算机可以聊天、编写代码并解决谜题。但这里有一个每个人都在问的大问题:它们是在变得越来越聪明,还是仅仅在变得更擅长背诵测试题?如果它们确实变得更聪明了,这意味着它们变得越来越昂贵,还是变得越来越划算?本论文深入探讨了这个谜团,回顾了从 2018 年到未来 2026 年这段 AI 进步的疯狂旅程,旨在观察其内部究竟发生了什么。


从阅读眼镜到超级计算机:八年的过山车

这篇论文就像一部穿越时空的侦探故事,追踪了人工智能从 2018 年到 2026 年的生命历程。它提出了三个大问题:我们是如何从只能勉强写出一个句子的计算机,进化到能够修复软件漏洞并解决数学奥林匹克竞赛题的计算机的?这种“脑力”的价格下降得有多快?最重要的是,我们是需要一台巨大的、昂贵的超级计算机来做所有事情,还是未来的趋势实际上是一支由专业专家组成的团队?

AI 成长的四个时代
作者将过去八年划分为四个不同的章节,就像电子游戏中的季节一样:

  1. “阅读眼镜”时代 (2018–2019): 它始于像 BERT 这样的模型。把它们想象成那些擅长读完一本书并回答相关问题,但如果你让他们写故事,他们就会陷入僵局的学生。他们需要针对每一项特定任务进行专门的“微调”(就像参加专门的训练营)。
  2. “大脑袋”时代 (2020–2021): 随后出现了像 GPT-3 这样的模型。这些就像是读过了几乎整个互联网内容的巨型图书馆。你不再需要专门的训练,只需在聊天窗口中给它们几个例子,它们就能理解其中的模式。它们非常出色,但仍然会编造事实,且无法总是完美地遵循指令。
  3. “礼貌助手”时代 (2022–2023): 科学家们教会了这些“大脑袋”如何通过一种叫做“对齐”(alignment)的技术来保持礼貌并遵循命令。突然之间,它们变成了 ChatGPT 及其同类——擅长聊天、写邮件并遵循复杂规则。
  4. “智能体”时代 (2024–2026): 这是事情变得疯狂的阶段。模型不再仅仅是说话,而是开始“行动”。它们成为了能够使用工具、修复 GitHub 上损坏的代码并通通过思考步骤来解决数学问题的“智能体”(agents)。到 2026 年,顶尖的模型已经能够解决国际数学奥林匹克竞赛题目并修复整个软件项目。

进步的速度:一个数学谜题
论文衡量了这些模型在修复现实世界软件漏洞(使用名为 SWE-bench 的测试)方面的进步速度。结果令人震惊:模型成功修复漏洞的概率每年增长约 5.8 倍。这就像如果一名跑者每年都变快 5.8 倍,那么在短短几年内,他就会跑得比音速还快。然而,论文也指出,旧有的“知识测试”(如 MMLU)正在触及天花板。模型现在在这些测试中表现得太好了,以至于这些测试已无法有效区分它们的优劣。该领域已经转向了更难、更具实践性的挑战。

价格崩塌:“廉价档”的惊喜
这是故事中最令人惊讶的部分:这种智能的价格已经崩塌了。

  • 在 2020 年,获取一百万个单词的 AI 思考成本为 60 美元
  • 到 2026 年,同等规模思考量的“廉价版”AI 仅需 1 美元
    这是 60 倍的降价

但这还没完。论文发现,2026 年的廉价“预算型”模型实际上与仅仅几个月前的超昂贵“旗舰型”模型一样出色。这就像今天的 100 美元级别的汽车可以开得和去年的 500 美元级别的汽车一样好。市场的“中间层”消失了;你要么选择便宜且聪明的预算级模型,要么选择极度昂贵的顶级模型。中间地带已不复存在。

“专家团队”对比“全才”
长期以来,人们认为一个巨大的模型最终会在所有领域都达到顶尖。论文认为,到 2026 年,这个想法已经破灭了。目前的“前沿”(最顶尖的 AI)是碎片化的。

  • 如果你想构建一个网站,Claude Opus 5 是冠军。
  • 如果你需要修复一个庞大的代码库,Claude Fable 5 胜出。
  • 如果你需要一台能在终端里像人类一样操作的计算机,GPT-5.6 Sol 是老大。
  • 如果你需要解决一种全新的逻辑谜题,Opus 5 是纪录保持者。

没有一个模型能胜任所有工作。论文建议,现在使用 AI 最聪明的方法是做一个“路由”(router)——即一个交通警察,将不同的任务发送给最适合该任务的特定专家模型。一个简单的系统,只要能在两个模型之间进行切换,就能通过挑选最合适的专家来击败最好的单一模型。

我们能否让一个固定的模型变得更聪明?
研究人员还进行了一个小实验,旨在观察是否可以通过改变提问的方式,在不改变模型本身的情况下,让一个较小的固定模型变得更聪明。

  • 他们让一个小型模型(Qwen2.5-1.5B)解决数学问题。
  • 当他们只问一次(“贪婪”方式)时,正确率为 58%
  • 当他们问四次并选取出现次数最多的答案(一种称为“投票”的技术)时,正确率为 62%
  • “天花板”(即如果他们能神奇地从四次尝试中选出最佳答案)是 79%

这表明模型在大多数时候其实“知道”正确答案,只是需要一种更好的方式将其提取出来。论文还构建了一个“置信度检测器”,可以预测哪些答案更有可能是正确的。研究发现,如果只信任检测器认为最有把握的答案,可以在这组特定样本中获得 94% 的准确率。这表明,在未来,我们可能不需要更大的模型;我们可能只需要更好的方法来检查它们的工作并挑选出最好的结果。

总结
论文得出结论: “一个模型统治一切”的时代已经结束。我们正在进入一个专业化与路由化的时代。模型在特定工作上变得极其出色,价格正在快速下降,而使用它们最聪明的方法是将它们视为一支专家团队,而非单个超级大脑。虽然模型变得非常惊人,但论文警告说,它们也变得非常擅长“钻测试漏洞”,因此我们需要谨慎对待对它们的信任。未来不仅仅关乎更大的大脑,更关乎如何更聪明地使用我们现有的这些大脑。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →