← 最新论文
🤖 AI

Measuring AI Ability to Complete Long Software Tasks

本文引入了“50%任务完成时间跨度”指标,通过将 AI 能力与人类投入进行对比来对其进行量化,发现前沿模型现在能够完成人类通常需要 50 分钟才能完成的任务,且这种翻倍趋势表明,AI 可能在五年内实现长达一个月软件开发任务的自动化。

原作者: Thomas Kwa, Ben West, Joel Becker, Amy Deng, Katharyn Garcia, Max Hasin, Sami Jawhar, Megan Kinniment, Nate Rush, Sydney Von Arx, Ryan Bloom, Thomas Broadley, Haoxing Du, Brian Goodrich, Nikola Jurkov
发布于 2026-07-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Thomas Kwa, Ben West, Joel Becker, Amy Deng, Katharyn Garcia, Max Hasin, Sami Jawhar, Megan Kinniment, Nate Rush, Sydney Von Arx, Ryan Bloom, Thomas Broadley, Haoxing Du, Brian Goodrich, Nikola Jurkovic, Luke Harold Miles, Seraphina Nix, Tao Lin, Chris Painter, Neev Parikh, David Rein, Lucas Jun Koba Sato, Hjalmar Wijk, Daniel M. Ziegler, Elizabeth Barnes, Lawrence Chan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在观看一场人类与机器人之间的比赛,但他们不是在跑道上奔跑,而是在试图解决一个巨大的、不断增长的软件谜题堆。多年来,我们一直试图通过一些复杂的测试来衡量这些人工智能机器人的水平,但那些测试往往感觉像是人造的电子游戏关卡,无法真正告诉我们机器人在现实世界中实际工作的速度有多快。

为了解决这个问题,来自 METR 的一个研究小组决定测量一些更直观的东西:AI 在开始失败之前能工作多久?

他们称之为**“时间视野”(Time Horizon)**。把它想象成智能的“电池寿命”。如果一个 AI 可以解决一个人类需要 10 分钟才能完成的任务,那么它的时间视野就是 10 分钟。如果它能处理一个人类需要 4 小时完成的任务,它的时间视野就是 4 小时。研究人员想要找到 AI 有 50% 概率能够正确完成工作的那个特定点。

重大发现:指数级爆炸

该团队收集了包含 170 个不同任务的海量集合,范围从微小的 1 秒钟检查(如识别特定的文件名)到大规模的 8 小时研究项目。他们聘请了熟练的人类专家来计时完成这些任务所需的时间。然后,他们让 12 种不同的 AI 模型(从 2019 年发布的旧版 GPT-2 到 2025 年发布的最新版 o3)尝试解决这些问题。

令人惊叹的部分在于:AI 的“电池寿命”每七个月就会翻倍。

在 2019 年,最好的 AI 只能可靠地处理人类完成大约 2 秒钟的任务。到 2025 年,顶尖模型(如 o3)可以处理人类完成大约 110 分钟(近两小时)的任务,且成功率达到 50%。

研究人员发现,这种增长不仅仅是稍微变快了一点;它是一条指数曲线。这就像看着一个雪球滚下山坡,每经过一棵树时体积就会翻倍。他们测量了从 2019 年到 2025 年的这一趋势,发现“翻倍时间”大约为 207 天(约七个月)。

它们为什么变得更强了?

论文指出,AI 不仅仅是在以一种模糊的方式变得“更聪明”;它在变得更擅长特定的、实用的技能。当研究人员观察旧模型为何失败以及新模型为何成功时,他们发现新模型:

  • 更擅长使用工具: 它们知道如何使用计算器或代码编辑器而不破坏它们。
  • 更擅长修复错误: 如果旧的 AI 犯了错,它通常会一遍又一遍地重复同一个错误。新的模型可以发现错误,说声“哎呀”,然后尝试另一条路径。
  • 更擅长逻辑推理: 它们可以遵循思维链而不会迷失方向。

“混乱”的限制:现实生活更难

然而,论文非常谨慎,并没有说机器人已经赢得了战争。研究人员明确指出,这些测试可能过于“干净”了。

想象一下,AI 正在玩一款电子游戏,规则写在清晰的手册里,敌人是可预测的,而且没有突发的停电。研究人员将现实世界的工作称为**“混乱的”(Messy)**。在现实世界中,任务通常指令不明、需要与他人沟通,或者涉及资源枯竭的问题。

当团队在更“混乱”(缺乏结构化、更混乱)的任务上测试 AI 时,AI 的表现显著下降。论文表明,虽然 AI 在处理“干净”的谜题方面做得很好,但它可能仍然难以应对软件工程师日常工作中那种混乱、不可预测的性质。他们发现目前还没有证据表明 AI 在处理“混乱”任务时的进步速度放缓了,但他们警告说,“干净测试”与“混乱现实”之间的差距是一个巨大的未知数。

这对未来意味着什么?

研究人员进行了一些数学计算,以观察这条曲线将走向何方。如果这种每七个月翻倍的趋势持续下去,他们预测在 5 年内(2028 年中期至 2031 年中期之间),AI 系统可能能够自主完成目前需要人类花费 一个月(约 167 个工作小时)才能完成的软件任务。

他们强调,这是一种预测,而非保证。这取决于 AI 是否能保持这种精确的速度提升,以及那些“干净”的测试结果是否适用于“混乱”的现实世界。如果这一趋势保持不变,我们可能会看到能够在其复杂项目上几乎作为全职员工工作的 AI 智能体。但如果趋势放缓,或者现实世界的“混乱性”被证明过于困难,那么这个时间表可能会改变。

底线

这篇论文并不声称 AI 已经解决了所有问题。相反,它给了我们一把衡量进步的新尺子。它表明,在过去的六年中,AI 处理长期、复杂任务的能力正在以惊人的速度增长,其“工作日”大约每七个月就会翻倍。虽然在处理混乱的现实世界时仍存在巨大差距,但这一轨迹表明,AI 能够自主完成长达一个月工作周期的日子可能比我们想象的要近。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →