← 最新论文
💬 NLP

BRIDGE: Predicting Human Task Completion Time From Model Performance

本文介绍了 BRIDGE,这是一个心理测量学框架,它通过在潜在任务难度与人类完成时间的对数之间建立线性关系,从而通过模型性能数据来预测人类的任务完成时间,实现了无需高昂人类标注成本的可扩展能力预测。

原作者: Fengyuan Liu, Jay Gala, Nilaksh, Dzmitry Bahdanau, Siva Reddy, Hugo Larochelle

发布于 2026-07-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Fengyuan Liu, Jay Gala, Nilaksh, Dzmitry Bahdanau, Siva Reddy, Hugo Larochelle

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图弄清楚新一代超快速机器人解决谜题的速度有多快。通常情况下,为了衡量这一点,你必须雇佣一支人类专家团队亲自尝试这些谜题,记录他们完成任务所需的时间,然后将其与机器人进行比较。但雇佣人类既昂贵又缓慢,而且很难为每一个新出的谜题都去执行这一过程。

名为 “BRIDGE” 的论文提出了一个聪明的捷径。它建议,我们只需通过观察 AI 模型在某项任务上的表现,就能精准预测人类完成该任务需要多长时间,而无需雇佣哪怕一个人类来进行计时。

以下是他们实现这一目标的原理,通过几个简单的类比来解释:

1. “学校考试”类比(项目反应理论)

把所有不同的 AI 基准测试(如编程测试、数学问题或网络安全挑战)想象成一个巨大的、混合在一起的各类学校考试。有些考试很简单,有些很难,有些则很棘手。

研究人员使用了一种叫做项目反应理论 (Item Response Theory, IRT) 的统计工具。你可以把它理解为一种用于教育领域的复杂评分系统。IRT 不仅仅是计算学生答对了多少题,它还会观察学生答对了“哪些”题。

  • 如果一名学生答对了一道非常难的题目,这说明他非常聪明。
  • 如果一名学生答错了一道简单的题目,我们就知道他在挣扎。

通过将许多不同 AI 模型在许多不同任务上的通过/失败结果输入到这个系统中,论文为每一项任务都创建了一个“隐藏难度分”。这就像是给每个谜题都赋予了一个代表其难度的秘密数字,而这个数字完全是基于机器人的表现得出的。

2. 构建“桥梁”

这是神奇之处。研究人员选取了一组人类已经完成过计时任务的特定任务(来自之前的一项名为 METR 的研究)。他们将“秘密难度分”(来自机器人)与“实际人类时间”(来自人类)进行了对比。

他们发现了一个直线关系:对机器人来说越难的任务(难度分越高),人类完成它所需的时间就越长。 具体来说,随着难度分的上升,人类所需的时间呈指数级增长。

可以将这想象成在建造一座桥梁。河流的一侧是“机器人表现”,另一侧是“人类时间”。研究人员找到了连接这两者的完美木板。一旦桥梁建成,你就可以站在机器人这一侧,观察一个模型的表现,并瞬间得知人类完成同样的事情需要多久,即使你从未见过人类做这件事。

3. AI 进步的“水晶球”

利用这座桥梁,作者观察了 AI 模型(从 2022 年到 2025 年)的历史。他们问道:“随着模型变得越来越聪明,它们能解决多长时间的‘人类任务’?”

他们发现了一个清晰的模式:AI 能力正在呈指数级增长。

  • 想象一下,一个 2022 年的模型只能解决一项人类需要 1 分钟完成的任务。
  • 到 2025 年,最优秀的模型可以解决人类需要约 2 小时才能完成的任务。
  • 论文计算出,AI 所能处理的任务“长度”每 6 个月就会翻倍

这就像是在看一个电子游戏角色升级的过程,升级速度之快,使得每隔六个月,他们就能挑战一个比之前能打过的 Boss 战时长两倍的任务。

4. 为什么这很重要(根据论文所述)

该论文声称这种方法是一个游戏规则的改变者,因为它:

  • 成本低廉: 你不需要为了计时每一个新测试而支付人类报酬。
  • 速度极快: 在你获得机器人结果的那一刻,你就能预测人类的投入时间。
  • 准确度高: 当他们使用未曾用于构建桥梁的真实人类数据来测试这些预测时,他们的猜测非常接近。

总结

这篇论文介绍了 BRIDGE,这是一种利用 AI 模型的表现来创建“难度图谱”的方法。通过用少量的人类计时数据对该图谱进行校准,只需观察 AI 的表现,我们就能预测任何任务需要人类完成多长时间。这使我们能够追踪 AI 能力的快速增长(任务长度每 6 个月翻倍),而无需经历不断雇佣人类来计时这一缓慢且昂贵的过程。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →