← 最新论文
💬 NLP

Cost-of-Pass: An Economic Framework for Evaluating Language Models

本文提出了名为“通过成本”(Cost-of-Pass)的经济学评估框架,通过结合准确率与推理成本来衡量语言模型的生产力,揭示了不同任务类型下的最优模型选择、成本效率的显著进步趋势,以及各类模型创新与推理技术在推动成本效益前沿中的关键作用。

原作者: Mehmet Hamza Erol, Batu El, Mirac Suzgun, Mert Yuksekgonul, James Zou

发布于 2026-02-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Mehmet Hamza Erol, Batu El, Mirac Suzgun, Mert Yuksekgonul, James Zou

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文提出了一种全新的视角来评估人工智能(AI)语言模型,我们可以把它想象成给 AI 算一笔“经济账”

以前,大家评价 AI 主要看它“聪不聪明”(准确率)。但这篇论文的作者们(来自斯坦福大学)说:“光聪明没用,还得看贵不贵。”他们发明了一个叫"通过成本"(Cost-of-Pass)的指标,用来衡量为了得到一个正确答案,平均需要花多少钱

为了让你更直观地理解,我们可以用几个生活中的比喻来拆解这篇论文的核心内容:

1. 核心概念:去餐厅点菜(什么是“通过成本”?)

想象你开了一家餐厅,顾客点了一道很难做的菜(比如“解一道复杂的数学题”)。

  • 以前的做法:只问厨师(AI 模型):“这道菜你做得对吗?”如果厨师说“对”,你就觉得他好。
  • 这篇论文的做法:不仅问“做得对吗”,还要算账。
    • 如果厨师 A 很便宜,但做 10 次只有 1 次做对,那你为了吃到一次对的菜,得花 10 份的钱。
    • 如果厨师 B 很贵,但做 1 次就能对,那你可能只花 1 份的钱。
    • 结论:虽然厨师 B 单价贵,但他**“通过成本”**(为了得到一次成功结果花的总钱数)反而更低,更划算。

“通过成本” = 单次尝试的成本 ÷ 做对的概率
这个指标把“价格”和“能力”结合在了一起,告诉你到底谁才是真正“性价比之王”。

2. 三大发现:不同任务,不同“厨师”最划算

作者们测试了各种类型的任务,发现并没有一种“全能冠军”,不同的任务需要不同的“厨师”:

  • 简单算术题(比如 2 位数加法):
    • 最划算的轻量级小模型(便宜的小厨师)。
    • 原因:这种题太简单了,大厨师(大模型)虽然也能做,但收费太贵,杀鸡焉用牛刀。小厨师便宜又快,性价比最高。
  • 知识问答(比如“谁发明了相对论?”):
    • 最划算的大型模型(经验丰富的大厨师)。
    • 原因:这需要脑子里有大量的知识库。小厨师记不住,大厨师虽然贵点,但能一次做对,省去了反复试错的钱。
  • 复杂推理题(比如奥数竞赛题):
    • 最划算的推理型模型(专门训练过逻辑的“特级厨师”)。
    • 原因:这类题最难,普通大厨师容易想错。推理型模型虽然单次尝试很贵,但它们思考更周密,做对的概率极高,所以算总账反而最省钱。

3. 时间轴上的进步:成本在“大跳水”

作者们像看股票一样,追踪了过去一年(2024 年 5 月到 2025 年 2 月)这些“厨师”的价格变化。

  • 发现:解决复杂数学题的“通过成本”下降得飞快,大约每几个月就减半一次
  • 比喻:这就像以前买一张去火星的票要 100 万美元,现在只要 50 万,再过几个月只要 25 万。AI 的进步不仅仅是变聪明了,更是变得极其便宜了。

4. 谁是功臣?(反事实分析)

作者们做了一个思想实验:如果把某类模型(比如“推理模型”)从市场上全部撤掉,会发生什么?

  • 结果
    • 如果没有轻量级模型,简单算术题的成本会飙升。
    • 如果没有大型模型,知识问答的成本会飙升。
    • 如果没有推理模型,复杂数学题的成本会飙升。
  • 启示:这三类模型是互补的,缺一不可。它们共同推动了整个 AI 行业的成本下降。

5. 避坑指南:有些“技巧”其实不省钱

现在流行一些“测试时技巧”,比如让 AI 自己多思考几次(自我修正),或者让 AI 多试几次选个众数(多数投票)。

  • 论文发现:这些技巧虽然能让准确率稍微提高一点点,但花的钱更多
  • 比喻:这就像为了把一道菜做得更完美,你让厨师多试了 3 次,结果多花了 3 倍的钱,但味道只提升了一点点。对于大多数情况,直接换个更好的厨师(升级模型),而不是在同一个厨师身上花更多时间。
  • 例外:有一种叫"TALE-EP"的预算控制技巧,稍微有点用,但效果有限。

6. 和人类专家比一比

论文还设定了一个“人类专家”的基准线(比如请一位数学家来解题要多少钱)。

  • 现状:在很多简单任务上,AI 已经比请人类专家便宜得多了。
  • 未来:随着成本继续下降,AI 将在更多领域取代昂贵的人类专家,成为经济上更优的选择。

总结

这篇论文告诉我们:评价 AI 不能只看它“智商”有多高,更要看它“性价比”有多好

  • 简单事小模型(便宜)。
  • 知识事大模型(稳)。
  • 难题推理模型(强)。
  • 不要盲目用那些让 AI“反复试错”的昂贵技巧,直接升级模型才是王道。

这就好比我们在生活中买东西,不再只看“功能最强”的,而是看“在满足需求的前提下,谁最省钱”。这就是这篇论文给 AI 世界带来的**“经济账”思维**。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →