← 最新论文
🤖 AI

OckBench: Measuring the Efficiency of LLM Reasoning

本文介绍了 OckBench,这是首个旨在共同评估大语言模型在推理和编程任务中的准确性与 Token 效率的基准测试,揭示了当前模型中存在的显著低效问题,并倡导向优化 Token 使用量的范式转变。

原作者: Zheng Du, Hao Kang, Song Han, Tushar Krishna, Ligeng Zhu

发布于 2026-06-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Zheng Du, Hao Kang, Song Han, Tushar Krishna, Ligeng Zhu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在雇佣两个人来解决一个复杂的谜题。

A 先生看了看谜题,思考了片刻,然后说:“答案是 42。”
B 先生花了三个小时写了一篇 50 页的长文,内容涵盖了数字的历史、逻辑哲学以及他们的童年回忆,最后才低声说道:“答案是 42。”

两人都得到了正确的答案。但如果你按他们说出的字数来付钱,B 先生会让你耗费巨资、浪费大量时间并消耗过多的精力。

这篇名为 OckBench 的论文本质上是一份成绩单,它不再仅仅根据 AI 模型是否得到了正确答案来评判它们,而是根据它们达到答案的效率来进行评判。它将“奥卡姆剃刀”定律应用于 AI:实体不应被过度增加(即:不要无谓地增加复杂度)。 换句话说,如果 10 个字就能讲清楚,就不要用 1000 个字。

以下是研究人员发现的详细内容,以简单易懂的方式进行了解释:

1. 问题所在:“话痨型”AI 税

目前的 AI 基准测试就像是一场选择题考试,只关心你是否在选项上涂对了字母。它们并不关心你在边角空白处是否写了一部小说才得出结论。

研究人员注意到,现代 AI 模型(如 GPT-5.5 或 Claude)在推理方面已经变得非常出色,但也变得极其冗长。为了解决问题,它们会生成大量的文本(即“推理轨迹”)。这是昂贵的。每一个多出来的词都会增加成本、延长等待时间并消耗更多电力。

2. 解决方案:OckBench 与 OckScore

为了修复这个盲点,团队创建了 OckBench。这是一套包含 200 个关于数学、编程和科学的难题的特定题库。

但诀窍在于:他们并没有随机挑选问题。他们使用了一种**“差异化过滤器”**。他们专门挑选那些有些 AI 会给出简短、聪明的回答,而另一些 AI 则会给出冗长、啰嗦回答的问题。这暴露了“效率差距”。

他们还发明了一个新的评分标准,叫做 OckScore

  • 旧方式: 分数 = 准确率。
  • OckScore: 分数 = 准确率减去因过于冗长而产生的惩罚。

这就像高尔夫球的计分方式。你希望分数越低越好(准确率越高),但如果你用了 20 次挥杆才把球打进洞(使用了太多 Token/字符),你的得分就会变差。顶尖选手通常只需一两次挥杆就能完成。

3. 三大核心发现

发现 1:“过度思考税”

你可能会认为,规模较小的、更便宜的 AI 模型总是对你的钱包更友好。OckBench 表明事实往往并非如此。

较小的模型经常遭受**“过度思考税”**的影响。因为它们不够聪明,所以试图通过“多说话”来弥补。它们会喋喋不休、重复自身,并生成巨大的文字墙来试图寻找答案。

  • 例子: 一个小型模型的每个词可能只需极微小的成本,但因为它为了解决一个问题而写了 10 万个词,最终其成本反而比一个用 5000 个词就解决问题的更聪明模型还要高。

发现 2:开放与封闭的差距

“封闭式”模型(如来自 OpenAI 或 Anthropic 的模型)与“开放权重”模型(如 DeepSeek 或 Qwen,这些是向公众开放的)之间存在巨大差异。

  • 封闭式模型: 它们就像高效的外科医生。它们直击问题的核心。
  • 开放式模型: 它们就像热情的实习生。它们在获取正确答案方面进步很快,但仍然非常话痨。

研究表明,一个开放式模型的准确率可能与封闭式模型相同,但它为了达到这个结果可能会多使用 26 倍的词量。这是一个巨大的资源浪费。

发现 3:“每 Token 智能度”

研究人员提出了一个新术词:每 Token 智能度(Per-Token Intelligence)。它衡量的是 AI 生成的每个词中蕴含了多少“智慧”。

  • 高每 Token 智能度: AI 只说必要的内容。密度高、精准、高效。
  • 低每 Token 智能度: AI 用废话填充空间。稀疏、重复、低效。

令人惊讶的是,最聪明的模型往往拥有更高的每 Token 智能度。随着模型变得越来越聪明,它们的回答实际上会变得更短,因为它们不需要通过喋喋不休来寻找答案。

4. 我们能解决这个问题吗?

可以。论文表明,我们可以教导模型变得不那么话痨,同时又不降低它们的智力。

  • 混合模型: 通过将“思考型”模型与标准模型进行混合,他们可以在保持准确率稳定的同时,将词数减半。
  • 训练: 通过训练模型对自身的冗长行为进行自我惩罚(就像老师说,“请简洁一点!”),可以减少“过度思考税”。

总结

该论文认为,AI 领域需要改变思维方式。我们不应只问:“AI 是否得到了正确答案?”我们也必须问:“它在得到答案的过程中,是否没有浪费我们的时间、金钱和电力?”

在未来,最好的 AI 不仅要是最聪明的,更要是最简洁的。正如标题所暗示的,我们需要应用奥卡姆剃刀:不要增加不必要的 Token。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →