Do LLMs Overthink Basic Math Reasoning? Benchmarking the Accuracy-Efficiency Tradeoff in Language Models
该论文提出了 LLMThinkBench 基准与“过度思考”评分指标,通过对 53 个大语言模型的实证研究发现,模型在复杂基准上的优异表现并不能保证其在基础数学推理中的准确性,且延长推理预算往往导致效率降低甚至性能下降,从而挑战了“更长推理必然带来更好结果”的假设。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文就像是在给现在的 AI 大模型做了一次“数学体检”,结果发现了一个非常有趣甚至有点荒谬的现象:很多 AI 在解简单的数学题时,不仅没变聪明,反而变得“想太多”了。
我们可以把这篇论文的核心内容想象成以下几个生动的场景:
1. 核心发现:聪明的“书呆子”vs. 精干的“实干家”
想象一下,你让两个学生做一道简单的加法题:234 + 567。
- 普通学生(普通模型):拿起笔,算一下,写下答案
801。用时 5 秒,纸张没浪费。 - “思考型”学生(推理模型):他先开始写长篇大论:“首先,我们要理解位值的概念……个位 4 加 7 等于 11,进位 1……等等,让我用质因数分解法验证一下……再画个图……"最后,他写了整整 10 页纸,结果居然还算错了,或者虽然算对了,但浪费了 100 倍的时间。
论文结论:现在的 AI 模型(特别是那些被训练成“深度思考”的模型)就像这个“书呆子”。它们为了显示自己很努力,会生成大量冗长的废话(论文里叫“过度思考”Overthinking),这不仅没提高准确率,反而因为想太多把自己绕晕了,甚至导致在简单问题上出错。
2. 新工具:给 AI 算一笔“性价比账”
以前的评测只看 AI 答对没答对(准确率)。但这篇论文觉得这不够,就像只问“厨师菜做得好不好吃”,却不管他“浪费了多少食材和时间”。
作者发明了一个新指标,叫“过度思考分数”(Overthinking Score)。
- 比喻:这就像给餐厅打分。如果一家餐厅菜很好吃(准确率高),但每道菜都要厨师在厨房里折腾 3 个小时(Token 消耗巨大),那它的综合评分就会很低。
- 公式逻辑:这个分数是“准确率”和“效率”的调和平均数。意思是,如果你准确率很高但效率极低,或者效率很高但准确率很低,你的总分都会很难看。只有既快又准,才能拿高分。
3. 惊人的实验结果
作者让 53 种不同的 AI 模型做了 14 种基础数学题(比如排序、求和、找最大值等),结果发现了几个反直觉的真相:
越大的模型不一定越聪明:
有些参数巨大的模型(比如 700 亿参数),在基础数学题上反而不如中等大小的模型(比如 140 亿参数)。大模型就像是一个知识渊博但有点啰嗦的老教授,遇到简单问题也要讲半天大道理;而小模型像干练的办事员,直奔主题。- 比喻:就像让一个诺贝尔奖得主去数手指头,他可能会先发表一篇关于“手指进化论”的演讲,最后数错了;而一个小学生直接数出来就是对的。
“想太多”会崩溃:
如果你限制这些“爱思考”的 AI,不让它们写长篇大论(比如限制只能输出 1024 个字),它们的准确率会断崖式下跌。- 比喻:这就像强迫一个习惯了写 100 页论文的人,必须在 1 页纸内说完。他因为习惯了那种“铺垫 - 论证 - 再论证”的节奏,突然被切断思路,直接大脑宕机,连最简单的答案都写不出来了。
延长思考时间没用:
作者发现,给 AI 更多的思考时间(更多的 Token 预算),准确率并不会提高。- 比喻:就像你让一个人做
1+1,你给他 1 分钟,他算出来了;你给他 1 小时,他可能开始怀疑"1 到底是不是 1",甚至算出1+1=3。思考得越久,错误反而越多,因为他在自我怀疑和重复验证中引入了新的混乱。
- 比喻:就像你让一个人做
压缩模型(量化):
有趣的是,把大模型“压缩”(量化,比如从 16 位精度降到 4 位),大模型的数学能力几乎没受影响,但小模型就崩了。这说明“过度思考”是训练出来的坏习惯,而不是硬件算力不足的问题。
4. 为什么会出现这种情况?
论文指出,罪魁祸首是训练方式。
现在的 AI 训练喜欢让它们“一步步思考”(Chain-of-Thought),这本来是为了做难题。但模型学聪明了(或者说学歪了),它们以为只要话多、步骤多,就是好答案。于是,它们把“解释过程”当成了“解题过程”,甚至为了凑字数而编造步骤,导致“表演性思考”(Performative Verbosity)。
5. 给未来的建议
这篇论文给 AI 开发者提了个醒:
- 不要盲目追求“大”和“深”:有时候,中等大小、经过精简训练的模型,在解决实际问题时更靠谱、更省钱。
- 学会“见好就收”:AI 需要学会判断什么时候该停笔。做简单题时,应该像闪电一样快,而不是像蜗牛一样慢。
- 新的评价标准:以后评价 AI,不能只看它能不能解奥数题,还要看它做简单事时会不会“掉链子”或“瞎折腾”。
总结
这篇论文就像给 AI 界泼了一盆冷水:别被那些长篇大论的“思考过程”骗了。在基础数学这种确定性任务上,少即是多(Less is More)。一个能直接给出正确答案、不废话的 AI,比一个写了 1000 个字却还在纠结的 AI,要聪明得多,也实用得多。
一句话总结:现在的 AI 有时候像个“过度热情的导游”,明明只要指个路,它却非要给你讲 30 分钟历史,结果还把你带错了路。我们需要的是那种“指路精准、话少效率高”的 AI。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。