← 最新论文
🤖 AI

Nice Fold or Hero Call: Learning Budget-Efficient Thinking for Adaptive Reasoning

本文介绍了预算高效思维(BET),这是一种两阶段框架,它通过基于预期回报而非感知难度来动态分配预算,从而优化大型推理模型的测试时计算,在实现显著令牌减少的同时,通过自适应的“快速求解”、“优雅弃牌”和“英雄跟注”行为提升性能。

原作者: Zhaomeng Zhou, Lan Zhang, Junyang Wang, Mu Yuan, Junda Lin

发布于 2026-05-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhaomeng Zhou, Lan Zhang, Junyang Wang, Mu Yuan, Junda Lin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你有一位才华横溢但略显过于热情的助手,正试图为你解决堆积如山的大量谜题。这位助手擅长思考,却有一个坏习惯:有时他们会花数小时盯着一个根本无法解决的谜题发呆,而有时又会对一个本可在分钟内解决的简单谜题过度分析。这不仅浪费了你的时间,也浪费了你的金钱(以计算能力的形式)。

本文介绍了一种名为**BET(预算高效思考)**的新训练方法,旨在教导这位助手如何更明智地分配在每个谜题上投入的“思考能量”。

以下是 BET 的工作原理,通过简单的类比来说明:

问题所在:“过度思考者”与“思考不足者”

目前,大型 AI 模型就像一个不知道何时该停止学习的学生。

  • 简单谜题: 如果你问"2+2 等于几?”,这位学生可能会写一篇十页的论文来证明为什么 2+2 等于 4,从而浪费时间。
  • 不可能解决的谜题: 如果你问一个目前对学生来说太难的问题(比如他们尚未学过的复杂数学题),他们可能会因为不知道自己无法解决而持续尝试数小时,却一无所获。
  • 困难但可解决的谜题: 如果谜题很难但可行,学生就需要持续思考。但现有的方法有时会过早切断他们的思路,导致他们放弃那些本可以解决的谜题。

解决方案:BET 的三大超能力

该论文教导 AI 三种具体行为,作者称之为“快速解决”、“优雅弃牌”和“英雄跟注”。你可以将这些视为扑克策略:

  1. 快速解决(Quick Win):

    • 类比: 你在扑克中看到一手简单的牌。你知道自己会赢,所以不需要虚张声势或过度分析。你只需拿走筹码,继续下一局。
    • BET 的做法: 如果 AI 看到一个简单的问题,它会快速且简洁地回答。它不再在已知的事情上浪费能量。
  2. 优雅弃牌(Nice Fold,知道何时放弃):

    • 类比: 你在玩扑克,意识到自己的牌很烂且胜算渺茫。聪明的玩家会立即“弃牌”(放弃),以便将资金保留给更好的手牌。他们不会继续往一个必输的游戏中投入资金。
    • BET 的做法: 如果 AI 意识到一个问题超出了它当前的能力范围,它会说“我解决不了这个”,并立即停止。它不会浪费时间试图在一个无法破解的问题上强行给出答案。这节省了巨大的计算资源。
  3. 英雄跟注(Hero Call,在正确时刻全押):

    • 类比: 你有一手好牌,但尚未显而易见。你知道需要投入更多资金才能赢得大奖。于是你做出“英雄跟注”,继续深入游戏。
    • BET 的做法: 如果 AI 看到一个困难的问题,且判断只要深入思考就能解决,它就会保存能量并继续下去。它不会过早地切断自己的思路。

如何训练 AI(两阶段训练)

研究人员并没有仅仅告诉 AI 要“高效”。他们分两个步骤进行训练:

  • 第一阶段:教学计划(冷启动): 他们向 AI 展示了行为示例。他们展示:“这是一个简单的问题;这是你快速回答它的方式。”“这是一个不可能解决的问题;这是你说‘我放弃’的方式。”“这是一个难题;这是你持续思考的方式。”
  • 第二阶段:实战演练(强化学习): 他们让 AI 进行游戏。每当 AI 尝试解决问题时,系统就会检查:“你是否在不可能解决的问题上浪费了时间?你是否在难题上过早放弃?”根据结果,他们给 AI 打分(奖励)。如果 AI 在不可能的问题上节省了资源,同时仍然解决了难题,它就会获得高分。

结果

当他们在七项不同的数学和逻辑测试中测试这种新方法时:

  • 节省了约 55% 的思考时间。 AI 使用的计算能力大约只有之前的一半。
  • 解决问题能力提升了。 因为它不再在不可能完成的任务上浪费时间,也不再对简单问题过度思考,所以它实际上更多地正确解决了难题。
  • 适用于新型谜题。 尽管他们仅在数学上进行了训练,但它将这些“明智支出”的习惯应用到了它从未见过的科学问题和逻辑谜题上。

核心结论

BET 教导 AI 模型像一位精明的投资者。它不再盲目地花钱(计算能力),而是为每个问题计算“投资回报率”。

  • 如果回报低(简单问题),就少花点。
  • 如果回报为负(不可能的问题),一分钱也别花。
  • 如果回报高(困难但可解决的问题),就大力投入。

这使得 AI 运行速度更快、成本更低,并且在解决难题方面表现得出奇地好。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →