← 最新论文
💻 computer science

Thinking with Reasoning Skills: Fewer Tokens, More Accuracy

该论文提出了一种通过检索和复用从大量探索中提炼的推理技能来替代“从头推理”的新范式,从而在数学和编程任务中显著减少推理令牌消耗并提升模型准确率。

原作者: Guangxiang Zhao, Qilong Shi, Xusen Xiao, Xiangzheng Zhang, Tong Yang, Lin Sun

发布于 2026-04-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Guangxiang Zhao, Qilong Shi, Xusen Xiao, Xiangzheng Zhang, Tong Yang, Lin Sun

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文提出了一种让 AI“更聪明、更省钱”的新方法,叫做**“带着推理技能思考”(Thinking with Reasoning Skills, 简称 TRS)**。

为了让你轻松理解,我们可以把现在的 AI 解题过程想象成**“让一个天才但没经验的实习生去解决难题”**。

1. 现在的痛点:实习生总是“从零开始”

目前的先进 AI(比如 OpenAI 的 o1 或 DeepSeek-R1),遇到新问题时,习惯**“从零开始”**(Reasoning from scratch)。

  • 场景:老板(用户)问:“怎么算这个复杂的积分?”
  • 实习生的做法:它会在脑子里疯狂试错。“先试试分部积分法?不行,太复杂了。试试三角函数?也不行。哎呀,好像哪里错了,重来……"
  • 结果:它最终可能算对了,但它在脑子里走了很多弯路,说了几千个“废话”(Token)。
  • 代价:
    1. 慢:想太久,用户等得着急。
    2. 贵:现在的 AI 是按“字数”(Token)收费的。它说了几千个字的思考过程,你就得付几千字的钱。

2. 论文的核心创意:建立“专家经验库”

这篇论文的作者说:“别每次都让实习生从零摸索了,我们给他一本‘错题集’和‘解题秘籍’吧!”

他们提出了 TRS 方法,分为两步走:

第一步:离线“提炼秘籍”(Distillation)

  • 做法:先让 AI 去解决一大堆难题。当它成功解决时,把它的“解题套路”总结成一张**“技能卡”;当它失败时,把“哪里容易踩坑”也总结成一张“避坑卡”**。
  • 比喻:就像把老专家几十年的经验,浓缩成一张张**“小抄”**(Skill Cards)。
    • 技能卡例子:“看到这种长得很像 (a+b)(a−b)(a+b)(a-b) 的式子,直接用平方差公式,别硬算!”
    • 避坑卡例子:“别用分部积分法,那个会死循环,换个思路。”
  • 这些“小抄”被存进了一个**“经验图书馆”**里。

第二步:在线“按需取用”(Retrieval)

  • 做法:当用户再问一个新问题时,系统先不急着让 AI 思考,而是先去“经验图书馆”里搜一下:“这个问题以前遇到过类似的吗?有没有现成的‘小抄’能用?”
  • 比喻:
    • 以前:实习生拿到题目,抓耳挠腮,自己瞎想。
    • 现在:实习生拿到题目,先看了一眼旁边的“小抄”,上面写着:“这题用换元法,三步搞定,别走弯路!”
    • 于是,实习生直接照着“小抄”走,省去了所有试错和绕路的时间。

3. 效果:既快又准,还省钱

论文在数学和编程(写代码)的测试中发现,用了这个方法后:

  • 更准:因为有了“避坑指南”,AI 不容易掉进以前犯过的错误里。
  • 更省:因为它不需要再废话几千字去“试错”,直接输出核心步骤。
    • 数据:在某些测试中,思考的字数(Token)减少了 50% 以上,成本也降了一半,但准确率反而还提高了。

4. 为什么这很重要?(打破“不可能三角”)

以前大家觉得:“想得快(省 Token)”和“想得对(高准确率)”是矛盾的。

  • 如果你逼 AI 少说话,它就容易算错。
  • 如果你让它多说话,它又太慢太贵。

TRS 打破了这个魔咒:
它不是强迫 AI“少说话”,而是通过**“借用经验”,让 AI“少废话”**。就像你开车去一个熟悉的地方,不需要每次都重新规划路线、看导航、走错路再掉头,直接开“老司机”的捷径,既快又稳。

总结

这篇论文就是教 AI 学会**“站在巨人的肩膀上思考”,而不是每次都“赤手空拳去战斗”**。

  • 对普通用户:意味着以后用 AI 解题、写代码,响应更快,费用更低。
  • 对开发者:提供了一种不需要重新训练模型,就能让现有 AI 变聪明、变省钱的“外挂”方法。

一句话总结:别让 AI 每次都“重新发明轮子”,给它一本“最佳实践手册”,它就能跑得更稳、更省油。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →