← 最新论文
💻 computer science

Reason Wide, Not Deep: Amortizing the Reasoning Premium into Distilled Skills

本文提出通过将紧凑的自然语言技能从少量现有轨迹中蒸馏到非推理模型中,来摊销推理模型的高昂 Token 成本,这种方法通过以深度的、针对单实例的搜索换取广泛的、一次性的语料库蒸馏,在实现与推理模型相当或更优的智能体基准测试性能的同时,显著减少了 Token 的输出。

原作者: Agamdeep Singh, Srishti Gautam, Priyanshu Gupta, Nikita Mehrotra, Tanmay Bakshi, Sumit Gulwani

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Agamdeep Singh, Srishti Gautam, Priyanshu Gupta, Nikita Mehrotra, Tanmay Bakshi, Sumit Gulwani

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

伟大的代币税与神奇的参考手册

想象一下,你正在试图教一个超级聪明的机器人如何做家务,比如整理乱糟糟的房间或解决一个棘手的数学问题。在人工智能的世界里,有一种流行的技巧叫做“推理”(reasoning)。这就像是告诉机器人要在行动之前“大声思考”。机器人不再只是直接去抓一只袜子,而是会停顿一下并说:“好的,我需要找到袜子,检查它是否干净,然后把它放进脏衣篮。”这种“思考”的部分让机器人在处理困难任务时表现得更出色,但这也伴随着沉重的代价:它每次尝试都会消耗大量的数字能量(称为“代币/tokens”)。这就像是你每次开车经过一条熟悉的道路都要缴纳过路费,即使你已经在这条路上行驶过一千次了。机器人一直在一遍又一遍地重新推导那些简单的规则,在它本该已经掌握的事情上浪费能量。

研究人员提出的一个大问题是:我们能否把这些规则教给机器人一次,这样它就不必每次都去“思考”了?如果我们能给机器人一份永久性的“参考手册”,记录下做事的最优方式,它是否能变得和那个“思考型”机器人一样聪明,却不需要支付昂贵的能量账单?这就是来自 COLM 2026 工作坊的新研究的核心,该研究探索了一种既能节省能量又不损失智能的巧妙方法。


论文的核心思想:“向宽处求索,而非向深处挖掘”

研究这项研究的团队(与微软合作)注意到这些“推理型”机器人工作方式中一个有趣的地方。当它们处理一系列相似的任务时——比如在商店里帮助顾客或整理电子表格——它们花费了大量的时间在“重新发明轮子”。它们可能会反复进行推理,例如:“在他们给我电子邮件之前,我不应该调用客户的账户工具”,尽管这条规则从未改变。这就像是一个学生在每次参加数学考试时,都要从头开始重新发现 2+2=42+2=4,而不是直接记住它。

团队提出了一个名为**被动技能蒸馏(Passive Skill Distillation)**的解决方案。他们不再让机器人每次都进行“深度思考”(这就像为了每本书都在图书馆进行深度搜索),而是决定通过对许多过去的尝试进行“宽泛搜索”来寻找模式。

以下是他们的做法:

  1. 收集: 他们收集了一小堆过去的尝试记录(大约 35 到 50 个任务),在这些记录中,机器人尝试解决问题。这些尝试可以是机器人正在“思考”的,也可以是仅仅在“行动”而没有思考的。
  2. 分析师: 他们将这堆数据交给了一个不同的、非常聪明的编程机器人(一个“智能体”)。他们要求这个分析师查看日志,找出机器人失败的地方,并弄清楚为什么失败。
  3. 参考手册: 分析师机器人写了一套简短、简单的用纯英文表达的规则(大约 40 到 130 行文本)。例如,它可能会写道:“在你尝试查找用户 ID 之前,请确保消息中确实包含电子邮件地址,否则你会报错。”
  4. 注入: 他们将这个简短的“技能”粘贴到了非思考型机器人的系统指令中。现在,机器人不需要通过“思考”来记住规则;它只需阅读参考手册并采取行动。

他们的发现:更聪明、更快、更便宜

结果出人意料地好。当他们在四个具有挑战性的基准测试(如整理虚拟房屋、修复电子表格和处理客户服务电话)上测试这些“带有技能”的机器人时,拥有技能的机器人表现得几乎与昂贵的“思考型”机器人一样好,有时甚至更好。

  • 得分: 在某些测试中,带有技能的非思考型机器人实际上击败了思考型机器人。例如,在名为 ALFWorld(整理虚拟房屋)的任务中,增强了技能的机器人得分为 0.787,而思考型机器人仅得 0.713
  • 节省: 思考型机器人使用的输出代币比带有技能的机器人多出 3 到 6 倍。在某些情况下,带有技能的机器人使用的代币减少了 2.7 到 6 倍
  • 成本: 创建这份参考手册的成本极低。生成该技能每个领域仅需 1.28 美元到 2.44 美元,而思考型机器人每次运行任务时都要支付那份“税”。

转折点:你并不需要“思考”日志

研究人员发现的最有趣的发现之一是,他们实际上并不需要“思考”日志来制作一份好的参考手册。他们尝试仅使用那些没有思考的机器人(即那些只是行动且经常失败的机器人)的日志来制作技能。令人惊讶的是,这些技能与使用“思考”日志制作的技能一样好。

事实上,对于一个特定的测试(SpreadsheetBench),使用“非思考”失败记录制作的技能比使用思考日志制作的技能高出了 10 个百分点。研究人员认为这是因为“思考”日志充满了机器人关于它认为什么是正确的内心独白,而“非思考”日志则展示了现实世界中究竟发生了什么错误。这就像学习驾驶:阅读驾驶手册(思考日志)很有帮助,但观看汽车撞到路缘石的视频(失败日志)能让你准确知道哪些行为是绝对不能做的。

参考手册失效的地方

研究人员谨慎地指出,这并不是解决所有问题的灵丹妙药。参考手册最适用于那些始终不变的规则,比如“始终在调用工具前检查电子邮件”。然而,对于那些需要针对每个问题进行独特的、分步逻辑的任务——比如一个复杂的电子表格,其中每个单元格都依赖于不同的变量;或者一个具有非常特定、古怪历史记录的客户服务电话——参考手册的帮助就没那么大了。在这些情况下,“深度搜索”式的思考仍然是必要的。

总结

这篇论文提出了看待人工智能的一种新方式。我们不必强迫每个机器人在执行每个任务时都进行“深度思考”,我们可以一次性教会它们共同的模式。通过对许多过去的错误进行“宽泛搜索”来寻找规则,我们可以赋予机器人一套永久的技能集,使它们比“思考型”对手更快、更便宜,有时甚至更聪明。事实证明,对于许多任务,你不需要每次都重新发明轮子;你只需要一张好的地图。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →