← 最新论文
💬 NLP

SPECS\texttt{SPECS}: Faster Test-Time Scaling through Speculative Drafts

本文提出了名为 SPECS 的延迟感知测试时扩展方法,该方法利用小模型生成候选序列并结合奖励模型与大模型进行验证,在保持甚至提升推理准确率的同时显著降低了延迟。

原作者: Mert Cemri, Nived Rajaraman, Rishabh Tiwari, Xiaoxuan Liu, Kurt Keutzer, Ion Stoica, Kannan Ramchandran, Ahmad Beirami, Ziteng Sun

发布于 2026-02-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Mert Cemri, Nived Rajaraman, Rishabh Tiwari, Xiaoxuan Liu, Kurt Keutzer, Ion Stoica, Kannan Ramchandran, Ahmad Beirami, Ziteng Sun

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 SPECS 的新方法,旨在解决大语言模型(LLM)在“思考”时面临的一个核心矛盾:想要更聪明(提高准确率),往往需要更慢(增加延迟);想要更快,往往就要牺牲聪明度。

想象一下,你正在让一个超级聪明的数学家(大模型)和一个反应极快但经验稍浅的实习生(小模型)一起帮你解一道复杂的数学题。

1. 核心痛点:为什么现在的“思考”这么慢?

以前,为了让模型更聪明,我们通常会用“束搜索”(Beam Search)的方法。这就像让那个超级数学家一个人同时画出好几条解题思路(比如 4 条、8 条),然后仔细检查每一条,选出最好的一条继续往下走。

  • 问题在于:让这位“超级数学家”每走一步都要重新计算好几条路,非常消耗时间(就像让一个教授同时写好几篇论文,速度自然慢)。
  • 现状:用户等得太久,体验很差。

2. SPECS 的解决方案:聪明的“师徒搭档”

SPECS 的核心思想是**“让实习生先起草,教授再把关,但只在关键时刻让教授亲自上手”**。

比喻:建筑工地的“快速草图”与“最终审核”

想象你在盖一座大楼(解决复杂问题):

  • 传统方法(束搜索):每次砌砖,都要请总工程师(大模型)亲自画 4 种不同的砌法,然后他再亲自选一种。这太慢了,因为总工程师太忙了。
  • SPECS 方法
    1. 起步阶段(教授亲自带队):刚开始,问题很难,谁也不知道方向对不对。这时候,我们请总工程师(大模型)先画几条草图,确保方向没错。
    2. 判断阶段(奖励模型打分):有一个监理(奖励模型,PRM)会看这些草图。如果监理发现某条路“看起来很有希望”(分数很高),那就说明这条路大概率是对的。
    3. 加速阶段(实习生接手):一旦监理确认“这条路稳了”,SPECS 就会立刻把任务交给实习生(小模型/草稿模型)。实习生画得飞快,他迅速画出后续的步骤。
    4. 快速审核:总工程师不需要重新画,只需要快速看一眼实习生画的图,确认“嗯,没错,继续”,或者“这里有点问题,换一条”。
    5. 动态切换:如果监理发现某条路“看起来不太对劲”(分数低),那就立刻把任务抢回来,重新让总工程师亲自处理,避免实习生在错误的路上跑太远。

3. 为什么 SPECS 既快又准?

论文中提出了两个非常巧妙的策略:

A. “看人下菜碟”的动态切换(Dynamic Switching)

  • 旧思路:很多以前的方法(如投机解码)是“先让实习生猜,猜对了教授确认,猜错了教授重来”。这有个问题:如果实习生一开始就猜错了,教授还得花时间去纠正,浪费了时间。
  • SPECS 思路先让教授定调子。只有当教授和监理都确认“这条路很稳(高奖励)”时,才放心大胆地让实习生去跑。
    • 比喻:就像开车,起步和过急弯(难题)时,必须由老司机(大模型)亲自开;但在直道(简单步骤)上,可以交给自动驾驶(小模型)来跑,既快又安全。

B. “软硬兼施”的评分机制(Reward-Guided Soft Verification)

  • 在挑选哪条路继续走时,SPECS 不仅仅看“谁画得像”(概率),还看“谁得分高”(奖励)。
  • 它把教授的专业判断(大模型的概率)和监理的评分(奖励模型)结合起来。
  • 比喻:选路时,不仅看“这条路是不是教授平时常走的”(概率),还要看“这条路是不是通往宝藏的”(奖励)。这样选出来的路,既符合逻辑,又大概率能解出答案。

4. 实验结果:真的有效吗?

作者在数学题(MATH500, AMC23 等)和科学问答(GPQA)上做了测试:

  • 速度提升:相比传统的“教授全权负责”的方法,SPECS 让回答速度快了约 18%
  • 准确率:虽然用了实习生,但准确率没有下降,甚至在一些情况下还更高了。
  • 理论保证:论文还从数学上证明了,只要给的“思考次数”(束宽)足够多,这个方法最终能逼近最优解。

总结

SPECS 就像是一个聪明的项目经理:
它知道什么时候该让专家亲力亲为(解决难题、定方向),什么时候该让助手放手去干(处理简单步骤、加速流程)。通过这种“动态切换”和“智能筛选”,它成功地在**“快”“准”**之间找到了完美的平衡点,让用户既能快速得到答案,又能保证答案的高质量。

这就好比在餐厅点菜:以前是主厨(大模型)亲自切每一块肉;现在,主厨负责切最难处理的食材并定菜单,剩下的切配工作交给熟练的帮厨(小模型),主厨最后快速检查一眼。结果就是:上菜更快了,味道也没变差。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →