← 最新论文
💬 NLP

Accelerated Test-Time Scaling with Model-Free Speculative Sampling

本文介绍了 STAND,一种无模型投机解码方法,它利用随机自适应 N 元组草稿来挖掘固有的推理冗余,在无需牺牲准确性或进行额外模型训练的情况下,于各类推理任务中实现了 60-65% 的推理延迟降低。

原作者: Woomin Song, Saket Dingliwal, Sai Muralidhar Jayanthi, Bhavana Ganesh, Jinwoo Shin, Aram Galstyan, Sravan Babu Bodapati

发布于 2026-05-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Woomin Song, Saket Dingliwal, Sai Muralidhar Jayanthi, Bhavana Ganesh, Jinwoo Shin, Aram Galstyan, Sravan Babu Bodapati

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试解决一个非常棘手的谜题,比如一道复杂的数学题或一个棘手的编程挑战。你有一位才华横溢但思维缓慢的朋友(即 AI 模型),他能够解决这个问题,但他需要花费很长时间,逐字逐句地写下解决方案的每一个字。

问题:“慢走”
目前,当 AI 模型进行推理时,它像一个人逐字逐句地写句子一样,一步步地构建解决方案。如果模型需要生成 1,000 个字,它就必须停顿、思考并书写 1,000 次。这既缓慢又消耗大量能量。

有些人试图通过让模型同时写出 16 个不同的解决方案并挑选最好的一个来加速这一过程(就像让 16 个人来解谜并选出获胜者)。但这会让计算机工作得更加吃力,就像雇佣了 16 个人而不是一个人。

解决方案:STAND(“记忆技巧”)
这篇论文介绍了一种名为 STAND 的新方法。将 STAND 想象为一个聪明的“捷径”,它不需要雇佣第二个更小的助手。相反,它利用那位才华横溢的朋友自身的记忆来预测接下来的内容。

以下是其工作原理,使用简单的类比说明:

1. “模式识别器”(N-grams)

当你的才华横溢的朋友解决许多谜题时,他们往往会反复使用相同的短语或逻辑步骤。

  • 旧方法: 如果朋友说“答案是 42",系统会等待下一个字被写出来。
  • STAND 方法: 系统记得,每当朋友说“答案是”时,他们几乎总是紧接着说"42"。因此,系统会提前猜测接下来的几个字。

2. “置信度计”(随机草稿)

这是该论文最大的创新。

  • 旧的猜谜游戏: 以前的方法就像一个机器人,只猜测最有可能的那个词。如果朋友不确定,机器人的猜测往往就是错的,朋友不得不停下来进行修正。
  • STAND 猜谜游戏: STAND 更聪明。它不仅记住了用了什么词,还记住了朋友在说这个词时有多大的把握
    • 类比: 想象你的朋友在“苹果”和“香蕉”之间做选择。
      • 旧方法: 如果他们说“苹果”,系统就猜“苹果”。如果朋友实际上指的是“香蕉”,猜测就会失败。
      • STAND 方法: 系统记得:“当他们说‘苹果’时,他们有 70% 的把握,但也有 30% 的可能性是‘香蕉’。”因此,系统会同时猜测所有可能性,并根据其可能性进行加权。这使得猜测正确的概率大大提高。

3. “可能性之树”(树搜索)

有时,路径并不是一条直线,而是分岔路口。

  • 策略: STAND 构建了一个小型的猜测“树”。它不仅仅猜测下一个字,而是猜测朋友可能采取的几条不同路径。
  • 优化: 论文提到了一种“数据驱动”的方法。想象系统首先尝试了一个巨大且杂乱的猜测树。然后,它查看结果并说:“好吧,这些分支总是有效,但这些死胡同从未奏效。”它剪除死胡同,保留最佳分支,从而为未来的猜测创建一张超级高效的地图。

4. “速度提升”(Gumbel-Top-K)

为了让这些猜测瞬间发生而不拖慢计算机速度,论文使用了一种名为 Gumbel-Top-K 的数学技巧。

  • 类比: 想象你有一袋弹珠,需要选出最快的 3 颗。与其一颗一颗地挑选(这需要时间),不如摇晃袋子,让最快的 3 颗一次性弹出来。这节省了宝贵的时间。

结果:他们发现了什么?
研究人员在困难的数学、科学和编程问题上测试了这种方法。

  • 速度: 他们发现,与标准的缓慢方法相比,STAND 使 AI 的速度提高了 60% 到 65%
  • 准确性: 关键在于,它并没有让 AI 变笨。答案和以前一样正确。
  • 无需额外训练: 你不需要教 AI 任何新东西。这是一个“即插即用”的工具。你可以将任何现有的 AI 模型立即连接上这个“记忆技巧”。
  • 扩展性: AI 探索的路径越多(例如尝试 16 个不同的解决方案),STAND 的效果就越好。这就像在探索一片巨大的森林时,拥有一张更好的地图。

总结
STAND 就像是给一个缓慢但深思熟虑的 AI 提供了一份由其自身过往思想制成的“作弊条”。它不需要从头开始写每一个字,而是利用对相似模式的记忆来瞬间预测接下来的几个字。它这样做不需要第二个 AI 来协助,并且保持了答案的聪明程度与以前一样,只是速度快得多。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →