Self-Speculation for Faster Reasoning Models
本文介绍了 SSR(面向推理模型的自我投机),这是一种无需训练的解码方法,通过利用部分思维链响应作为草稿来验证并扩展完整的推理轨迹,从而加速大语言模型,在复杂的长文本生成任务中实现了高达 24.1% 的延迟降低。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能领域,大型语言模型已经从简单的聊天机器人进化为能够进行规划、编程和做出复杂决策的高级问题解决者。为了实现这种智能水平,这些模型通常会参与一种被称为“思维链”(chain-of-thought)推理的过程。模型并不会直接跳到答案,而是生成一段长长的、逐步进行的内部独白,在产生最终响应之前先对问题进行推演。虽然这种额外的思考时间显著提高了答案的质量,但也造成了一个瓶颈:模型思考得越久,用户等待结果的时间就越长。对于语音助手或编程工具等交互式应用,这种延迟可能会令人感到沮丧,从而破坏对话的流畅性或减慢开发者的工作流。研究人员面临的挑战在于,如何既能保持高质量的推理,又不必让用户在看到答案开始出现之前,必须等待每一个思考步骤全部完成。
加州大学洛杉矶分校的一组研究人员开发了一种名为“推理模型的自我投机”(Self-Speculation for Reasoning Models,简称 SSR)的新方法,旨在解决这个延迟问题,同时又不牺牲输出质量。他们的方法建立在一个简单但强大的观察之上:随着模型思考一个问题,它对最终答案的早期猜测往往包含了关于最终答案实际内容的显著线索。甚至在模型完成其完整的内部推理之前,它通常已经确定了解决方案的大致结构和关键细节。研究人员意识到,他们可以将这些早期、不完整的想法作为预测最终答案的“草稿”,同时让模型在后台继续其完整的推理过程。
该方法通过同时运行两个版本的同一个模型来工作。其中一个版本充当“起草者”(drafter),它提前停止推理过程,并立即尝试根据目前掌握的部分想法来生成最终答案。与此同时,主模型版本继续进行其完整的、深度的推理过程。一旦主模型完成了其长长的思维链,它就会作为一个“验证者”(verifier),检查由早期版本生成的草稿。如果草稿与经过完整推理后的最终答案相匹配,系统就会接受草稿中的标记(tokens),从而有效地跳过了逐个生成这些标记所需的时间。由于起草过程是与主推理过程并行进行的,因此花费在创建草稿上的时间被隐藏了起来;用户并不会感觉到在等待它。这使得系统能够更快地交付最终响应,特别是对于需要长篇、结构化输出的任务,如编写代码或规划复杂的序列。
为了使这一过程更加有效,研究人员在过程中加入了第二层机制。在许多情况下,早期的草稿可能会在开头出现一些细节错误——例如使用错误的变量名或略有不同的措辞——但随后会与最终答案完美对齐很长一段距离。标准方法会在第一个错误处就丢弃整个草稿,但新系统包含了一个“后缀解码”(suffix decoding)功能。这使得系统能够穿透初始错误,寻找草稿中稍后出现的、最终答案也会使用的匹配文本段落。通过回收这些有用的文本块,系统可以接受更多的草稿内容,从而进一步减少生成响应所需的时间。
研究人员在多项具有挑战性的任务上测试了这种方法,包括为复杂的软件类生成代码以及创建长篇结构化文档。他们发现,对于处理这类问题的模型,这种新方法将生成响应的总时间减少了高达 24.1%。这种加速是在没有改变模型权重或需要任何额外训练的情况下实现的,这意味着它可以立即应用于现有系统。在最终答案较长且具有结构性的任务(如编程)中,这种效果最为显著,因为模型在思考过程中倾向于尽早确定整体结构。相比之下,对于思考时间本身是主导因素的较短任务,加速效果较小,因为该方法主要加速的是答案生成阶段而非推理阶段。
该研究还探讨了当模型被要求进行不同长度的思考时,该方法的表现如何。他们发现,最佳结果来自于在模型完成实质性部分的推理后开始生成草稿,以确保草稿是基于足够的上下文来保证准确性的。他们还开发了一个该方法的迭代版本,可以在推理过程中的多个点更新草稿,从而允许系统随着模型思考的深入而不断完善其预测。这种方法确保了即使早期草稿并不完美,后期的草稿也可以在其基础上进行构建,从而保持较高的成功率。
最终,这项工作表明,推理过程本身的结构本身就可以作为加速人工智能的一种资源。通过将模型的自身中间想法视为预测来源,研究人员创造了一种能够以显著减少等待时间的方式,来交付高质量、经过推理的答案。该方法对于对速度要求极高的交互式应用特别有价值,证明了可以在不损害解决方案质量的前提下,兼顾深度思考与快速响应。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。