Learning When to Think: Adaptive Reasoning for Test-Time Compute Allocation
本文介绍了一种训练推理语言模型的方法,通过组相对策略优化(Group Relative Policy Optimization)学习在“无思考”(NoThink)、“短思考”(Short)和“长思考”(Long)推理模式之间进行选择,从而实现测试时计算资源的自适应分配,在保持或提高各种基准测试准确性的同时,实现了显著的 Token 减少。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
大语言模型在解决复杂问题方面已变得异常出色,它们通常通过将问题分解为一系列冗长的中间步骤来完成,就像人类在纸上演算一道难题一样。这种被称为“思维链推理”的逐步处理方法,使得这些系统在处理数学和编程任务时能够达到极高的准确度。然而,这种能力也带来了显著的代价:模型生成的文本往往远超实际需要,消耗了大量的计算能力和时间。即使面对一个简单的问题,模型也可能生成冗长且啰嗦的解释,在一些可以瞬间解决的任务上浪费资源。研究人员长期以来一直怀疑,这些系统缺乏判断特定问题究竟需要多少精力的能力,导致出现简单问题也受到同样重度处理的情况。
阿姆斯特丹自由大学的一个研究小组致力于教导模型进行这种自我判断。他们使用了一个参数量相对较小的推理模型(包含15亿参数),该模型此前已接受过数学问题的训练。研究人员并没有强制模型始终进行固定时长的思考,而是在其回答的最开始提供了一个简单的选择:它可以决定是立即回答而不进行思考、进行简短推理,还是进行深入且长时间的推理。该模型是通过一种称为强化学习的方法进行训练的,即根据其答案是否正确以及到达正确答案的效率高低来接收反馈。其目标是观察模型是否能学会根据问题的难度来匹配其投入的精力,从而在处理简单任务时节省时间,同时在解决难题时投入足够的资源。
研究人员设计了一个系统,让模型在输出第一个 token 时发出一个单词,以表明其选择的运行模式。如果模型选择“NoThink”(不思考),它会尝试直接回答。如果选择“Short”(短),它被允许生成一段简短的解释,但对字数有严格限制。如果选择“Long”(长),则允许其进行长篇幅的推理而没有上限。为了确保模型确实遵循了这些选择,研究人员对较短模式下的响应长度施加了硬性限制。如果模型选择了“Short”模式却写过了限制长度,系统就会将其判定为错误,无论最终答案是否正确。这迫使模型学习到,它在开头所做的选择会对其实际行为产生后果。
为了防止模型仅仅忽略选择并总是默认选择最长、最稳妥的选项,研究人员调整了它获得的奖励机制。他们让“NoThink”和“Short”模式在回答极短时获得更高的奖励,而“Long”模式则提供稳定的奖励,无论长度如何。这创造了一个取决于问题的策略环境:对于一个微不足道的问题,最快的回答能获得最高分;而对于一个困难的问题,则需要通过“Long”模式的延伸努力才能成功。他们还加入了一种平衡机制,温和地引导模型使用所有三种选项,以确保模型不会退化到对每个问题都只使用单一策略。
结果显示,该模型成功学会了按难度对问题进行分类。在一组由500个留存数学问题组成的测试集中,模型开始将简单问题路由至“NoThink”或“Short”模式,并将难题路由至“Long”模式。在整个训练过程中,模型的准确率与原始未修改版本几乎完全一致,但其平均响应长度显著下降。研究人员发现,新策略减少了41%的平均生成词数,将响应长度从近4,800个 token 降低到了约2,800个。这意味着模型在解决相同数量正确问题的同时,使用的计算量不到原来的一半。
至关重要的是,这种效率提升并未以牺牲模型在处理从未见过的题目时的性能为代价。当测试一组不同的初等数学应用题时,模型节省了更多的文本量,token 数量减少了76%,同时保持了高准确度。在处理几乎都需要深度推理的极难竞赛数学题时,模型几乎对每个问题都正确选择了“Long”模式,其表现与基准模型相当,且没有在走捷径上浪费时间。这项研究表明,推理模型可以经过训练来实现自我调节精力,仅在问题需要时才分配更多的思考时间。这为提高人工智能的效率指明了一条路径,使系统能够既聪明又节约,而非仅仅是冗长啰嗦。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。