Funnel of Thoughts: Efficient Test-Time Scaling via Early Voting and Rollout Pruning
本文介绍了思维漏斗(Funnel of Thoughts, FoT),这是一种无需训练的推理方法,它通过基于词汇犹豫标记(lexical hesitation markers)及早剪枝无效的推理轨迹,在保持全样本投票准确性的同时,显著降低了大语言推理模型的计算成本和延迟。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
现代人工智能已经达到了这样一个水平:其最强大的推理模型不再仅仅针对一个难题给出一个单一的答案。相反,它们会生成长而曲折的思维链,在得出最终结论之前探索多条路径。这一过程模拟了人类的审慎思考,但也引入了一个独特的挑战:当被重复询问同一个问题时,这些模型往往会产生不同且有时相互矛盾的答案。为了确保可靠性,工程师们采用了一种策略,即要求模型生成许多不同的尝试(或称为“采样路径”),然后从中选择出现频率最高的答案。这种被称为“多数投票”的方法显著提高了处理复杂任务(如高级数学)时的准确性。然而,这也付出了沉重的代价。由于这些推理链可以延伸至数千字,同时运行数十条这样的路径会消耗大量的计算资源。随着链条变长,成本迅速增长,这意味着整个过程中最昂贵的部分往往是最后阶段——此时模型可能正陷入不必要的自我修正或犹豫不决的循环之中。
来自韩国高丽大学的一个研究小组开发了一种名为“思维漏斗”(Funnel of Thoughts)的新方法,旨在解决这种低效问题而不牺牲准确性。他们的工作针对了一个特定的问题:在三十二个不同的推理尝试中,往往有少数尝试是徒劳无功的。这些特定的尝试倾向于陷入重复的循环,无休止地质疑自己的逻辑,或者陷入“无答案”的状态,同时消耗了绝大部分的计算资源。研究人员发现,这些失败的尝试会通过其生成的文本展现出一种简单且可观察的模式。它们频繁使用特定的犹豫标记——例如“等等”、“实际上”、“也许”或“让我重新考虑”之类的词汇和短语。通过统计这些标记出现的频率,系统可以在推理路径结束前很久,就识别出哪些路径很可能会失败。
这种新方法的工作原理是像以前一样并行运行三十二个尝试,但引入了一个逐渐收窄领域的“漏斗”。在特定的检查点,系统会检查两件事。首先,如果某个尝试已经产生了一个清晰的最终答案,它会被立即保存到一个安全的库中,系统也会停止为该特定尝试生成文本。这既保留了成功路径的投票权,又不会浪费进一步的能量。其次,对于仍在运行的尝试,系统会计算那些犹豫标记的密度。如果某个尝试充满了不确定性的迹象,它就会被提前“剪枝”或切断。这使得系统能够丢弃那些浪费资源的、螺旋式下降的路径,同时保留那些可能导向正确解决方案的有生产力的路径。
该方法的成果是显著的。通过使用这种方法,研究人员能够将计算成本(以模型所需的注意力操作次数衡量)降低近一半。在单块高性能显卡的实际测试中,这意味着处理时间减少了超过百分之三十七。至关重要的是,这种效率并没有以牺牲准确性为代价。该方法保持了与传统运行全部三十二个尝试直至完成的方法相同的准确水平。事实上,在一些困难的问题上,新方法甚至提高了最终结果。这是因为传统方法有时会允许一些徒劳的、重复性的尝试占据主导地位,仅仅因为它们是唯一完成的路径,而新方法则通过及早移除这些干扰,让正确的答案更清晰地显现出来。
研究人员在六种不同的主流推理模型以及各种具有挑战性的数学基准测试中测试了这项技术。他们发现,犹豫标记的信号在所有模型中都是一致的,无论其内部架构或规模如何。该方法在应用于数学之外的任务(如回答复杂的科学问题或生成代码)时也表现出了鲁棒性,只要系统能够识别何时达到了最终答案即可。核心洞察在于,系统不需要理解推理的内容也能知道何时停止;它只需要识别出犹豫不决的模式。这使得该方法无需任何额外的训练或复杂的外部工具即可运行,完全依赖于模型本身正在生成的文本。
这项工作表明,人工智能推理中最昂贵的部分往往也是生产力最低的部分。通过学会识别模型陷入困境的早期迹象,我们可以阻止它在无法带来结果的路径上浪费资源。“思维漏斗”证明了,我们可以在保持系统智能程度不变的同时,使其运行得更快、更便宜。它为扩展先进推理模型的使用提供了一种切实可行的方法,使这些模型在对速度和成本至关重要的实际应用场景中更具生命力。研究结果表明,未来高效人工智能的突破口可能不在于构建更大的模型,而在于如何更聪明地管理我们现有的模型。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。