ChainPrune: Evaluating and Reducing Redundancy in Long Chain-of-Thought Reasoning
本文介绍了 ChainPrune,一种通过将自生成的路径整合为树状结构进行多标准选择,并应用基于 DPO 的偏好学习,从而优化长思维链(Chain-of-Thought)推理的新颖方法,该方法在保持或提高准确性的同时,有效地减少了冗余和计算开销。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
大语言模型在解决复杂问题方面已经变得非常出色,但它们解决问题的方式往往让人感觉像是在看某人在对一个简单的决定过度思考。当这些人工智能系统被要求解决数学问题或编写代码时,它们经常在得出答案之前生成一段冗长、迂回的思维过程。这种被称为“思维链”(chain-of-thought)推理的过程,模仿了人类将困难任务分解为较小步骤的方式。虽然这种方法提高了人工智能的准确性,但一个新问题出现了:模型思考得太多了。它们产生过多的文本,重复自身,进行不必要的检查,并且采取的步骤远超所需。这种“过度思考”浪费了计算能力并减慢了系统的速度,使其在实际应用中变得不够实用。研究人员现在正试图教会这些模型如何在不丧失深度思考能力的情况下做到简洁。
一个研究小组开发了一种名为 ChainPrune 的新方法来解决这种过度思考的问题。他们发现,仅仅告诉模型使用更少的词汇往往会适得其反。当模型仅因文本短促而获得奖励时,它们往往会将逻辑切碎成细小、破碎的片段。这造成了一种情况:总字数虽然低,但步骤数量仍然很高,导致推理路径变得漫长且低效。研究人员称之为“伪简洁”(pseudo-conciseness)。这就像是为了节省时间而迈出极小、极快的步伐;你可能每秒迈出的步数减少了,但你最终走过的路程依然很长。他们意识到,目标是同时减少词数和步骤数,确保推理保持清晰且符合逻辑。
为了实现这一目标,研究人员构建了一个将模型的思维视为分支树的系统。当模型针对同一个问题生成多种不同的解决方法时,该系统会寻找那些含义相同、即使表述方式不同的步骤。例如,如果一条路径说“将一百加到总数中”,而另一条路径说“将总和增加一百”,系统会将这些识别为相同的动作。随后,系统将这些重复的步骤合并为一个单一、干净的节点,从而有效地修剪掉树中的冗余分支。这个过程创建了一张精简的推理地图,既保留了所有必要的逻辑,又消除了重复。
一旦系统拥有了这条精简后的地图,它就会选择最佳版本的推理路径。它不仅仅是选择最短的一条;它寻找的是既在词数上短、又在步骤上短,同时仍然正确的路径。如果一条路径过长或包含错误,它就会被丢弃。研究人员随后利用这些高质量、高效的数据对模型进行重新训练。他们结合了一种教导模型偏好更好答案的方法,以及一种确保模型在努力追求简洁时不会丧失正确推理能力的技术。这种训练帮助模型学习生成自然简洁且有结构的思维,而不是仅仅从长句子中删减词语。
训练结果非常显著。在测试困难的数学问题和编程挑战时,经过 ChainPrune 训练的模型在准确度上与之前持平,但解决问题所付出的努力却大幅减少。研究人员发现,这些模型减少了近 27% 的推理步骤,并削减了超过 28% 的总文本量。更重要的是,思考的质量得到了提升。模型产生的逻辑错误更少了,停止了不必要的自我反思,并且与未经训练的版本相比,减少了 60% 以上的冗余步骤。这表明,通过关注推理的结构而非仅仅是文本的长度,可以使人工智能在变得更聪明的同时也变得更高效。
这项研究还强调了以往让 AI 变快的方法中存在的一个关键缺陷。许多早期方法试图通过惩罚使用过多词汇的行为来强迫模型变短。研究人员表明,这种方法通常会导致“伪简洁”问题,即模型看起来很短,但实际上效率低下。相比之下,ChainPrune 证明了真正的效率来自于理解步骤的含义并移除重复项,而非仅仅是统计词数。这一发现为开发能够深度思考而不陷入不必要细节的 AI 系统提供了更清晰的路径,使其在对速度和清晰度有要求的日常任务中更加有用。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。