想象一下,你有一个才华横溢但过于啰嗦的学生正在尝试解决一道数学题。这个学生代表现代大型语言模型(LLM),非常擅长得出正确答案,但他们经常“过度思考”。他们可能会为了求解一个简单的方程而写一篇 50 页的论文,重复同样的步骤三次,在中间胡言乱语,或者在已经找到答案后继续长篇大论。
这篇论文介绍了一种名为CLORE(推理效率的内容级优化)的新方法来解决这个问题。以下是通过简单类比对其工作原理的解释:
问题:那个“过度思考”的学生
当前的 AI 模型被训练为得出正确答案。如果学生答对了,老师(训练系统)就会说:“干得好!”并给予奖励。
然而,老师并不关心学生是如何得出答案的。
- 问题所在:学生可能会写出完美的解答,但随后又添加了 10 页的废话,重复同一句话 50 次,或者在答案已经框定后继续书写。
- 结果:AI 将时间和计算资源(token)浪费在“废话”上。现有的方法试图通过简单地告诉学生“写满 500 字后停止”来解决这个问题。但这就像一位严厉的编辑只是切掉了文章的结尾;它并没有解决文章中间充满了重复性废话的事实。
解决方案:CLORE(“智能编辑”)
CLORE 改变了游戏规则。它不再仅仅计算字数,而是审视思维的质量。
将 CLORE 想象成一位与学生并肩工作的智能编辑。以下是其流程:
- 草稿:学生(AI)解决一个问题。如果答错了,CLORE 会忽略它。如果答对了,CLORE 就会介入。
- 编辑:智能编辑阅读正确的解答并问道:“这部分有必要吗?这部分只是在重复吗?这部分是胡言乱语吗?”
- 类比:想象学生写了一段话:“我需要把 2 和 2 相加。2 加 2 等于 4。所以,2+2=4。总和是 4。”编辑会划掉重复部分,只留下"2+2=4"。
- 类比:如果学生写了一整段与其数学推导相矛盾的代码,编辑就会删除这段代码。
- 教学:编辑创建两个版本:原始版(冗长、杂乱但正确)和增强版(简短、干净且正确)。
- 训练:随后,AI 被教导去偏好增强版。它学会了:“嘿,我可以得到同样的正确答案,但如果我写得更简洁、没有废话,我会获得更好的奖励。”
为何这与众不同
大多数其他方法就像计时器。它们会说:“你有一分钟时间解决这个问题。”如果你在 30 秒内完成,很好。如果你在 59 秒内完成,也很好。但它们无法阻止你浪费其中 50 秒盯着天花板发呆。
CLORE 则像一位内容教练。它说:“你在 59 秒内解决了问题,但其中 40 秒是你自己在重复。下次,让我们试着通过删减重复内容,在 20 秒内解决这个问题。”
结果
该论文在数学问题(如高中竞赛和奥林匹克竞赛)上测试了这种方法。他们发现:
- 更短的答案:AI 开始写出更简短的解释。
- 相同的准确率:AI 的数学能力没有下降;它仍然能得出正确答案。
- 更少的“废话”:AI 不再写重复的循环、胡言乱语,或在找到答案后继续思考。
- 更高的效率:由于 AI 写得更少,它使用的计算资源更少,运行速度也更快。
一句话总结
CLORE 教导 AI 模型成为简洁的思考者。它不仅仅是强迫它们变短;而是教导它们识别并删除自己的“思维杂音”(重复、废话和过度思考),同时保留真正解决问题的聪明部分。其结果是一个思考更快、能耗更低,且仍能得出正确答案的 AI。
技术摘要:CLORE——面向推理效率的内容级优化
问题陈述
大型语言模型(LLM)的最新进展,特别是那些利用强化学习(RL)进行后训练的模型(如 OpenAI o1、DeepSeek-R1),已在数学问题解决等多步推理任务中展现出卓越能力。这些系统倾向于激励生成长链式思维(CoT)轨迹。然而,本文指出,过长的推理轨迹往往遭受“过度思考”的困扰,其特征是三种低质量内容的特定模式:
- 重复推理片段:在没有新进展的情况下,冗余地重新访问等效的中间状态。
- 难以辨认或与任务无关的内容:语义不连贯、损坏或脱节的文本,降低了可解释性。
- 多余的探索:在正确解决方案已被确定后继续进行的推理。
现有的高效推理方法主要通过长度级控制来解决这一问题,例如强制执行明确的 token 预算或设计长度感知奖励。作者认为,这些方法依赖于粗略的序列级信号,仅能调节生成推理的数量,却未能监督生成推理的内容。因此,它们使得中间推理内容处于弱监督状态,导致低效用、难以辨认或无贡献的片段持续存在,并可能破坏 RL 训练动态的稳定性。
方法论:CLORE 框架
本文提出了CLORE(面向推理效率的内容级优化),这是一个通过编辑正确推理轨迹的内容而不仅仅是约束其长度来优化推理效率的框架。
核心工作流程
- ** rollout 生成**:策略模型 πθ 为给定提示 x 采样多条推理轨迹 τ。
- 正确轨迹选择:该框架将增强限制在最终答案正确的轨迹上(R(x,τ)=1)。这确保了基础数据中包含的低质量推理少于错误轨迹,并使增强后的数据更接近策略分布。
- 推理增强:外部增强模型(充当编辑器的 LLM)处理正确的轨迹。它被指示执行以下操作:
- 删除重复的推理片段。
- 移除难以辨认或与任务无关的内容。
- 截断解决方案确立后发生的多余探索。
- 约束:编辑器不得重写、改写或重新排序内容;它仅执行删除操作,以保留原始结构和解决方案的有效性。
- 偏好对构建:结果是一对轨迹 (τ,τ~),其中 τ~ 是经过编辑的更简洁版本。基于推理质量(而非答案正确性,因为两者均正确)建立偏好,即 τ~≻τ。
- 训练目标:策略使用混合目标进行训练,结合:
- 标准策略梯度(PG):优化基础轨迹(例如 GRPO、DAPO)。
- 无参考 DPO:应用于 (τ,τ~) 对的辅助直接偏好优化(DPO)目标。损失函数表述为:
LDPO=−logσ(β[logπθ(τ~∣x)−logπθ(τ∣x)])
与标准 DPO 不同,该公式不需要显式的参考策略。作者认为,由于 τ~ 是通过对 τ 进行局部删除派生而来,它在结构上仍接近于策略内分布,从而隐式地约束了偏差。
兼容性
CLORE 被设计为与底层 RL 骨干无关。它可以通过将 DPO 项添加到现有损失函数中,与各种策略梯度方法(PPO、GRPO、REINFORCE)以及现有的基于长度的高效推理方法(如 ThinkPrune、Training Efficient)集成。
主要贡献
- 内容级优化框架:CLORE 将重点从序列级长度控制转移到内容级监督。它明确针对并移除低质量推理组件(重复、难以辨认、答案后噪声),同时保留最终答案。
- 增强 - 原始偏好学习:该方法引入了一种机制,通过无参考 DPO 目标利用增强 - 原始对来训练策略,减轻了通常与事后编辑相关的策略外不匹配问题。
- 实证验证:该框架在五个数学推理基准(OlympiadBench、Minerva、MATH500、AMC2023、AIME2025)上对 DeepSeek-R1-Distill-Qwen-7B 和 Qwen2.5-Math-7B 进行了评估。
- 互补性证明:本文证明 CLORE 并非长度级控制的替代品,而是一个互补层,当与现有方法结合时,可改善精度 - 效率权衡。
实验结果
- 精度 - 效率权衡:CLORE 在所有测试基线(GRPO、DAPO、Training Efficient、ThinkPrune)上均一致提高了精度 - 效率(AE)分数。
- 在 DeepSeek-R1-Distill-Qwen-7B 上,应用 CLORE 使各基准的平均 AE 分数提高了约 0.4。
- 在 Qwen2.5-Math-7B 上,改进更为显著,平均 AE 增益通常超过 1.0,且在应用于 GRPO 时,Minerva 基准的具体增益超过 6 分。
- 长度缩减:CLORE 显著减少了输出 token 数量(DeepSeek 上为 20–30%,Qwen 上为 30–50%),且未导致系统性精度崩溃。
- 内容分析:
- 重复:CLORE 减少了局部 n-gram 重复和最长重复片段。
- 难以辨认性:它大幅降低了难以辨认或与任务无关内容的比率(通过 LLM-as-a-judge 测量)。
- 答案后探索:它有效抑制了在找到解决方案后继续进行的推理。
- 消融研究:
- DPO 权重:适度的 DPO 权重(λ)在长度缩减和精度保留之间提供了最佳平衡。
- 增强模型:即使使用较小的增强模型(Qwen3-1.7B),该方法仍然有效,尽管使用更强的模型(Qwen3-4B)会产生稍好的结果。
意义与主张
本文主张,高效推理需要双重优化:控制推理的数量(长度)和监督推理的质量(内容)。
- 超越长度控制:作者认为,简单地最小化长度或强制执行预算是不够的,因为它无法区分高价值推理和冗余噪声。CLORE 解决了标准 RL 训练中固有的中间内容“弱监督”问题。
- 稳定优化:通过将增强限制在正确轨迹上并使用局部删除,CLORE 使编辑后的 rollout 保持接近策略分布,减轻了通常困扰事后编辑方法的策略外不匹配问题。
- 通用适用性:该框架被提出作为对现有基于 RL 的推理训练管道的通用增强,能够通过减少来自低质量 token 的噪声梯度来提高训练效率,并通过生成更简洁、更密集的推理轨迹来提高推理效率。
作者总结道,虽然长度级控制调节生成推理的数量,但内容级监督(如 CLORE 所提供)对于确定哪些推理内容具有信息量且值得保留是必要的。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。