想象你有一位才华横溢但过度热情的学生(即人工智能),他正试图解决一道数学题。当你问他一个简单的问题,比如“2+2 等于多少?”时,他不仅仅回答"4",而是会写出一篇 50 页的长文,阐述数字的历史、加法的概念以及数字 2 为何特殊,最后才圈出答案"4"。
这被称为**思维链(Chain-of-Thought, CoT)**推理。它有助于人工智能得出正确答案,但速度极慢且成本极高,因为人工智能在“过度思考”,生成了过多的词(token)。
本文介绍了一种名为Extra-CoT的新系统来解决这一问题。可以将其想象为一个三步训练计划,旨在教导这位过度热情的学生如何在保持聪明的同时变得简洁。
现有“编辑”的问题
在这篇论文之前,研究人员曾尝试使用“编辑”来削减学生冗长的文章。这些编辑只是随机地或基于简单规则删减文字。
- 类比:想象一位编辑删掉了一句话:“根号 109 约等于 10.44。”如果他将这句话从中切断,你可能会得到“根号 10……",这毫无意义。
- 结果:当这些编辑试图将文章压缩到极小的规模(例如原长度的 20%)时,学生的答案变得一团糟。逻辑分崩离析,因为“关键步骤”被切碎了。
Extra-CoT 解决方案:三步训练营
作者提出了一种新方法,将学生与编辑区别对待。
第一步:“精通数学”的编辑(压缩器)
首先,他们训练了一位特殊的编辑,他对数学公式的理解胜过任何人。
- 工作原理:这位编辑不再仅仅关注单词,而是将整个数学公式(例如 x2+12x=73)视为一个不可分割的“块”。他们知道,如果将公式切断,整个公式就会失效。
- 类比:想象一位图书管理员知道某本书的特定章节是解开谜团的“线索”。如果图书馆需要缩减规模,他们不会撕掉该章节的页面,而是会保留整个章节的完整性,只删掉周围枯燥的描述。
- 目标:这创造了一种“黄金标准”的简略答案,它们在逻辑上依然完美无缺。
第二步:“混合模式”课堂(SFT)
接下来,他们教导主要的人工智能学生遵循这位新编辑的指令。
- 工作原理:他们向学生展示示例,编辑会说“保留 80% 的文本”,然后是“保留 60%",接着是“保留 20%"。
- 类比:这就像教练训练运动员跑不同的距离。运动员明白,当教练喊“短跑冲刺!”时,他们不会停止奔跑,而是针对该特定距离进行高效奔跑。这教会了人工智能服从不同的“词汇预算”。
第三步:“敢于冒险”的教练(CHRPO)
最后,他们使用一种特殊的奖励系统(强化学习)来推动学生变得更加高效。
- 问题:学生害怕过于简短,因为可能会答错。
- 解决方案:教练(CHRPO)如果学生答对了且使用的词汇极少,就会给予巨额奖励。但是,如果学生试图过于简短而答错了,惩罚将是巨大的。
- 类比:想象一个游戏节目,如果你在 10 秒内解开了谜题,就能获得奖品。如果你在 5 秒内解开,你将获得双倍奖品。但如果你匆忙行事而答错,你将失去一切。这鼓励人工智能找到既超快又准确的“最佳平衡点”。
结果
该论文在困难的数学问题(如高中竞赛中的题目)上测试了这一系统。
- 胜利:新系统(Extra-CoT)能够将人工智能生成的词汇量减少73%(降至原长度的 27%),同时实际上比之前答对了更多的问题。
- 对比:旧方法(如"TokenSkip")在被要求如此简短时就会崩溃。它们要么拒绝执行指令,要么给出错误答案。Extra-CoT 即使在极端限制下也能保持冷静和准确。
- 速度:由于人工智能写的东西少得多,其实时解题速度提高了3 倍。
总结
简而言之,Extra-CoT是一个教导人工智能停止“过度思考”的系统。它使用一位尊重数学公式的智能编辑,训练人工智能遵循严格的词汇限制,并奖励其既快速又准确。其结果是,人工智能能够使用过去所需计算能力和时间的一小部分来解决复杂的逻辑谜题。
技术摘要:Extra-CoT
问题陈述
大型语言推理模型(LRMs)通过生成逐步的思维链(CoT)推理,展现了在复杂逻辑推理方面的卓越能力。然而,这种性能是以巨大的计算成本为代价的,往往导致“过度思考”,即模型即使在简单查询中也会生成冗余的推理路径。虽然现有的 CoT 压缩方法(如 TokenSkip、CTS)能够在中等压缩率(50–60%)下有效剪枝 token,但在极端压缩率(如 20–30%)下,它们会遭遇致命的“保真度灾难”。在这些水平上,通用压缩器无法保留稀疏的关键推理步骤和数学完整性,导致逻辑保真度灾难性丧失和性能显著下降。核心挑战在于,在不牺牲答案准确性的前提下,在超低 token 预算下实现高保真推理。
方法论:Extra-CoT 框架
作者提出了Extra-CoT,这是一个新颖的三阶段框架,旨在在保持高准确度推理的同时,突破 CoT 效率的边界。该流程集成了语义压缩器、混合比率监督微调(SFT)以及一种专门的强化学习(RL)算法。
1. 语义保持、问题感知的压缩器
为了生成用于极端压缩的可靠监督数据,作者在数学 CoT 数据上训练了一个专用压缩器。
- 架构:基于 Longformer-large-4096,该模型利用输入问题中所有 token 的全局注意力,使压缩器具备“问题感知”能力。这使得每个推理 token 都能直接关注问题上下文。
- 标注策略:训练数据经过独特的基于索引、公式感知的标注过程。数学表达式和 LaTeX 实体被折叠为原子单元,以防止碎片化。教师模型(GPT-4o)被提示仅返回需要保留的索引集合,从而确保对渲染变化的鲁棒性。
- 目标:压缩器使用类别加权的 Focal Loss 进行训练,以预测保留或丢弃每个 token,优先保障数学完整性的保留。
2. 混合比率监督微调(SFT)
一个推理大语言模型在高质量压缩数据上进行微调,以学习鲁棒的可控性。
- 控制词表:分词器增加了特殊的控制 token(例如
<COMP 20>、<COMP 40>、...、<COMP POLICY>)。
- 两阶段数据队列:
- 固定比率队列:训练模型严格遵循特定的压缩指令(例如
<COMP 40>),在一系列预算范围内建立鲁棒的可控性。
- 策略预热队列:训练模型在给定
<COMP POLICY> 触发器时自主预测比率 token,为后续的 RL 阶段建立可训练的机制。
- 目标:此阶段为 RL 提供稳定的初始化,教导模型遵循一系列压缩预算,而不仅仅是单一目标。
3. 约束与分层比率策略优化(CHRPO)
为了明确激励选择更低预算同时保持准确性,作者引入了CHRPO,一种分层强化学习算法。
- 教师预算选择:对于每个查询,确定一个“教师预算”(r∗),即 SFT 模型仍能产生正确答案的最小比率,确保 RL 目标是可实现的。
- 分层奖励结构:
- 主奖励(Rmain):应用于整个序列,整合了四个组成部分:准确性、比率优化模式(奖励成功缩短,惩罚失败)、预算校准(确保实现的比率与选定的比率匹配)以及推理完整性(惩罚缺失的推理块)。
- 控制头奖励(Rctrl):仅应用于第一个 token(即比率选择 token)。这为塑造策略的决策提供了即时的梯度信号,解决了最终准确性信号与初始比率选择之间距离过远的信用分配问题。
- 风险敏感塑形:奖励函数采用非对称惩罚,以确保策略仅在正确时进行缩短(“安全缩短”),并倾向于在困难实例上增加预算而非失败(“快速失败恢复”)。
主要贡献
- Extra-CoT 框架:一个新颖的三阶段流程(压缩器 → 混合比率 SFT → CHRPO),在超低 token 预算下实现高保真推理,有效缓解了语义保持和控制遵循方面的挑战。
- 语义保持压缩器:一种具备公式感知标注的问题感知架构,生成高保真监督数据,保留数学完整性,防止符号推理组件的碎片化。
- 统一 SFT-RL 流程:一种训练策略,利用混合比率 SFT 建立鲁棒的可控性,随后通过带有分层奖励的 CHRPO 明确激励在极端压缩比率下的准确性。
实验结果
该框架在三个数学推理基准测试上进行了评估:GSM8K、MATH-500 和 AMC2023,主要使用 Qwen3-1.7B 作为骨干模型。
- 极端比率下的性能:在 MATH-500 上,Extra-CoT 实现了 73% 的 token 减少(0.27 实际比率),准确率比基线模型提高了 0.6%,显著优于 TokenSkip 等最先进方法。在 0.2 的目标比率下,Extra-CoT 保持了稳健的性能(MATH-500 准确率为 47.8%),而 TokenSkip 则遭受灾难性下降至 23.4%。
- 控制遵循:与表现出“控制崩溃”(即实现的比率与目标显著偏离)的基线方法不同,Extra-CoT 在所有比率下都表现出对压缩指令的精确遵循。
- 效率:在端到端推理延迟测试中,与基线模型相比,Extra-CoT 在 GSM8K 上降低了 3.24 倍 的延迟,在 MATH-500 上降低了 2.35 倍。相比之下,TokenSkip 在某些基准测试上仅显示出边际增益,甚至增加了延迟。
- 泛化性:该方法在不同骨干模型(Qwen2.5-7B、Llama3.2-3B)和长上下文设置(16K 上下文的 Pangu-Embedded-7B-V1.1)中均表现出鲁棒性,证实了改进源于压缩监督的质量,而非特定的模型架构。
意义与主张
本文主张,Extra-CoT 证明了高保真极端压缩是实现高效推理的一条可行路径。通过通过语义保持的监督和高阶 RL 优化来解决“保真度灾难”,该框架使大型语言推理模型能够在超低 token 预算下有效运行,而不会出现现有方法中看到的性能崩溃。这项工作强调,即使在 token 数量大幅减少的情况下,保留推理链的逻辑完整性对于维持问题解决能力也至关重要。作者提供了其代码,以促进该方向的进一步研究。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。