← 最新论文
🤖 machine learning

Towards Efficient Large Language Reasoning Models via Extreme-Ratio Chain-of-Thought Compression

本文介绍了 Extra-CoT,这是一个新颖的框架,通过结合语义保持的压缩器、混合比例监督微调以及约束分层比例策略优化(CHRPO)策略,在最小化准确率损失的同时实现极致的思维链压缩,从而赋能大语言模型进行高效且高保真的推理。

原作者: Yuntian Tang, Bohan Jia, Wenxuan Huang, Lianyue Zhang, Jiao Xie, Wenxi Li, Wei Li, Jie Hu, Xinghao Chen Rongrong Ji, Shaohui Lin

发布于 2026-05-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuntian Tang, Bohan Jia, Wenxuan Huang, Lianyue Zhang, Jiao Xie, Wenxi Li, Wei Li, Jie Hu, Xinghao Chen Rongrong Ji, Shaohui Lin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你有一位才华横溢但过度热情的学生(即人工智能),他正试图解决一道数学题。当你问他一个简单的问题,比如“2+2 等于多少?”时,他不仅仅回答"4",而是会写出一篇 50 页的长文,阐述数字的历史、加法的概念以及数字 2 为何特殊,最后才圈出答案"4"。

这被称为**思维链(Chain-of-Thought, CoT)**推理。它有助于人工智能得出正确答案,但速度极慢且成本极高,因为人工智能在“过度思考”,生成了过多的词(token)。

本文介绍了一种名为Extra-CoT的新系统来解决这一问题。可以将其想象为一个三步训练计划,旨在教导这位过度热情的学生如何在保持聪明的同时变得简洁。

现有“编辑”的问题

在这篇论文之前,研究人员曾尝试使用“编辑”来削减学生冗长的文章。这些编辑只是随机地或基于简单规则删减文字。

  • 类比:想象一位编辑删掉了一句话:“根号 109 约等于 10.44。”如果他将这句话从中切断,你可能会得到“根号 10……",这毫无意义。
  • 结果:当这些编辑试图将文章压缩到极小的规模(例如原长度的 20%)时,学生的答案变得一团糟。逻辑分崩离析,因为“关键步骤”被切碎了。

Extra-CoT 解决方案:三步训练营

作者提出了一种新方法,将学生与编辑区别对待。

第一步:“精通数学”的编辑(压缩器)

首先,他们训练了一位特殊的编辑,他对数学公式的理解胜过任何人。

  • 工作原理:这位编辑不再仅仅关注单词,而是将整个数学公式(例如 x2+12x=73x^2 + 12x = 73)视为一个不可分割的“块”。他们知道,如果将公式切断,整个公式就会失效。
  • 类比:想象一位图书管理员知道某本书的特定章节是解开谜团的“线索”。如果图书馆需要缩减规模,他们不会撕掉该章节的页面,而是会保留整个章节的完整性,只删掉周围枯燥的描述。
  • 目标:这创造了一种“黄金标准”的简略答案,它们在逻辑上依然完美无缺。

第二步:“混合模式”课堂(SFT)

接下来,他们教导主要的人工智能学生遵循这位新编辑的指令。

  • 工作原理:他们向学生展示示例,编辑会说“保留 80% 的文本”,然后是“保留 60%",接着是“保留 20%"。
  • 类比:这就像教练训练运动员跑不同的距离。运动员明白,当教练喊“短跑冲刺!”时,他们不会停止奔跑,而是针对该特定距离进行高效奔跑。这教会了人工智能服从不同的“词汇预算”。

第三步:“敢于冒险”的教练(CHRPO)

最后,他们使用一种特殊的奖励系统(强化学习)来推动学生变得更加高效。

  • 问题:学生害怕过于简短,因为可能会答错。
  • 解决方案:教练(CHRPO)如果学生答对了且使用的词汇极少,就会给予巨额奖励。但是,如果学生试图过于简短而答错了,惩罚将是巨大的。
  • 类比:想象一个游戏节目,如果你在 10 秒内解开了谜题,就能获得奖品。如果你在 5 秒内解开,你将获得双倍奖品。但如果你匆忙行事而答错,你将失去一切。这鼓励人工智能找到既超快又准确的“最佳平衡点”。

结果

该论文在困难的数学问题(如高中竞赛中的题目)上测试了这一系统。

  • 胜利:新系统(Extra-CoT)能够将人工智能生成的词汇量减少73%(降至原长度的 27%),同时实际上比之前答对了更多的问题。
  • 对比:旧方法(如"TokenSkip")在被要求如此简短时就会崩溃。它们要么拒绝执行指令,要么给出错误答案。Extra-CoT 即使在极端限制下也能保持冷静和准确。
  • 速度:由于人工智能写的东西少得多,其实时解题速度提高了3 倍

总结

简而言之,Extra-CoT是一个教导人工智能停止“过度思考”的系统。它使用一位尊重数学公式的智能编辑,训练人工智能遵循严格的词汇限制,并奖励其既快速又准确。其结果是,人工智能能够使用过去所需计算能力和时间的一小部分来解决复杂的逻辑谜题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →