← 最新论文
💻 computer science

CLORE: Content-Level Optimization for Reasoning Efficiency

CLORE 是一个内容级优化框架,它通过利用外部增强模型对正确的推理轨迹进行编辑和修剪,以去除重复或无关的内容,从而在不依赖显式长度预算的情况下提升大语言模型的推理效率,进而改善准确性与效率之间的权衡。

原作者: Yuyang Wu, Qiyao Xue, Guanxing Lu, Weichen Liu, Zihan Wang, Manling Li, Olexandr Isayev

发布于 2026-05-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuyang Wu, Qiyao Xue, Guanxing Lu, Weichen Liu, Zihan Wang, Manling Li, Olexandr Isayev

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个才华横溢但过于啰嗦的学生正在尝试解决一道数学题。这个学生代表现代大型语言模型(LLM),非常擅长得出正确答案,但他们经常“过度思考”。他们可能会为了求解一个简单的方程而写一篇 50 页的论文,重复同样的步骤三次,在中间胡言乱语,或者在已经找到答案后继续长篇大论。

这篇论文介绍了一种名为CLORE(推理效率的内容级优化)的新方法来解决这个问题。以下是通过简单类比对其工作原理的解释:

问题:那个“过度思考”的学生

当前的 AI 模型被训练为得出正确答案。如果学生答对了,老师(训练系统)就会说:“干得好!”并给予奖励。

然而,老师并不关心学生是如何得出答案的。

  • 问题所在:学生可能会写出完美的解答,但随后又添加了 10 页的废话,重复同一句话 50 次,或者在答案已经框定后继续书写。
  • 结果:AI 将时间和计算资源(token)浪费在“废话”上。现有的方法试图通过简单地告诉学生“写满 500 字后停止”来解决这个问题。但这就像一位严厉的编辑只是切掉了文章的结尾;它并没有解决文章中间充满了重复性废话的事实。

解决方案:CLORE(“智能编辑”)

CLORE 改变了游戏规则。它不再仅仅计算字数,而是审视思维的质量

将 CLORE 想象成一位与学生并肩工作的智能编辑。以下是其流程:

  1. 草稿:学生(AI)解决一个问题。如果答错了,CLORE 会忽略它。如果答对了,CLORE 就会介入。
  2. 编辑:智能编辑阅读正确的解答并问道:“这部分有必要吗?这部分只是在重复吗?这部分是胡言乱语吗?”
    • 类比:想象学生写了一段话:“我需要把 2 和 2 相加。2 加 2 等于 4。所以,2+2=4。总和是 4。”编辑会划掉重复部分,只留下"2+2=4"。
    • 类比:如果学生写了一整段与其数学推导相矛盾的代码,编辑就会删除这段代码。
  3. 教学:编辑创建两个版本:原始版(冗长、杂乱但正确)和增强版(简短、干净且正确)。
  4. 训练:随后,AI 被教导去偏好增强版。它学会了:“嘿,我可以得到同样的正确答案,但如果我写得更简洁、没有废话,我会获得更好的奖励。”

为何这与众不同

大多数其他方法就像计时器。它们会说:“你有一分钟时间解决这个问题。”如果你在 30 秒内完成,很好。如果你在 59 秒内完成,也很好。但它们无法阻止你浪费其中 50 秒盯着天花板发呆。

CLORE 则像一位内容教练。它说:“你在 59 秒内解决了问题,但其中 40 秒是你自己在重复。下次,让我们试着通过删减重复内容,在 20 秒内解决这个问题。”

结果

该论文在数学问题(如高中竞赛和奥林匹克竞赛)上测试了这种方法。他们发现:

  • 更短的答案:AI 开始写出更简短的解释。
  • 相同的准确率:AI 的数学能力没有下降;它仍然能得出正确答案。
  • 更少的“废话”:AI 不再写重复的循环、胡言乱语,或在找到答案后继续思考。
  • 更高的效率:由于 AI 写得更少,它使用的计算资源更少,运行速度也更快。

一句话总结

CLORE 教导 AI 模型成为简洁的思考者。它不仅仅是强迫它们变短;而是教导它们识别并删除自己的“思维杂音”(重复、废话和过度思考),同时保留真正解决问题的聪明部分。其结果是一个思考更快、能耗更低,且仍能得出正确答案的 AI。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →