← 最新论文
🤖 AI

SLAT: Segment-Level Adaptive Trimming for Efficient CoT Reasoning

该论文介绍了 SLAT,这是一个通过在理论上识别并自适应地修剪冗余的高概率片段,从而在不损害准确性的情况下将推理长度减少 50%,进而提高思维链推理效率的强化学习框架。

原作者: Jian Yao, Xiongcai Luo, Ran Cheng, Kay Chen Tan

发布于 2026-06-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Jian Yao, Xiongcai Luo, Ran Cheng, Kay Chen Tan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个才华横溢但过于话痨的学生,名叫“推理机器人”(Reasoning Bot)。当你问它一个数学问题时,它不仅仅是给出答案。相反,它会写下一段长长的、一步步的思考日记(称为“思维链”,Chain of Thought)。

最近,研究人员发现,虽然这种话痨风格有助于机器人得出正确答案,但它经常遭受**“过度思考”**(overthinking)的困扰。它会在得出解决方案后继续喋喋不休。它可能会重复问题、重新解释它已经知道的基础规则,或者陷入一种机械化、重复性的检查工作的循环中。这就像一个学生在解出 2+3=52+3=5 后,花了接下来的五分钟写道:“我把二和三相加了。二加三等于五。我确定它是五。让我再检查一遍。是的,它是五。”

这种“过度思考”浪费了大量的计算能量(和时间),而没有让答案变得更正确。

当前解决方案的问题

此前,研究人员尝试通过告诉机器人:“在写满 X 个词后停止。”或者,“如果你的回答太长,我们会惩罚你。”

这种方法的问题在于,它就像一位严厉的老师说:“如果你的文章太长,无论如何我都会切掉最后 500 个字。”问题在于,机器人可能会为了节省空间而切掉了真正的解决方案,或者可能在保留无聊、重复的废话的同时,切掉了关键的一步。这是一种笨拙的手段,它并不理解正在说什么内容,只知道说了多少内容

新的解决方案:SLAT(“编辑”机器人)

论文介绍了一种名为 SLAT(分段自适应修剪,Segment-Level Adaptive Trimming)的新方法。SLAT 不仅仅是计数单词,它更像是一个智能编辑,能够实时观察机器人思考的质量

以下是它的工作原理,使用一个简单的类比:

1. “无聊”检测器
想象机器人正在写一个故事。SLAT 会观察机器人的信心。当机器人正在写一些新颖且重要的内容时,它可能会有些犹豫或谨慎地选择词汇(低概率)。但当机器人开始重复自己或陈述显而易见的事实时(比如“这个问题要求的是 2 和 3 的和”),它会变得非常有信心且机械化。它开始以极高的确定性反复说着同样的话。

SLAT 会捕捉到这些**“高概率片段”**(high-probability segments)。在论文看来,这些时刻就是机器人正在“原地打转”的时候——说话很多,但并没有增加任何新的信息或学习内容。

2. “修剪”奖励
SLAT 使用一种特殊的训练方法(强化学习)。它告诉机器人:

  • “如果你继续写下去并只是重复自己或陈述显而易见的事实,你会受到‘惩罚’(负分)。”
  • “如果你在得到答案后立即停止并跳过那些无聊的重复,你会得到‘奖励’。”

这就像训练一只狗。如果狗对着松鼠(显而易见的事物)乱叫,你就忽略它。如果狗在松鼠离开后停止乱叫并安静地坐下,你就给它奖励。最终,狗会学会一旦松鼠消失就停止乱叫。

3. 结果
论文在困难的数学问题上测试了这一方法。

  • 使用 SLAT 之前: 机器人会对一个简单问题写出 10,000 字的解释,其中 5,000 字都是重复的废话。
  • 使用 SLAT 之后: 机器人依然能得到完全相同的正确答案,但它将解释长度缩减了一半(减少了约 50% 的长度)。它保留了聪明且必要的步骤,并删除了“过度思考”的循环。

为什么这很重要

作者发现这种方法创造了一个“甜点区”(sweet spot)。机器人的速度和效率提升了一倍,且没有损失任何智慧。这证明了你不需要强迫机器人变短,你只需要教会它识别何时该停止说话,并专门针对“过度思考”的循环进行停止。

简而言之:SLAT 教会了 AI 在仅仅是重复自己时停止说话,在保持答案完美的同时,节省了时间和能量。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →