← 最新论文
💬 NLP

Self-Compression of Chain-of-Thought via Multi-Agent Reinforcement Learning

本文提出了一种通过多智能体强化学习实现的自压缩(Self-Compression via Multi-Agent Reinforcement Learning, SCMA)框架,该框架利用专门的分段与评分智能体来选择性地惩罚冗余的推理块,同时保留核心逻辑,从而与传统的强化学习方法相比,显著降低了大型推理模型的推理开销并提高了准确性。

原作者: Yiqun Chen, Jinyuan Feng, Wei Yang, Meizhi Zhong, Zhengliang Shi, Rui Li, Xiaochi Wei, Yan Gao, Yi Wu, Yao Hu, Zhiqiang Pu, Jiaxin Mao

发布于 2026-01-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Yiqun Chen, Jinyuan Feng, Wei Yang, Meizhi Zhong, Zhengliang Shi, Rui Li, Xiaochi Wei, Yan Gao, Yi Wu, Yao Hu, Zhiqiang Pu, Jiaxin Mao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个才华横溢但过于唠叨的学生,名叫“推理者”。当你问他一个数学问题时,他不仅仅是解决问题,他还会写一部小说。他会说:“嗯,让我想想……等等,这样对吗?让我再检查一遍。噢,也许我应该尝试另一种角度。不,那太复杂了。让我们回到起点吧。”

虽然这种“过度思考”通常能得出正确的答案,但它在计算机上运行起来极其缓慢且昂贵。这就像雇佣了一位导游,他在前往目的地的途中会停下来解释每一根草叶。你最终到达了目的地,但你已经精疲力竭,而且耗费了双倍的时间。

这篇论文介绍了一种名为 SCMA(通过多智能体强化学习进行自我压缩)的新型训练方法,旨在教导这位学生如何在保持聪明才智的同时变得言简意赅。

旧方法的缺陷

此前,研究人员试图通过简单地告诉学生:“如果你的回答太长,你就会得到差评”来解决这个问题。

  • 缺陷: 这就像一位严厉的老师说:“无论如何,你的文章必须控制在500字以内。” 学生可能会为了符合字数限制而删掉论证中最核心的部分,从而导致错误的答案。他们牺牲了逻辑的“精华”来节省空间。

新方案:三人小组

作者提出了一种更聪明的方法,即使用由三个专门的“智能体”(AI角色)组成的团队进行协作训练。你可以把它想象成一个电影制作团队:

  1. 导演(推理智能体): 这是主角,负责实际解决问题并编写剧本(思维链)。
  2. 剪辑师(分割智能体): 这个智能体接过导演冗长的剧本,并将其拆解成一个个小的、逻辑连贯的场景或“块”。
  3. 影评人(评分智能体): 这个智能体观察这些“块”,并给出1到5分的评分。
    • 1分: “这只是废话。我们可以把它剪掉。”(例如:“等等,让我想想……”)
    • 5分: “这至关重要!不要动它。”(例如:“因此,X等于Y。”)

他们如何协作

与其使用简单的“越短越好”的规则,该团队使用了一个智能惩罚系统

  • 如果导演写了一个冗长且无聊的场景(低分),剪辑师和影评人会说:“我们会因为这段长度而严厉惩罚你。”
  • 如果导演写了一个冗长但复杂且必要的场景(高分),团队会说:“这里可以写长一点,我们不会惩罚你。”

这鼓励了导演学习到:“我需要删掉废话,但我必须保留沉重的逻辑。”

结果:一个“自我压缩”的学生

一旦训练完成,“剪辑师”和“影评人”智能体就会被关闭。导演独自工作。因为他们在训练过程中学会了如何区分“废话”与“逻辑”,他们现在能够自然地产生简短、有力且高度准确的答案。

论文的研究结果显示:

  • 更短: 新方法将思考过程的长度减少了 11% 到 39%
  • 更聪明: 出人意料的是,答案变得更加准确(提升了 4% 到 10%)。
  • 无额外成本: 因为额外的智能体仅在训练期间使用,最终的系统运行速度与普通 AI 一样快,但减少了许多“唠叨”。

简而言之,SCMA 教会了 AI 模型停止闲聊并开始高效思考,确保它们在丢弃“泥土”的同时,保留住逻辑的“金块”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →