← 最新论文
🤖 machine learning

Co-Evolving Policy Distillation

本文提出了协同进化策略蒸馏(CoPD),这是一种新颖的训练范式,它将并行专家训练与双向在线策略蒸馏相结合,以克服能力损失和行为差距,从而在文本、图像和视频推理方面实现优于现有强化学习与视觉推理及蒸馏方法的综合性能。

原作者: Naibin Gu, Chenxu Yang, Qingyi Si, Chuanyu Qin, Dingyu Yao, Peng Fu, Zheng Lin, Weiping Wang, Nan Duan, Jiaqi Wang

发布于 2026-05-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Naibin Gu, Chenxu Yang, Qingyi Si, Chuanyu Qin, Dingyu Yao, Peng Fu, Zheng Lin, Weiping Wang, Nan Duan, Jiaqi Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图培养一名超级聪明的学生,使其成为数学、艺术和视频分析这三个截然不同领域的专家。

过去,研究人员尝试过两种主要方法,但两者都存在重大缺陷。本文介绍了一种名为“协同进化策略蒸馏(CoPD)”的新方法,它通过让学生以一种独特的、类似“舞蹈”的伙伴关系进行学习,从而解决了这些缺陷。

以下是论文如何用简单的类比来解释问题与解决方案:

问题:“拔河”与“差距过大”

1. “拔河”(混合 RLVR)
想象一下,你试图在同一个教室、由同一位老师,在同一时间教你的学生数学和艺术。

  • 问题所在: 数学需要严格的逻辑和规则,而艺术则需要创造力和打破规则。当你将它们混合时,学生会感到困惑。论文将这种现象称为“能力分歧”。这就像一场拔河比赛:数学课把学生往一个方向拉,而艺术课则把他们往另一个方向拉。最终,学生两样都学得一塌糊涂,因为这两种教学相互抵消了。

2. “差距过大”(静态 OPD)
于是,研究人员尝试了另一种方法:“先培养一名数学专家,再单独培养一名艺术专家,然后让他们去教一名新学生。”

  • 问题所在: 等到数学专家完成训练时,他们已经发生了如此巨大的变化,以至于不再与新学生说同一种“语言”。学生是初学者,而专家是大师。
  • 类比: 想象一位国际象棋大师试图教一个幼儿。大师的招法对幼儿来说过于复杂,无法理解。幼儿(学生)看着大师(老师)的招法,心想:“我完全不知道你在做什么。”由于思维模式差距太大,知识因此流失。论文将这种现象称为“行为模式差距”。

解决方案:“协同进化之舞”(CoPD)

作者提出了 CoPD,彻底改变了训练流程。他们不再先训练一名专家然后再进行教学,而是同时训练两名学生,让他们不断地互相教学和学习。

以下是这场“舞蹈”的运作方式:

第一步:独奏练习(RLVR 阶段)

  • “数学学生”只练习数学问题。
  • “艺术学生”只练习艺术问题。
  • 为什么? 这使他们能够在特定技能上变得非常精通,并发现新的、高级的技巧。他们的思维开始产生分歧,这是好事,因为这意味着他们有了的东西可以互相传授。

第二步:舞伴互换(相互 OPD 阶段)

  • 在他们分歧过大之前,他们停下来互换角色。
  • 数学学生尝试解决艺术问题,艺术学生则观察并提供反馈。
  • 艺术学生尝试解决数学问题,数学学生则观察并提供反馈。
  • 为什么? 因为他们刚刚一起练习过,他们的思维模式仍然足够接近,能够互相理解。数学学生可以说:“我看到你想做 X,但这里有更好的方法”,而艺术学生确实能理解,因为他们仍在同一频道上。

第三步:重复

  • 他们回到第一步,学习更高级的技巧,然后在第二步再次互换。
  • 这个循环不断重复。

为什么这种方法效果更好

论文声称,该方法在以下三个方面更优越:

  1. 没有“拔河”: 因为他们会先分开练习各自的技能,所以不会因混合数学和艺术规则而感到困惑。
  2. 没有“差距过大”: 因为他们在训练过程中(而非之后)互换角色,所以他们永远不会分歧到无法互相理解的地步。他们始终保持在“甜蜜点”:老师足够先进以进行教学,但又足够接近以便被理解。
  3. 共同成长: 他们不仅仅是老师和学生,而是协同进化的。他们共同成长。论文发现,最终生成的单一模型在数学和艺术方面的表现,实际上优于那些单独的“专家”模型。

结果

研究人员在一个需要处理文本(数学)、图像(艺术)和视频的模型上测试了这种方法。

  • 旧方法: 模型要么感到困惑(混合训练),要么丢失知识(静态教学)。
  • CoPD: 模型精通了所有三项。事实上,最终生成的“全能”模型的表现优于构建它的各个专业专家模型。

总结

不要把 CoPD 想象成那种必须先修完一门课才能开始下一门的学校,而要把它想象成两名运动员共同训练健身房。他们各自进行专项训练以增强实力,然后立即互相辅助(spot),在身体尚热、节奏同步时分享技巧。等到训练结束时,他们两人都比单独训练或隔离训练时更加强大。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →