← 最新论文
💬 NLP

CEPO: RLVR Self-Distillation using Contrastive Evidence Policy Optimization

该论文提出了对比证据策略优化(CEPO),这是一种新颖的 RLVR 自蒸馏方法,它利用正确和拒绝的 rollout 生成对比奖励信号,从而精准识别关键推理步骤,同时避免信息泄露,并在多模态数学推理基准测试中超越了 GRPO 等现有基线方法。

原作者: Ahmed Heakl, Abdelrahman M. Shaker, Youssef Mohamed, Rania Elbadry, Omar Fetouh, Fahad Shahbaz Khan, Salman Khan

发布于 2026-05-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Ahmed Heakl, Abdelrahman M. Shaker, Youssef Mohamed, Rania Elbadry, Omar Fetouh, Fahad Shahbaz Khan, Salman Khan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人解决一道复杂的数学题。你让机器人尝试解题,当它得出正确答案时,你给它一颗金星;当它答错时,你给它一个“再试一次”的信号。

这就是当前人工智能训练的工作方式(称为RLVR)。但这种方法存在一个重大问题:无论机器人输入的每一个词是精妙的洞见,还是仅仅像“嗯”、“所以”或“因此”这样的填充词,它都会得到同样的金星奖励。

这就像一位老师给学生的整篇作文打了 A+,尽管学生只写了一句精彩的话,其余部分全是凑数的填充内容。机器人并不知道具体是哪些词解决了问题,因此它学习缓慢且容易混淆。

旧有的修正方案(以及为何失败)

科学家们曾试图通过这种方式来修正:“好吧,让我们在机器人开始写作之前就告诉它正确答案,然后看看它会写出怎样不同的内容。”

然而,这引发了一个名为"信息泄露"的新问题。

  • 类比:想象一个学生在考试中作弊。如果你在他们写作过程中告诉他们答案密钥,他们可能会直接背诵答案密钥,而不是学习数学原理。他们开始写出看似答案密钥但实际毫无意义的内容。该论文发现,以往的方法正是如此:人工智能开始通过背诵答案而非学习推理过程来“作弊”。

新解决方案:CEPO

作者提出了一种名为CEPO(对比证据策略优化)的新方法。其工作原理如下,通过一个简单的类比来说明:

“好警察,坏警察”审讯
CEPO 不再仅仅问机器人:“你得到正确答案了吗?”,而是提出了一个更尖锐的问题:**“这个词是否帮助你得到了正确答案,并且是否降低了你得出错误答案的可能性?”**

  1. 好老师(正确答案):人工智能查看正确的解决方案,并问:“如果我知道答案是正确的,我会写出这个词吗?”
  2. 坏老师(错误答案):人工智能查看一次失败的尝试(即它已经尝试过但答错的那次),并问:“如果我是为了得出错误的答案,我会写出这个词吗?”

神奇的对比:

  • “填充”词:如果这个词仅仅是“因此”或“the",那么无论是好老师还是坏老师本来都会写出它。由于双方意见一致,该词获得中性评分。它不会获得额外奖励。
  • “决定性”词:如果这个词是一个关键的数学步骤(例如“除以 2"),好老师会说:“是的,我需要那个!”但坏老师会说:“不,我不会那样做!”由于双方意见相左,人工智能意识到:“啊哈!这个词是解决问题的关键!” 它会获得巨大的奖励提升。

为何这更好

  • 杜绝作弊:因为人工智能是在同一批尝试中,将“正确”路径与“错误”路径进行对比,所以它不会将答案泄露到训练过程中。它保持安全,并学习实际的逻辑。
  • 精准性:它不再浪费时间因机器人写出"the"或"and"而给予表扬。它将所有的表扬都集中在真正解决谜题的具体步骤上。

结果

该论文在两个不同规模的人工智能模型(20 亿和 40 亿参数)上,使用涉及几何和逻辑的数学问题进行了测试。

  • 获胜者:CEPO 始终击败了之前的最佳方法。
  • 失败者:那些试图通过泄露答案来“作弊”的旧方法(称为 OPSD 和 SDPO),其表现实际上比未经训练的机器人还要差。这证明了作者的理论是正确的:如果你不防止人工智能背诵答案,它就会变得更笨。

总结

将 CEPO 想象成一个智能聚光灯。它不是将强光照射在整个舞台(整句话)上,而是只聚焦于那个真正抛出笑点的演员。它忽略了背景噪音和填充内容,确保人工智能确切地学习到什么让解决方案生效,而不会意外地背诵答案密钥。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →