← 最新论文
🤖 machine learning

Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization

本文介绍了对比策略优化(Contrastive Policy Optimization, CPO),这是一种新颖的强化学习框架,它通过在参考引导生成与原始生成之间引入标记级对比差异,来取代基于熵的优势塑造,从而更准确地传递正确性信号,进而解决了零优势问题,并在域内和域外基准测试上均显著优于现有方法。

原作者: Weiwen Xu, Jia Liu, Hou Pong Chan, Long Li, Deng Cai, Min Chen, Hao Zhang

发布于 2026-07-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Weiwen Xu, Jia Liu, Hou Pong Chan, Long Li, Deng Cai, Min Chen, Hao Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人解决一个棘手的谜题,比如一道复杂的数学题或一个编程挑战。你不仅希望机器人能猜出正确答案,还希望它能学会“如何思考”。这就是强化学习的世界,在这里,AI 通过尝试并获取反馈来学习。通常情况下,反馈很简单:如果最终答案正确,就说“做得好!”,如果错误,就说“再试一次!”。但问题在于:一条通往正确答案的长而曲折的路径中,可能既有精彩的步骤,也有愚蠢的错误交织在一起。如果你只看最终结果,机器人可能会对哪些具体的步骤是有帮助的、哪些是有害的感到困惑。

为了解决这个问题,科学家们尝试使用“熵”(entropy)的概念。把熵想象成衡量机器人在任何给定时刻有多“不确定”或多“困惑”的指标。如果机器人在两个选项之间犹豫不决,它的熵就会很高。其核心思想是:高不确定性意味着机器人在探索新想法,这是好事;而低不确定性意味着它很有信心,这也是好事。但问题在于:困惑并不总是意味着机器人在进行有用的探索。有时,机器人之所以困惑,是因为它陷入了死胡同。这就像一个学生盯着数学题抓耳挠腮。他们是在对一个巧妙的解法进行深度思考,还是仅仅完全迷失了方向?使用熵的传统方法无法区分“生产性的困惑”与“破坏性的困惑”。这篇题为《超越熵》(Beyond Entropy)的论文试图通过给机器人一种更好的方式来判断它是否走在正确的轨道上,从而解决这个谜团。

研究人员提出了一种名为**对比策略优化(Contrastive Policy Optimization, CPO)**的新方法。CPO 不仅仅是猜测机器人是否困惑,它更像是一个通过对比标准答案来检查作业的学生。想象一个刚刚完成数学测试的学生。他们看着自己的作业并想:“我不确定这一步。”然后,他们瞄了一眼老师的标准答案。突然间,错误变得显而易见了!学生看到:“噢,我在这里写了一个减号,但标准答案里是一个加号。”这种领悟的瞬间——即他们所想与正确答案之间的差异——清晰地告诉了他们哪里出了错。

CPO 对 AI 也是如此。它获取 AI 自己的答案,并将其与“参考答案”(正确解法)进行对比。它会观察 AI 生成的每一个单词(或“标记/token”)。如果 AI 在错误的步骤上表现得很自信,那么参考答案会让 AI 在该错误步骤上的信心大幅下降。如果 AI 在正确的步骤上表现得犹豫不决,参考答案则会提升其信心。这种“对比性分歧”(contrastive disagreement)——即 AI 的想法与正确路径之间的差距——成为了一个极其可靠的信号。论文通过数学和实验证明,通过这种信号来识别错误,比仅仅测量 AI 的“困惑度”要有效得多。

团队在一些非常难的数学问题上测试了该方法,使用了像 Qwen2.5-Math-7B 和 Qwen3-Base-4B 这样的模型。他们发现 CPO 相比于标准方法(GRPO)有了巨大的提升。平均而言,与标准方法相比,它将性能提升了约 7.7% 到 8.5%。更令人印象深刻的是,虽然其他方法在处理未见过的任务(域外任务)时往往表现变差,但 CPO 反而变得更好了。看起来,通过专注于 AI 推理偏离真相的具体时刻,该模型不仅学会了更准确,也学会了更有创造力。

其中一个最有趣的发现是 AI 如何从不同类型的答案中学习。论文指出,当 AI 得到一个正确答案时,应该鼓励它继续探索并尝试新的、有创意的路径(探索);但当它得到一个错误答案时,应该引导它遵循已被证明正确的步骤(利用)。CPO 完美地平衡了这两种行为。这就像一位教练告诉球员:“当你领先时,尝试一些花哨的新招式!但当你落后时,坚持那些你已知有效的基本功。”这种平衡防止了 AI 陷入无聊的循环或漫无目的地游荡。

简而言之,这篇论文认为,仅仅测量“困惑度”不足以教会 AI 进行良好的推理。相反,我们需要向 AI 展示它自己的想法与正确答案之间的差异。通过使用这种“对比性分歧”,AI 能够更精准地识别自己的错误,从而实现更聪明、更可靠且更具创造性的问题解决能力。作者展示了这种方法不仅适用于其训练的数学问题,也适用于全新的、未见的挑战,这为让 AI 变得更聪明、更鲁棒开辟了一条充满前景的道路。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →