← 最新论文
🤖 machine learning

ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy

本文提出了自适应信用策略优化(Adaptive Credit Policy Optimization, ACPO),这是一种利用模式局部代理熵来非对称地调节策略更新的标记级信用分配框架,通过有效解决稀疏奖励和梯度失配带来的挑战,在数学推理和编程基准测试中超越了现有的强化学习基准方法。

原作者: Zijun Xie, Yuyang You, Yongzhi Li, Enlei Gong, Zeyu Chen, Quan Chen, Yanhua Cheng, Peng Jiang, Yadong Mu

发布于 2026-07-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Zijun Xie, Yuyang You, Yongzhi Li, Enlei Gong, Zeyu Chen, Quan Chen, Yanhua Cheng, Peng Jiang, Yadong Mu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一名非常聪明的学生(一个 AI)如何解决复杂的数学问题或编写代码。你给他们一个问题,他们写出了一段长长的、分步骤的解答,然后在最后告诉你:“正确!”或“错误。”

问题:“一刀切”的评分
在传统的训练方法中,如果学生得到了最终正确答案,系统会给他们写的每一个词都发一颗“金星”。如果错了,则会对每一个词都给一个“大拇指朝下”。

这是低效的。想象一下学生在写一篇长论文:

  • 好的情况: 他们可能完美地写好了 90% 的内容,但中间因为一个微小的、自信的错误而导致全盘皆错。
  • 坏的情况: 或者,他们可能有一半的内容都在盲目猜测,但最后运气好碰对了结果。

如果对每个词都一视同利,AI 会感到困惑。它不知道哪些词帮助它成功了,哪些词导致了它的失败。这被称为信用分配问题(Credit Assignment Problem)

旧的解决方案:猜测与粗放工具
以往的方法试图解决这个问题:

  1. 过程奖励(Process Rewards): 雇佣人类来为论文中的每一步进行评分。这太昂贵且太慢了。
  2. 熵(置信度)检查: 观察 AI 对每个词有多“确定”。如果 AI 不确定(高“熵”),系统就假设这个词很重要。
    • 缺陷: 一些方法只是简单地说,“忽略前 20% 不确定的词”,这太粗放了。另一些方法试图直接优化“不确定性”的数学模型,但这就像是试图通过看后视镜来驾驶汽车——它会向引擎发送错误的信号。

新的解决方案:ACPO(自适应信用策略优化)
作者提出了一种名为 ACPO 的新方法。你可以把 ACPO 想象成一位超级聪明的教练,他会实时观察学生的置信度,并据此调整反馈。

以下是 ACPO 的工作原理,使用一个简单的类比:

1. “代理熵”(置信度计)

ACPO 没有测量整个词典的混乱程度(这太杂乱且充满噪声),而是使用了一个置信度计。它只关注 AI 最有可能选择的下一个词。

  • 高置信度: AI 对自己的答案很确定。
  • 低置信度: AI 在犹豫。

论文发现了一个有趣的模式:当 AI 犯错时,它通常会以一个自信的错误猜测开始,然后随着尝试挽回局面,其置信度变得混乱且摇摆不定。ACPO 利用这种“摇摆感”作为信号。

2. 非对称策略(双轨制系统)

ACPO 对“好日子”和“坏日子”采取不同的处理方式。

  • 场景 A:学生做对了(正向优势)

    • 逻辑: 如果学生解决了问题,但在某个特定步骤表现得有些犹豫(低置信度),那么这种犹豫实际上是深度思考或关键决策点的体现。
    • 行动: ACCO 会说:“做得好!但刚才你犹豫的部分?为那个特定的词增加双倍奖励。” 它鼓励 AI 即使在感到不确定时也要努力思考,只要最终能得到正确答案。
  • 场景 B:学生做错了(负向优势)

    • 逻辑: 如果学生失败了,但在犯错时却表现得极其自信(高置信度),那是很危险的。这意味着他们过度自信且犯了错。
    • 行动: ACPO 会说:“你错了,而且你还非常确定。严厉惩罚那个自信的错误。” 然而,如果学生在犯错后陷入了混乱和盲目猜测,ACPO 则会说:“不用担心混乱的部分;专注于修正那个自信的错误。”

3. 为什么它更好(“代理”技巧)

论文解释说,使用完整的“不确定性”数学计算非常混乱,因为它试图考虑 AI 可能选取的每一个词,而不仅仅是它实际选取的词。这会产生“噪声”。

ACPO 使用了代理熵(Surrogate Entropy)。你可以把它想象成置信度计的一个简化、纯净的版本。它忽略了“如果……会怎样”这种杂乱的背景噪声,只专注于:“AI 对它实际写下的那个词有多确定?”

这使得训练信号更加清晰。它就像一位教练在说:“我不在乎你可能说的另外 99 个词;我只在乎你在这里自信地说了错误的词。”

结果

作者在难题(如 AIME)和编程挑战上测试了该方法。

  • 结果: ACPO 始终优于其他顶尖方法(如 GRPO、DAPO 和 SAPO)。
  • 原因: 它学习得更快、更稳定,因为它知道应该赞扬哪些词,以及应该纠正哪些词,而不是仅仅给整个答案一个笼统的评分。

总结:
ACPO 是一种更聪明的 AI 作业批改方式。它不再是对整个答案给出一个单一的分数,而是观察学生在每一步的置信度。如果学生不确定但做对了,它会给予额外奖励;如果学生很自信但做错了,它会给予严厉惩罚。这有助于 AI 进行深度思考并避免过度自信。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →