← 最新论文
🤖 AI

AEGPO: Adaptive Entropy-Guided Policy Optimization for Diffusion Models

本文提出了 AEGPO,一种针对扩散模型的创新策略优化框架,该框架利用注意力熵作为双信号代理,在样本间动态分配展开预算,并在关键时间步选择性地引导探索,从而与标准 GRPO 方法相比,显著提高了收敛速度和对齐性能。

原作者: Yuming Li, Qingyu Li, Chengyu Bai, Xiangyang Luo, Zeyue Xue, Wenyu Qin, Meng Wang, Yikai Wang, Shanghang Zhang

发布于 2026-02-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuming Li, Qingyu Li, Chengyu Bai, Xiangyang Luo, Zeyue Xue, Wenyu Qin, Meng Wang, Yikai Wang, Shanghang Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在教一个机器人艺术家根据你的描述来画画。你希望这个机器人能快速学习,并创作出人类真正喜欢的图像。为此,你使用了一种叫做基于人类反馈 Reinforcement Learning from Human Feedback (RLHF) 的方法。你可以把它想象成:机器人尝试画画,你给结果打分,然后机器人再次尝试以获得更高的分数。

目前的标准方法被称为 GRPO。然而,这篇论文的作者发现,GRPO 就像一个通过把教科书每一页都读同样多次来准备考试的学生,无论那一页是简单的还是极其困难的,它都一视同仁。这浪费了时间在简单的内容上,却没能在最困难的部分投入足够的时间。

以下是他们解决方案 AEGPO 的简单拆解:

问题所在:“一刀切”行不通

旧的方法(GRPO)对待每一个绘画提示词和绘画过程中的每一个步骤都是一样的。

  • 问题在于: 有些提示词对机器人来说很简单(它已经知道如何画它们),而有些则非常难。同样,绘画过程中的某些时刻对于把握细节至关重要,而另一些时刻仅仅是常规操作。
  • 结果: 机器人浪费了精力去练习它已经掌握的东西,并且错过了它最需要学习的关键时刻。

发现:“困惑度计”

研究人员观察了机器人的大脑内部(具体来说是一个叫做注意力 Attention 的部分),看看它在思考什么。他们发现了一个他们称之为注意力熵 Attention Entropy 的隐藏信号。

熵(Entropy)想象成一个“困惑度计”“游离度计”

  • 低熵: 机器人很专注。它清楚地知道该做什么。它很有信心。
  • 高熵: 机器人的目光到处乱看,不确定应该关注描述中的哪一部分。它感到困惑,或者正在探索多种可能性。

他们发现了这个计数的两个惊人之处:

  1. “学习价值”信号: 如果机器人在接受一课之后,其“旧自我”与“新自我”之间的困惑程度变化很大,那么这个提示词就具有极高的价值。它迫使机器人学习了新知识。如果困惑程度几乎没有变化,说明这个提示词很简单,并没有教给它太多东西。
  2. “关键时刻”信号: 在绘画过程中,机器人的困惑会在特定时刻激增。这些激增发生在机器人做出重大决策时(比如“这应该是一只狼还是一只狗?”)。这些正是机器人需要探索不同选项以寻找最佳路径的时刻。

解决方案:AEGPO(聪明的教练)

作者构建了一个名为 AEGPO 的新系统,它利用这个“困惑度计”来扮演聪明教练的角色。它做了两件事:

1. 全局策略:“专注于难点”
AEGPO 不再给每个提示词分配相同数量的练习时间,而是观察“学习价值”信号。

  • 简单的提示词: 机器人获得的练习轮数较少,因为它已经掌握了。
  • 难的提示词: 机器人会获得更多的练习轮数,因为这些才是真正让它变得更强的部分。
  • 类比: 想象一位导师,他不再把时间花在你已经掌握的乘法表上,而是把所有时间都用来帮助你解决那些让你感到挣扎的复杂微积分问题。

2. 局部策略:“在正确的时间进行探索”
AEGPO 不再在固定的、随机的时间进行分支(尝试不同的可能性),而是等待“困惑度计”出现激增时才行动。

  • 它只在机器人感到困惑并正在探索选项时,才鼓励它尝试不同的创意路径。
  • 类比: 想象一个徒步旅行者。徒步者不是每隔 10 分钟就看一次地图,而是在路经雾气弥漫、看不清方向时才会停下来看地图。这节省了精力,并确保他们不会迷失方向。

结果

论文在文本生成图像模型(将文字转化为图片的机器人)上测试了该方法。

  • 速度: 机器人的学习速度比以前快了 2 到 5 倍。它在极短的时间内就达到了同样的技能水平。
  • 质量: 最终生成的图片更符合人类的偏好(看起来更符合人们想要的效果)。
  • 效率: 它不需要超级计算机;它只是利用机器人自身的内部“困惑”信号来决定如何学习。

总结

AEGPO 是一种更聪明的训练 AI 艺术家的方案。它不再盲目地练习一切,而是利用 AI 自身的内部“困惑”来确定练习什么(难的提示词)以及何时探索新想法(关键时刻)。这使得训练过程更加高效,最终结果也更加出色。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →