技术摘要:通过重试实现策略梯度强化学习中的探索涌现
1. 问题陈述
在强化学习(RL)中,探索通常是通过向奖励信号添加显式奖励(例如熵、好奇心或基于计数的奖励)或采用后验采样方法来驱动的。作者提出了一个不同的机制:探索应当通过**重试(retrying)**这一需求自然地从最大化奖励的过程中涌现出来。
其核心直觉是:在智能体可以重试动作或遇到相似状态的环境中,如果忽略了后续尝试中获得更高回报的可能性,那么贪婪策略将是次优的。如果没有重试的机会,理性的选择是当前被认为能产生最高回报的动作。然而,在存在不确定性的情况下,一个通过探索替代动作来对冲不确定性的策略,可以在多次试验中实现更高的期望最大值回报。现有方法通常需要复杂的辅助模型来估计不意识或构建奖励,而本文探讨的是能否仅通过优化一个形式化了“重试价值”的基于奖励的目标函数来诱导探索。
2. 方法论
2.1 ReMax 目标函数
作者提出了 ReMax(Retry Maximum),该目标函数通过评估策略 π 在 M 个独立样本(试验)下的期望最大值,而非单个试验的期望回报来评估策略。
在具有动作值 μ 和代表认识不确定性(epistemic uncertainty)的分布 Π 的多臂老虎机设置中,ReMax 目标函数定义为:
JReMaxM(π):=Eμ∼Π[EA[M]∼π[m∈[M]maxμAm∣μ]]
其中 A[M] 代表从策略 π 中进行的 M 次独立抽取。
- 机制: 通过最大化 M 次抽取中的期望最大值,该目标函数激励策略为可能产生高回报的动作分配概率质量,即使这些动作目前并非估计的最大均值。这诱导了随机性(探索)作为一种涌现属性,用以对冲不确定性。
- 确定性情况: 即使在固定奖励的情况下,ReMax 也会重塑目标函数的几何结构。增加重试参数 M 会使最优解附近的梯度变平缓,从而减慢收敛速度并维持探索;而较小的 M 则会加速更新。
2.2 向 RL(MDP)的扩展
将 ReMax 扩展到马尔可夫决策过程(MDP)面临挑战:
- 不确定性单元: RL 中的不确定性涵盖了整个环境(奖励和转移)。
- 重试的可行性: 在物理上将环境重置到同一状态以重试多个动作通常是不可行的。
为了解决这些问题,作者使用 Q 函数 Qπ(s,a) 来定义 ReMax 目标,该函数代表了期望的单回合回报。目标函数被形式化为在状态 s 下 M 次 Q 值抽取的期望最大值:
JReMaxM(π,s,Q):=EQ∼Q[EA[M]∼π[m∈[M]maxQ(s,Am)]]
这里,分布 Q 捕捉了对 Q 值的确定性(可以通过显式建模如集成学习,或通过深度评论家(critic)的非平稳性来隐式捕捉)。
2.3 策略梯度公式化
为了高效优化 ReMax,作者推导了一种新的策略梯度(PG)估计器,该估计器可以从单轨迹回报中计算得出。
- 朴素方法的失败: 直接应用策略梯度定理需要同时观测所有 M 个采样动作的回报,这在回合制 RL 中是不可行的。
- 期望改进(EI)重构: 作者引入了一个基于“期望改进”(借鉴自贝叶斯优化)的基准线,该基准线将 max 算子分解为一个特定于动作的项和一个代表其他 M−1 次抽取的最大值的基准项(W−m)。
- 闭式解: 通过对 Q 值进行排序,他们推导出了期望改进项的闭式表达式。这使得可以使用单轨迹回报 R(s,a) 和当前的 Q 估计值来估计梯度。
- 连续参数 m: 整数重试计数 M 被推广为一个连续实参数 m>0。这实现了对探索-利用权衡的精细控制。闭式解中的项 (1−Cj)M−1 被替换为 (1−Cj)m−1。
2.4 RePPO 算法
作者将 ReMax 集成到近端策略优化(PPO)框架中,创建了 ReMax PPO (RePPO)。
- 架构: 使用 Q-critic 的同策略(on-policy)Actor-Critic 方法。
- 代理目标: RePPO 通过将标准优势函数替换为 基于 EI 的优势函数 来修改标准 PPO 代理目标。
A+(t)=R+(t)−b+(st)
其中 R+(t)=EIm(Rtλ,πθ,Qϕ(st,⋅)),b+ 是 EI 转换后的 Q 值的期望值。
- Q-替换策略: 为了防止评论家因低估 Q 值而高估采样动作的改进程度,作者在计算 EI 项时,用实际的轨迹回报替换了采样动作的 Q 值。这确保了“改进”是相对于真实回报而非潜在偏差估计来衡量的。
3. 主要贡献
- ReMax 目标函数: 一种新型 RL 目标,通过在不确定性下的贪婪奖励最大化(重试)来诱导探索,无需显式的探索奖励。
- 理论推导: 一种新的 ReMax 策略梯度公式化方法,利用 M 次抽取最大值的闭式表达式,使其可以从单轨迹回报中进行估计。
- 连续控制: 将离散重试计数 M 推广到连续参数 m,从而实现对探索率的精确调节。
- RePPO 算法: 一个实用的深度 RL 算法(RePPO),它在 PPO 框架内实现了 ReMax,证明了探索可以从目标函数本身涌现。
4. 实验结果
4.1 Bandits 实验
- 随机性: 在两臂老虎机中,当 M≥2 时,ReMax 会诱导随机策略,而标准 RL(M=1)则产生确定性策略。
- 适应性: ReMax 能根据奖励的不确定性程度调整探索。随着方差增加,ReMax 策略会增加探索以捕捉罕见的高回报结果,这与基于均值的熵正则化 Softmax 不同,后者保持固定。
- 遗憾值(Regret): 在后验老虎机设置(Beta-Bernoulli 和 Gaussian-Gaussian)中,ReMax 展示了经验上的亚线性累积遗憾,与 Thompson Sampling 和 UCB 相当,且优于 Softmax 基准。
4.2 MinAtar 基准测试
在四个游戏(Breakout, Asterix, Freeway, Space Invaders)上进行了评估:
- 性能: RePPO(当 m∈[1.2,1.4] 时)优于标准的 PPO 变体(PPO-V, PPO-Q)以及带有熵奖励或 RND 奖励的 PPO。
- 探索: 尽管没有显式的熵奖励,RePPO 在训练过程中保持了比带有显式熵奖励的 PPO 更高的策略熵。
- 参数敏感性: 性能在 m=1.2 到 $1.4之间达到顶峰。较大的m会减慢熵的衰减(维持探索),而较小的m$ 则会导致更快的收敛但较低的性能。
- 消融实验: 去除与动作无关的基准线或 Q-替换策略会显著降低性能,证实了它们的必要性。
4.3 Craftax 基准测试
在大型开放式 RL 环境 Craftax 上进行了评估:
- 性能: RePPO (m=1.2) 达到了具有竞争力的性能(最大奖励的 11.87%),与带有熵和 RND 奖励的 PPO 变体(分别为 11.66% 和 11.68%)相当,并优于不带奖励的 PPO。
- 可扩展性: RePلو 在没有显式奖励的情况下保持了更高的熵,证明了该机制可以扩展到复杂的长程任务。
5. 重要性与主张
本文声称 ReMax 为传统的探索方法提供了一个极具前景的替代方案,因为它:
- 消除了对显式奖励的需求: 探索通过最大化重试下的期望最大回报这一目标自然涌现。
- 简化了算法设计: 它避免了设计好奇心奖励或维护显式后验模型的计算开销和复杂性(尽管它可以利用这些模型进行不确定性估计)。
- 提供了精细控制: 连续参数 m 允许对探索-利用权衡进行精确调整。
作者指出,虽然其深度 RL 实验主要展示了随机探索(增加策略熵),但其理论框架支持深度探索(时间相干的信息收集),前提是结合显式的不确定性建模(例如集成学习)。他们将 ReMax 定位为适用于重试具有价值的领域的通用原则,包括大语言模型(LLM)中的推理任务,并将其与该领域的 pass@K 目标类比。
作者在理论主张上保持谦逊,指出深度 RL 设置下的正式遗憾界限(regret bounds)留作未来研究,目前的实验结果属于经验性的有效性演示。