技术摘要:单步贝尔曼对齐实现在线强化学习中的可证明高效迁移
1. 问题陈述
本文解决了在回合式马尔可夫决策过程(MDP)中**在线迁移强化学习(RL)**所面临的挑战。该设定涉及学习器与目标任务(M(0))进行交互,同时能够利用来自相关源任务(M(m))的经验。其目标是利用源数据加速目标任务的学习,同时不损害探索性或遗憾(regret)保证。
识别出的一个根本障碍是任务相似性定义与在线 RL 学习机制之间的错位:
- 任务相似性:通常通过奖励、转移或价值函数来定义。
- RL 学习机制:现代在线 RL 算法(例如 Q-learning)通过回归单步贝尔曼目标来运行,这同时依赖于延续值(Vh+1)和转移分布(Ph)。
作者认为,简单混合(naïve pooling)来自源任务的贝尔曼更新会引入系统性偏差。即使任务在本质上非常接近,用源价值 Vh+1(m) 替换目标延续值 Vh+1(0),或使用源转移分布 Ph(m),都会产生依赖于迭代变化的价值函数的差异。这种结构性偏差破坏了基于乐观主义的探索,并使标准遗憾保证失效,因为误差不会随着额外目标数据的增加而消失。
2. 方法论:重加权目标(RWT)
为了解决结构性偏差,本文提出了重加权目标(Re-Weighted Targeting, RWT),这是一种在算子层面进行的校正,旨在对齐不同任务间的贝尔曼算子。
2.1 单步贝尔曼对齐
核心见解在于,如果延续值是在目标任务下评估的,而转移不匹配通过测度变换进行校正,那么任务间的贝尔曼失配可以简化为固定的单步校正。
给定源任务 m 和目标任务 $0,令\omega^{(m)}_h(s' | s, a) = p^{(0)}_h(s' | s, a) / p^{(m)}_h(s' | s, a)$ 为密度比。定义的RWT 对齐贝尔曼算子为:
(Bh(m→0)Vh+1(m))(s,a):=Rh(m)(s,a)+γEs′∼Ph(m)[ωh(m)(s′∣s,a)Vh+1(0)(s′)]
关键在于,延续值 Vh+1(0) 是目标价值函数。真实目标贝尔曼算子与 RWT 对齐的源算子之间的差异简化为:
Δh(m)(s,a)=(Bh(0)Vh+1(0))(s,a)−(Bh(m→0)Vh+1(m))(s,a)=Rh(0)(s,a)−Rh(m)(s,a)
这一结果表明,任务失配变成了一个固定的单步奖励差异 Δr(m),独立于价值函数 Vh+1。这将迁移问题转化为学习一个结构化残差,而非学习一个复杂的、依赖于迭代的偏差。
2.2 算法框架:RWT Q-learning
作者提出了一个两阶段的RWT Q-learning框架(算法 1),将方差减少与偏差校正分离:
- 阶段 I:基于源的基础(方差减少)
- 利用当前的目标价值估计 Vh+1,从源数据构建 RWT 对齐的伪标签。
- 使用这些伪标签拟合基础估计器 Qn,hbase。这利用了丰富的源数据来减少估计方差,同时在奖励差异范围内保持与目标任务的贝尔曼一致性。
- 阶段 II:基于目标的校正(偏差校正)
- 使用目标数据计算残差标签:zi,h=yi,h(0)−Qn,hbase(si,h,ai,h)。
- 估计校正项 δn,h 以捕捉结构化的单步奖励差异 Δr(m)。
- 最终的迁移估计为 Qn,htrans=Qn,hbase+δn,h。
- 探索:
- 在 Qn,htrans 上添加探索奖励 bn,h 以形成乐观估计 Qn,hucb,该估计考虑了来自源基础(包括密度比估计)和目标校正的不确定性。
2.3 理论实例化(RKHS)
该框架在**再生核希尔伯特空间(RKHS)**函数逼近下实例化:
- 假设目标贝尔曼备份位于高复杂度 RKHS K 中。
- 假设任务偏移(即奖励差异 Δr(m))位于较低复杂度的 RKHS K~⊆K 中。
- 基础阶段和校正阶段均使用核岭回归。
- 探索奖励基于相应核的信息增益和覆盖数推导得出。
3. 主要贡献
- 概念性:识别出单步贝尔曼对齐是在线迁移的正确抽象。本文证明了由于对延续值的依赖,简单的贝尔曼重用存在结构性偏差,使其与遗憾保证不兼容。
- 算法性:提出了重加权目标(RWT),这是一种在算子层面进行的校正,使得源数据的统计合理重用成为可能。这产生了一个两阶段 Q-learning 框架,将方差减少(源)与偏差校正(目标)解耦。
- 理论性:在 RKHS 逼近下建立了遗憾界,其规模取决于任务偏移(即奖励差异)的复杂度,而非完整目标 MDP 的复杂度。当偏移具有结构时,这提供了相对于单任务学习的严格改进。
- 实证性:在表格和神经网络设置中展示了相对于单任务学习和简单混合的一致改进,验证了贝尔曼对齐的理论必要性。
4. 结果
理论结果
在假设任务偏移位于较低复杂度 RKHS K~ 中的前提下,OFU-RWT 算法的遗憾界为:
Regret(N)≲HNβ1(Nβ1+1+Nα1+1)+Source Terms
- 主导项取决于任务偏移(K~)的复杂度,而非环境目标 MDP(K)的复杂度。
- 当偏移比环境问题更简单时(例如 α1≤β1),遗憾严格低于单任务学习的 O(HN1/2+β0) 速率。
- 源估计项随着源到目标采样比率 κ 的增加而减小。
实证结果
实验在RandomRewardGridEnv上进行,其中目标奖励是固定的 Q 表,源奖励是扰动版本(Rsource=Rtarget+Δ)。
- 简单混合:与仅针对目标的学习相比,性能持续下降,证实了理论预测的结构性偏差。
- RWT-Q:在表格和深度 Q 网络(DQN)设置中,均优于简单混合和仅针对目标的基线。
- 样本效率:RWT-Q 在样本效率方面显示出显著增益,特别是在奖励偏移具有结构但非平凡的情况下。
5. 意义与主张
本文主张贝尔曼对齐是在线 RL 中一种与模型无关的迁移原则。
- 结构性与统计性:简单迁移的失败被确定为结构性问题(算子错位),而非统计性问题(数据不足)。
- 分解:通过将任务失配简化为固定的单步校正,RWT 允许将学习分解为源驱动的方差减少阶段和目标驱动的偏差校正阶段。
- 遗憾保证:与依赖共享表示或离线假设的先前迁移方法不同,这项工作提供了可证明高效的在线迁移,其遗憾界适应于偏移的复杂度,而非任务的复杂度。
- 通用性:该机制独立于具体的探索策略(兼容 ϵ-greedy 或 UCB)和函数逼近器(表格或神经网络),使其成为在线 RL 迁移的通用原则。