想象一下,你正在教一个机器人穿过房间。在强化学习(RL)的世界里,机器人通过尝试各种动作、获得反馈(奖励)并调整步伐以便下次做得更好来学习。
教导这个机器人主要有两种方法:
- “赌徒”方法(随机性): 机器人尝试许多不同的随机步伐,观察哪些有效,然后取平均值。这种方法安全但缓慢。
- “精准”方法(确定性): 机器人选择一个它认为完美的特定步伐,并试图优化这一确切动作。这种方法快速高效,但存在一个重大缺陷。
问题所在:“模糊地图”困境
“精准”方法(称为确定性策略梯度或 DPG)依赖一个非常具体的规则:为了知道该向机器人的脚部施加哪个方向的微小推力,教师(即“评论家”)需要查看奖励地图并说:“如果你将脚向左侧移动极其微小的一点点,分数就会上升。”
如果奖励地图是平滑的,就像一座缓坡,这非常有效。但在现实世界中,奖励往往是块状且锯齿状的。
- 想象一种奖励机制:只有当你精确地踩在特定的地砖上时,你才能得到一块饼干;哪怕偏离一毫米,你就得不到任何饼干。
- 在这张“块状”地图上,没有平滑的坡度可供遵循。“梯度”(即移动方向)是断裂的、锯齿状的,或者根本不存在。
- 当机器人试图在这张锯齿状的地图上使用“精准”方法时,它会感到困惑。它试图在悬崖边缘计算坡度,导致剧烈且不稳定的运动。论文将这种现象称为“定义不明的策略梯度”。
解决方案:“模糊透镜”(高斯平滑)
作者 Hyunjun Na 和 Donghwan Lee 提出了一种巧妙的修复方案,称为软确定性策略梯度(Soft-DPG)。
他们不是直接去读取那张锯齿状、块状的地图,而是在其上覆盖了一层柔和、模糊的透镜。
- 隐喻: 想象透过毛玻璃观察一张像素化、锯齿状的图像。那些尖锐、令人困惑的边缘会模糊融合成一座平滑、柔和的山丘。
- 工作原理: 机器人不再询问“对于确切这一步的奖励是多少?”,而是询问“对于这一步及其周围紧邻步骤的平均奖励是多少?”
- 通过平均邻近动作的奖励(使用一种称为高斯平滑的技术),他们将那张锯齿状、断裂的地图变成了一座平滑、可攀登的山丘。
新算法:Soft DDPG
他们构建了一种名为Soft DDPG的新机器人训练器。以下是它与旧方法的区别:
- 旧方法(DDPG): 机器人试图攀登一座锯齿状的悬崖。由于地图过于粗糙难以读取,它会滑倒、跌落并感到沮丧。
- 新方法(Soft DDPG): 机器人透过柔和的透镜观察地图。锯齿状的悬崖变成了平滑的斜坡。现在,即使底层现实依然锯齿状,它也能轻松看清哪边是“上”,并稳步攀登。
论文发现
作者在标准的机器人行走任务(如猎豹奔跑或人类行走)上测试了该方法,随后创建了这些任务的“锯齿状”版本,其中奖励被突然截断或离散化(就像“地砖上的饼干”示例)。
- 在平滑世界中: 当奖励本身已经非常平滑时,旧方法(DDPG)表现依然很好,而新方法(Soft DDPG)同样出色,尽管由于需要进行额外的平均计算,速度稍慢。
- 在锯齿状世界中: 奇迹就在这里发生。在“锯齿状”环境中,旧方法崩溃并失败。而新方法(Soft DPG)则表现出色。它保持稳定并成功学会了行走,因为它不会在断裂的梯度上绊倒。
核心结论
该论文认为,如果你在一个混乱的现实世界环境中训练人工智能,而那里的奖励并非完美平滑(这几乎总是如此),你不应该强迫人工智能直接去读取那张锯齿状的地图。相反,你应该给它一个“柔和”的世界视角。这种模糊地图的简单技巧,使得人工智能即使在游戏规则粗糙且断裂的情况下,也能平稳可靠地学习。
关键要点: 你不需要修复那个锯齿状的世界;你只需要教会机器人柔和地看待它。
技术摘要:高斯平滑的软确定性策略梯度
问题陈述
确定性策略梯度(DPG)及其深度学习实现——深度确定性策略梯度(DDPG)——被广泛用于连续控制任务。然而,这些方法依赖一个关键假设:动作价值函数(Critic)必须关于动作可微。在实际控制问题中,涉及稀疏或离散奖励时,所得的 Q 函数往往是非平滑或不可微的。在这些条件下,DPG 更新所需的动作梯度变得未定义或高度不稳定,导致学习性能下降。作者指出,标准的时序差分(TD)学习并未显式约束 Critic 动作梯度的平滑性,使得 DPG 对机器人和自动驾驶中常见的不规则奖励景观敏感。
方法论
本文提出了软确定性策略梯度(Soft-DPG),该框架用通过高斯平滑(GS)构建的σ-平滑贝尔曼方程替代了标准贝尔曼备份。
核心理论框架
σ-平滑贝尔曼方程:该方法不是学习标准 Q 函数 Qπ(s,a),而是学习平滑后的动作价值函数 Qσπ(s,a)。这被定义为新算子 Tσπ 的不动点:
Qσπ(s,a)=R(s,a)+γEs′∼P(⋅∣s,a),w∼N(0,I)[Qσπ(s′,π(s′)+σw)]
关键在于,平滑直接应用于贝尔曼备份算子,从而确保所得价值函数与平滑动力学一致,而非对已学习的 Critic 进行事后平滑。
Soft-DPG 定理:通过利用高斯平滑的性质,作者推导出了一个新的策略梯度定理。与需要 ∇aQ(s,a) 的标准 DPG 不同,Soft-DPG 梯度仅依赖于平滑 Critic 在扰动动作处的函数评估:
∇θJσ=Es∼ρνθ,a~∼νθ[σ21∇θπθ(s)(a~−πθ(s))Qσπθ(s,a~)]
其中 a~=πθ(s)+σw。该公式消除了对 Critic 动作梯度的显式依赖,确保即使底层 Q 函数不可微,梯度依然有定义。
理论保证:本文对平滑参数 σ 引入的近似误差提供了严格的界限。它表明,只要奖励和转移动力学满足 Lipschitz 连续性条件,原始价值函数与平滑版本之间的差异就是有界且可控的。
算法实现:Soft DDPG
作者将该框架实例化为一种名为Soft DDPG的深度强化学习算法。该算法遵循标准 DDPG 架构(带有经验回放池和目标网络的演员 - 评论家结构),但修改了更新规则:
- Critic 更新:目标值使用高斯扰动后的目标动作(a~′=πˉ(s′)+σw)计算,实际上训练 Critic 去逼近平滑贝尔曼算子的不动点。
- Actor 更新:策略通过采样高斯扰动动作并评估平滑 Critic 进行更新,避免了计算 ∇aQ。
主要贡献
本文概述了三项主要贡献:
- Soft-DPG 框架:提出了一种原则性框架,通过将高斯平滑直接融入贝尔曼算子,克服了标准 DPG 的可微性限制。
- 理论分析:推导了原始 MDP 与平滑 MDP 之间动作价值函数和状态价值函数近似误差的分析上界,为平滑参数引入的偏差提供了形式化保证。
- Soft DDPG 算法:实现了一种实用的深度强化学习算法,证明了其具有竞争力的稳定性和性能,特别是在具有不规则奖励表面的环境中。
实验结果
作者在标准 MuJoCo 连续控制基准(OpenAI Gym)及其离散化奖励变体上评估了 Soft DDPG。
- 连续奖励环境:在标准稠密奖励设置中(如 HalfCheetah、Hopper),普通 DDPG 通常能达到更高的性能。作者指出,这在理论上是预期的,因为当底层价值函数本身平滑时,高斯平滑会引入近似偏差。然而,Soft DDPG 在这些设置中仍具有竞争力。
- 离散奖励环境:在奖励稀疏、离散或不平滑的环境中,Soft DDPG 展现出比标准 DDPG 明显且一致的增益。在具有离散化奖励的Ant、Hopper和Inverted Double Pendulum等任务中,标准 DDPG 因梯度未定义而遭受学习不稳定,而 Soft DDPG 则保持稳定的策略更新并实现更高的最终回报。
- 其他基准:在* BipedalWalker和MountainCar*等具有离散奖励的环境中的进一步实验证实,Soft DDPG 在大多数非平滑场景中优于基线。
意义与主张
本文主张,Soft-DPG 为确定性策略梯度在不平滑环境中的不稳定性提供了一种原则性解决方案。通过消除对 Critic 动作梯度的依赖,该方法确保即使 Q 函数不可微,策略更新依然有定义。
作者将 Soft DDPG 定位为处理涉及不规则奖励景观的控制任务的稳健替代方案,例如机器人和自动驾驶中常见的稀疏或离散奖励场景。他们承认了局限性,指出该方法引入了需要调节的平滑参数 σ,并且像其他基于 DDPG 的方法一样,继承了深度强化学习设置中对超参数的敏感性且缺乏收敛保证。这项工作并不声称要在所有场景中取代 DDPG,而是旨在将其适用范围扩展到标准假设失效的更广泛问题类别。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。