← 最新论文
🤖 machine learning

Soft Deterministic Policy Gradient with Gaussian Smoothing

本文介绍了软确定性策略梯度(Soft-DPG),这是一种新颖的强化学习框架,它采用高斯平滑来消除对评论家动作梯度的需求,从而确保在稀疏或离散奖励导致标准 DPG 方法失效的连续控制任务中实现稳定学习和性能提升。

原作者: Hyunjun Na, Donghwan Lee

发布于 2026-05-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Hyunjun Na, Donghwan Lee

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人穿过房间。在强化学习(RL)的世界里,机器人通过尝试各种动作、获得反馈(奖励)并调整步伐以便下次做得更好来学习。

教导这个机器人主要有两种方法:

  1. “赌徒”方法(随机性): 机器人尝试许多不同的随机步伐,观察哪些有效,然后取平均值。这种方法安全但缓慢。
  2. “精准”方法(确定性): 机器人选择一个它认为完美的特定步伐,并试图优化这一确切动作。这种方法快速高效,但存在一个重大缺陷。

问题所在:“模糊地图”困境

“精准”方法(称为确定性策略梯度或 DPG)依赖一个非常具体的规则:为了知道该向机器人的脚部施加哪个方向的微小推力,教师(即“评论家”)需要查看奖励地图并说:“如果你将脚向左侧移动极其微小的一点点,分数就会上升。”

如果奖励地图是平滑的,就像一座缓坡,这非常有效。但在现实世界中,奖励往往是块状且锯齿状的

  • 想象一种奖励机制:只有当你精确地踩在特定的地砖上时,你才能得到一块饼干;哪怕偏离一毫米,你就得不到任何饼干。
  • 在这张“块状”地图上,没有平滑的坡度可供遵循。“梯度”(即移动方向)是断裂的、锯齿状的,或者根本不存在。
  • 当机器人试图在这张锯齿状的地图上使用“精准”方法时,它会感到困惑。它试图在悬崖边缘计算坡度,导致剧烈且不稳定的运动。论文将这种现象称为“定义不明的策略梯度”。

解决方案:“模糊透镜”(高斯平滑)

作者 Hyunjun Na 和 Donghwan Lee 提出了一种巧妙的修复方案,称为软确定性策略梯度(Soft-DPG)

他们不是直接去读取那张锯齿状、块状的地图,而是在其上覆盖了一层柔和、模糊的透镜

  • 隐喻: 想象透过毛玻璃观察一张像素化、锯齿状的图像。那些尖锐、令人困惑的边缘会模糊融合成一座平滑、柔和的山丘。
  • 工作原理: 机器人不再询问“对于确切这一步的奖励是多少?”,而是询问“对于这一步及其周围紧邻步骤的平均奖励是多少?”
  • 通过平均邻近动作的奖励(使用一种称为高斯平滑的技术),他们将那张锯齿状、断裂的地图变成了一座平滑、可攀登的山丘。

新算法:Soft DDPG

他们构建了一种名为Soft DDPG的新机器人训练器。以下是它与旧方法的区别:

  1. 旧方法(DDPG): 机器人试图攀登一座锯齿状的悬崖。由于地图过于粗糙难以读取,它会滑倒、跌落并感到沮丧。
  2. 新方法(Soft DDPG): 机器人透过柔和的透镜观察地图。锯齿状的悬崖变成了平滑的斜坡。现在,即使底层现实依然锯齿状,它也能轻松看清哪边是“上”,并稳步攀登。

论文发现

作者在标准的机器人行走任务(如猎豹奔跑或人类行走)上测试了该方法,随后创建了这些任务的“锯齿状”版本,其中奖励被突然截断或离散化(就像“地砖上的饼干”示例)。

  • 在平滑世界中: 当奖励本身已经非常平滑时,旧方法(DDPG)表现依然很好,而新方法(Soft DDPG)同样出色,尽管由于需要进行额外的平均计算,速度稍慢。
  • 在锯齿状世界中: 奇迹就在这里发生。在“锯齿状”环境中,旧方法崩溃并失败。而新方法(Soft DPG)则表现出色。它保持稳定并成功学会了行走,因为它不会在断裂的梯度上绊倒。

核心结论

该论文认为,如果你在一个混乱的现实世界环境中训练人工智能,而那里的奖励并非完美平滑(这几乎总是如此),你不应该强迫人工智能直接去读取那张锯齿状的地图。相反,你应该给它一个“柔和”的世界视角。这种模糊地图的简单技巧,使得人工智能即使在游戏规则粗糙且断裂的情况下,也能平稳可靠地学习。

关键要点: 你不需要修复那个锯齿状的世界;你只需要教会机器人柔和地看待它。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →