← 最新论文
🤖 machine learning

Learning the Supports for Categorical Critic in Reinforcement Learning

本文提出了一种新颖的演员-评论家强化学习方法,该方法能够动态学习高斯直方图损失(Gaussian Histogram Loss)的支持边界,从而在消除对预定义区间的需求的同时,提供更紧致的理论误差界限,并在连续控制任务上实现了与现有方法相当或更优的性能。

原作者: Jen-Yen Chang, Takayuki Osa, Tatsuya Harada

发布于 2026-07-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Jen-Yen Chang, Takayuki Osa, Tatsuya Harada

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试教一个机器人如何走路、跑步或保持平衡。为此,机器人需要一个“计分卡”(称为价值函数,Value Function),用来预测某个特定动作在未来会有多好。

传统上,机器人将这个分数计算为一个单一的数字,就像精确的温度读数(例如,“这个动作值 42.5 分”)。然而,未来是混乱且充满不确定性的。一个动作可能值 40 分,也可能因为运气好而值 80 分。

问题所在:“固定盒子”陷阱

为了处理这种不确定性,一些先进的机器人使用了一种叫做分布强化学习(Distributional RL)的方法。它们不再仅仅猜测一个数字,而是猜测一整组可能的范围。

论文讨论了一种特定的技术,叫做 HL-Gauss。想象你有一把长长的、空的尺子(一个“支撑区间”),你用它来测量这些分数。你将这把尺子分成 128 个微小的格子(bin)。机器人通过学习来表达:“有 10% 的概率分数落在第 1 个格子里,有 20% 的概率落在第 2 个格子里,”依此类推。

症结在于: 在旧的方法中,你必须在机器人开始学习之前就预先选定尺子的长度

  • 如果尺子太短: 机器人的未来得分可能会冲出尺子的末端。机器人会丢失这部分信息,就像试图用一把 1 英尺长的尺子去测量一根 10 英尺长的杆子。它会被截断(Truncated),导致机器人学到错误的经验。
  • 如果尺子太长: 为了测量 10 英尺的杆子,你可能会使用一把 1 英里长的尺子。但如果你只有 128 个格子来覆盖这一英里,那么每个格子都会变得巨大。机器人无法分辨 50 分和 51 分的区别,因为它们都落在了同一个巨大的格子里。这种“分辨率”变得过于模糊。

大问题是,在现实生活中,我们并不知道尺子需要多长。随着机器人的技能在学习过程中不断提升,其可能得分的范围也会随之改变。一个适合初学者的尺子,对于专家来说可能就毫无用处了。

解决方案:“智能伸缩尺”(DySEL)

作者提出了一种名为 DySEL(动态支撑端点学习,Dynamic Support Endpoint Learning)的新算法。他们不再提供一把固定的尺子,而是给机器人一把可伸缩、自调节的尺子

它是这样工作的,这里使用一个简单的类比:

想象机器人正试图将一堆沙子(可能的未来得分)装进一个桶里(即尺子)。

  1. 目标: 机器人希望桶尽可能小,以便让沙子被紧密填充(高分辨率),但它必须足够大,以容纳所有的沙子而不从侧面溢出。
  2. 冲突:
    • 如果桶太小,沙子会溢出(截断误差,Truncation Error)。
    • 如果桶太大,沙子会被分散得很稀薄(低分辨率,Low Resolution)。
  3. 游戏: 作者在机器人的大脑内部设置了一场“拔河”(一种极大-极小博弈/min-max game):
    • 玩家 A(优化者): 试图缩小桶的体积,以实现精确测量。
    • 玩家 B(执行者): 充当安全卫士。如果玩家 A 把桶缩得太小导致沙子开始溢出,玩家 B 就会大喊“停!”,并强制扩大桶的体积,直到刚好能接住溢出的沙子。

这场拔河赛让机器人能够在学习的每个阶段,自动找到最完美的尺寸。如果机器人刚开始学习且得分很小,桶就会保持很小;随着机器人变得更强、得分变得更高,桶就会自动拉伸以适应变化,而无需人类程序员去猜测尺寸。

他们发现了什么?

研究人员在各种机器人任务上测试了这种“伸缩尺”,比如让一只虚拟猎豹奔跑或让一个类人机器人行走。

  • 它有效: 在大多数任务中,使用伸缩尺的机器人表现得与使用固定尺子的顶尖机器人一样出色。
  • 它在困难情况下表现卓越: 在一些非常困难的任务(如“类人机器人”行走任务)中,伸缩尺的表现甚至更好。这是因为这些任务具有极其狂野且不可预测的得分范围,而固定的尺子根本无法应对。
  • 不再需要猜测: 最大的胜利在于,人类不再需要为每个新的机器人去猜测合适的尺子尺寸。机器人能够自行搞定。

总结

这篇论文介绍了一种让 AI 不再仅仅猜测其未来奖励的“范围”,而是开始学习范围本身的方法。通过将问题转化为“保持范围紧凑”与“捕捉所有数据”之间的平衡,机器人能够更高效地学习,并避免因使用过短或过模糊的尺子而导致的错误。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →