← 最新论文
🤖 machine learning

Shaping Sparse Rewards in Reinforcement Learning: A Semi-supervised Approach

本文提出了一种半监督奖励塑形方法,该方法通过新颖的数据增强技术利用非零奖励和零奖励转换来学习轨迹表示,在 Atari 和机器人操作等稀疏奖励环境中显著优于监督基线。

原作者: Wenyun Li, Wenjie Huang, Chen Sun

发布于 2026-05-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Wenyun Li, Wenjie Huang, Chen Sun

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人玩电子游戏,比如《蒙捷祖玛的复仇》或《海战》。在这些游戏中,只有当机器人完成非常具体的动作(例如救起一名潜水员或到达目标)时,它才会获得“竖起大拇指”(即奖励)。在 99% 的时间里,机器人只是在四处游荡,而游戏对它零反馈。这就像在黑暗中学习骑自行车,只有当你恰好保持直立整整一分钟时,才会得到一句“干得好!”,但当你摇晃或摔倒时,却得不到任何提示。

这就是稀疏奖励问题。由于机器人很少得到“干得好”的反馈,它很难弄清楚自己究竟做对了什么。

旧方法:猜测与验证

传统上,研究人员试图通过让人类教师观察机器人并说“嘿,那个动作不错!”,或者使用仅从机器人实际成功的罕见时刻进行学习的计算机程序来解决这个问题。

  • 问题所在:这就像试图只通过阅读你已知道单词的词典条目来学习一门语言。如果你只研究那几次获得“竖起大拇指”的时刻,你就没有足够的数据来学习游戏的规则。

新想法:“半监督”侦探

本文的作者提出了一种名为SSRS(半监督奖励塑形)的新方法。这就像聘请了一位非常擅长“读心术”(即从字里行间推断含义)的侦探。

以下是其工作原理,使用一个简单的类比:

1. 两类线索

  • “黄金”线索:这是机器人获得真实奖励(即“竖起大拇指”)的罕见时刻。
  • “沉默”线索:这是机器人获得零奖励的数百万个时刻。
  • 旧方法:只查看“黄金”线索。
  • SSRS 方法:同时查看两者。它假设即使机器人得分为零,它可能仍然在做一些“还可以”或“几乎正确”的事情。

2. 侦探的逻辑(半监督学习)
侦探(AI 模型)查看“黄金”线索以了解什么样的动作是“好”的。然后,它查看“沉默”线索。它会问:“这个沉默的动作看起来很像我之前看到的那个‘黄金’动作。也许它也值得一个小小的‘干得好’?”

它使用了一种称为一致性正则化的技术。想象一下,你给侦探看一张猫的照片,但稍微模糊了它或改变了光线。侦探仍然应该说:“那是一只猫。”如果它说“那是一只狗”,那就说明它困惑了。

  • 在本文中,他们取机器人的路径(一系列动作),对其进行轻微调整(就像模糊照片一样),然后询问侦探奖励是否应该保持不变。如果答案是一致的,侦探就会学会信任自己对“沉默”线索的判断。

3. 秘密武器:“熵增强”
通常,当你为侦探调整数据时,可能会将其上下颠倒或切掉一部分(就像编辑照片一样)。但本文引入了一种巧妙的新技术,称为熵增强

  • 类比:想象机器人的路径是一首歌。“熵”是衡量这首歌有多混乱或多可预测的指标。
  • 侦探不是简单地将歌曲上下颠倒,而是分析歌曲的混乱程度。如果一条混乱的路径突然变得更加有序,这就是一个线索!
  • 作者发现,测量这种“混乱”(熵)是调整此类机器人学习数据的更好方法,优于传统的照片编辑技巧。它帮助侦探理解机器人的路径,而不会破坏游戏规则。

结果:重大胜利

研究人员在以下领域测试了该方法:

  1. Atari 游戏:奖励非常罕见的经典电子游戏。
  2. 机器人技术:机械臂尝试抓取一个方块。

结果

  • 新方法(SSRS)的学习速度比旧方法快得多,得分也更高。
  • 在最困难的游戏(如《蒙捷祖玛的复仇》)中,新方法取得的得分是之前最佳方法的两倍
  • 仅“熵”技巧一项,与其他调整数据的方法相比,就将性能提升了约15%

为什么这很重要

该论文声称,通过将“沉默”时刻(零奖励)视为有价值的数据而非空白区域,并利用这种新的“测量混乱”技巧帮助 AI 从中学习,我们可以更高效地教导机器人和游戏代理。这就像将那个你只能看到几个发光点的黑暗房间,转变为一个你可以看到整张地图的房间,因为你学会了如何解读阴影。

简而言之:这篇论文教导 AI 停止等待“金星”来学习,而是开始利用中间的安静时刻进行学习,并使用一种特殊的数学技巧来确保它不会感到困惑。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →