Feedback Manipulation Regularization: Enabling Offline Agent Alignment for Imitation Learning
本文介绍了一种反馈操纵正则化(Feedback Manipulation Regularization, FMR),这是一种与算法无关的方法,它利用评估性反馈作为纠正信号,显著提升了离线、全序列决策环境下模仿学习策略的对齐性能,即使在演示数据稀缺或存在噪声的情况下,也能实现高达 98% 的失配减少。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在试图教一个机器人如何在迷宫中行走或参加比赛。你有两种方法可以帮助它:你可以给它看一段完美运行的视频(演示/demonstration),或者你在它尝试时大声喊“做得好!”或“不,停下!”(反馈/feedback)。
长期以来,研究人员一直试图通过一种复杂的、多步骤的过程将这两者结合起来,这种方法在处理文本时效果很好,但在处理现实世界的运动时却表现挣扎。他们认为:“如果我们只是比较两条路径并说‘路径 A 比路径 B 更好’,机器人就会学习。”但本文的作者认为,这种“比较”的方法就像是试图通过只问“这辆车是不是比那辆车好?”来教一个人开车,却从未说过“你快撞上树了!”。这太模糊了。如果两辆车都在撞车,机器人可能只会选择那个撞得稍微轻一点的,并将其视为胜利。
核心思想:“温度”技巧
作者 Benjamin D. Poole 和 Minwoo Lee 提出了一种名为**反馈操纵正则化(Feedback Manipulation Regularization, FMR)**的新方法。把 FMR 想象成机器人口脑中的一个神奇恒温器。
FMR 不仅仅是比较路径,它会倾听你“好”或“坏”的喊声,并立即调整机器人的“温度”。
- 如果你对某个动作说“坏!”(负面反馈),FMR 会调高该动作的“温度”。在机器人的大脑中,这会让该动作感觉起来很“热”,从而不太可能再次发生。它会将概率分布到其他更安全的选择上。
- 如果你说“好!”(正面反馈),它会降低该动作的“温度”,让它感觉起来很“冷”,从而非常容易被再次选中。
这是一个单步过程,是在离线状态下完成的(这意味着机器人是从一堆旧数据中学习,而不是通过实时尝试来进行学习)。它几乎可以配合任何学习算法,充当一个由人类控制的“熵调节器”,引导机器人远离坏习惯并趋向于好习惯。
证据:Safety Gym
为了测试这一点,作者建立了一个名为 Safety Gymnasium 的数字游乐场。他们创建了两种类型的挑战:
- 导航(Navigation): 一个红球必须到达一个绿方块。有些路径是安全的,但隐藏的“危险因素”(如隐形墙或湿滑地面)会在触碰时扣除机器人的分数。
- 速度(Velocity): 机器人(如跳跃的青蛙或游泳的蛇)必须移动,但必须保持在特定的速度限制之下。移动过快被视为一种“失配(misalignment)”。
他们给机器人喂入了一混合数据:少量的完美专家演示(假设是 10 或 25 个视频)和大量的杂乱、不完美的演示(50 个机器人漫无目的游荡或撞车的视频)。
发生了什么?
结果非常强劲。
- 基准模型的挣扎: 在没有 FMR 的情况下,标准的学习算法(如 BC、IQL、DemoDICE 和 ReCOIL)会被杂乱的数据搞糊涂。随着完美数据的减少,它们的“失配率”(即撞击危险或违反速度限制的频率)上升了。
- FMR 的胜利: 当作者加入 FMR 后,机器人变得聪明得多。在导航任务中,对于表现最好的算法(ReCOIL+FMR),FMR 在“PathM”任务上减少了高达 92% 的失配,在“PathBB”任务上减少了 67%。
- 速度测试: 对于速度任务,FMR 的表现甚至更加剧烈。在“SlowSwim”任务上,它减少了高达 98% 的失配。即使当杂乱数据几乎毫无用处时,FMR 也能帮助机器人保持在轨道上。
FMR 不是什么
论文明确排除了其他几种想法。
- 它不仅仅是“奖励”: 他们尝试将“好/坏”反馈视为一个简单的分数(比如游戏积分),并将其喂入一个标准的奖励系统(称为 DVL)。但这并没有奏效。作者发现,将反馈视为原始奖励是无效的,因为反馈的目的是纠正行为,而不仅仅是增加分数。
- 它不仅仅是“比较”: 他们还尝试了一种名为对比偏好学习(Contrastive Preference Learning, CPL)的方法,该方法试图通过比较成对的路径来确定偏好。这也未能达到 FMR 的性能,尤其是在数据杂乱的情况下。作者认为,仅仅比较两条坏路径并不能给机器人提供足够清晰的方向来修正错误。
他们有多确定?
作者对这些结果非常有信心,因为他们使用不同的随机种子运行了 5 次 模拟,并对 100 万个训练批次 的最后 10 次评估进行了平均。他们不仅仅是在猜测;他们测量了“失配率”(产生成本的步骤比例)和“成功率”(机器人到达目标的频率)。
他们还测试了在拥有极少完美数据(好数据与坏数据的比例为 10 到 50)时 FMR 的表现如何。即使在这些艰难的“有限数据”环境下,FMR 依然能站得住脚,而其他方法则崩溃了。
不足之处
论文也承认了一个局限性:FMR 依赖于杂乱的数据与正确行为之间存在某种联系。如果杂乱的数据完全无关(例如,目标是向前走,但机器人却在原地打转),FMR 并不能奇迹般地修复它。这些“噪声”数据需要在其中包含至少一些正确的动作,反馈才能捕捉到它们。
简而言之,FMR 是一种巧妙的方法,利用简单的“好/坏”反馈来微调机器人的决策温度,使其比以前能更好地从杂乱数据中学习,且无需复杂的、多阶段的训练流水线。它表明,有时,一个简单的引导比复杂的比较更有效。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。