想象一下,你正在教一个机器人如何行走、奔跑或跳跃。通常,你需要让机器人实际尝试这些动作数千小时,记录每一步、每一次摇晃以及它获得的每一次奖励。这就是“离线”部分:从海量预录制的过往尝试库中学习,而机器人不再与真实世界进行交互。
问题在于,这个库往往是不完整的。它可能有一段机器人摔倒的视频,但缺少导致摔倒的具体指令(即“动作”),或者缺少奖励分数。如果没有完整的故事——状态(它在哪里)、动作(它做了什么)、奖励(它做得有多好)以及下一状态(它最终到了哪里)——机器人的大脑就难以高效学习。
旧方法:遗忘细节的“梦想家”
研究人员曾尝试利用扩散模型(一种以生成逼真图像而闻名的 AI)来“构想”新场景以填补空白。可以将这些模型想象成一位富有创造力的作家,能够构想出一段机器人流畅奔跑的完美 10 秒视频。
然而,此前版本的这位“梦想家”存在一个缺陷:它们擅长构想场景(机器人的位置及其获得的分数),却不擅长记住机器人实际做了什么才达到那个结果。它们生成了电影,却忘记了剧本。由于缺乏具体的动作,它们无法使用标准且高效的学习方法(称为“单步学习”)来训练机器人,而不得不采用更慢、更复杂的变通方案。
新方案:DAWM(导演与编剧)
本文作者提出了一种名为DAWM(扩散动作世界模型)的新系统。他们通过将工作拆分为两个专业角色,就像电影制作团队一样,解决了“缺失剧本”的问题:
- 导演(扩散模型):这个 AI 是富有创造力的愿景家。它观察机器人当前的位置以及机器人应该瞄准的目标分数,然后“构想”出机器人未来将处于的位置以及将获得哪些奖励的逼真序列。它非常擅长预测结果,但不知道如何实现。
- 编剧(逆动力学模型):这是一个独立的、轻量级的 AI,专门训练用于观察事件序列(机器人曾在哪里、最终到了哪里),并推断出“必须发生了哪个动作才导致了这一结果?”。它就像一名侦探,重构缺失的动作。
魔法时刻:
DAWM 将导演的构想(未来状态和奖励)交给编剧。编剧填补了缺失的“动作”。突然间,你拥有了一个完整、完美的故事:这是我们的起点,这是我们采取的动作,这是获得的奖励,这是我们的终点。
为何这很重要
因为该系统现在拥有了完整的故事(状态 + 动作 + 奖励 + 下一状态),它可以使用标准且快速的学习技术来训练机器人。
- 速度:旧方法试图一次性生成整个故事(包括动作),既缓慢又不稳定,就像试图同时撰写小说、剪辑电影和配乐。DAWM 将任务分离,使其更快、更稳定。
- 性能:论文在 9 种不同的机器人运动任务(如跳跃机跳跃或猎豹奔跑)上测试了该方法。使用 DAWM“构想”数据进行训练的机器人,其表现优于使用旧版扩散方法训练的机器人。
- 逼真度:在许多情况下,在这些合成、AI 生成的故事上训练的机器人,其表现与在真实、杂乱的人类收集数据上训练的机器人一样出色。
核心结论
DAWM 就像一位智能助手,能够为机器人构想完美的训练场景,并立即填补缺失的细节,使机器人能够高效地从中学习。它弥合了“创造性想象”(生成新数据)与“实践学习”(利用该数据进行改进)之间的鸿沟,使机器人能够更快、更好地学习,而无需在现实世界中实际练习每一个动作。
技术摘要:DAWM——基于动作推断转移的离线强化学习扩散动作世界模型
1. 问题陈述
基于扩散的世界模型在合成用于离线强化学习(RL)的逼真长视野轨迹方面已展现出强大的能力。然而,现有方法与依赖单步时序差分(TD)学习的标准基于价值的离线 RL 算法(如 TD3BC、IQL)存在关键的兼容性问题。
- 无动作模型的局限性: 像扩散世界模型(DWM)这样的方法生成未来状态和奖励,但不显式生成动作。因此,它们无法构建完整的转移 (s,a,r,s′),使其与单步 TD 学习不兼容,而后者需要状态、动作和奖励之间的一致性以进行有效的评论家(critic)正则化。
- 联合建模的局限性: 试图联合建模状态、奖励和动作的方法通常面临训练复杂度和不稳定性的增加,导致实际性能下降。
- 基于规划方法的局限性: 通过逆动力学模型(IDM)或联合建模来恢复动作的基于扩散的规划器(如 Diffuser、Decision Diffuser)通常依赖迭代采样和后验奖励选择。这导致高昂的推理成本,并绕过了单步 TD 学习的效率。
核心挑战在于生成支持稳定、高效的单步 TD 学习的合成数据,同时避免联合建模的训练不稳定性或迭代规划的推理成本。
2. 方法论:DAWM
作者提出了DAWM(扩散动作世界模型),这是一个模块化框架,将轨迹生成与动作推断解耦,以生成适用于离线 RL 的完整、带标签的转移。该框架包含两个主要阶段:
阶段 1:条件扩散轨迹生成
- 训练一个扩散模型 pθ,使其根据当前状态 st、动作 at 和目标剩余回报(Rtg)生成未来的状态和奖励序列。
- 该模型定义了条件分布 pθ(s^t+1:t+H+1,r^t:t+H∣st,at,Rtg)。
- 训练目标使用带有无分类器引导的评分去噪目标,最小化预测噪声与真实噪声之间的期望误差。
- 关键在于,该模型生成无动作的轨迹(仅包含状态和奖励),通过避免在扩散过程中联合建模动作的复杂性,简化了生成任务。
阶段 2:通过逆动力学模型(IDM)完成动作
- 为了将无动作轨迹转换为完整的转移,采用了一个单独训练的逆动力学模型(IDM),记为 fϕ。
- IDM 通过建模分布 fϕ(at∣st−m:t−1,st,st+1) 为对角高斯分布,来重构缺失的动作。
- IDM 在真实的离线数据上进行训练,以最大化给定状态转移下观测动作的似然度。
- 在推理阶段,将 IDM 应用于扩散生成的轨迹以推断动作,从而产生完整的元组 (s,a,r,s′)。
离线策略训练
- 合成的完整转移用于训练离线 RL 智能体,采用标准的基于价值的算法,具体为TD3BC(在 TD3 基础上增加行为克隆正则化器)和IQL(执行优势加权的监督回归)。
- Q 函数使用从重构转移计算的 Bellman 目标进行更新,从而实现高效的单步 TD 更新。
3. 主要贡献
- 模块化框架: 作者提出了一种高效的框架,将基于扩散的状态 - 奖励生成与单独训练的 IDM 动作推断相结合。该设计避免了联合建模的训练不稳定性,同时生成了完整的转移。
- 与单步 TD 学习的兼容性: 通过生成完整的 (s,a,r,s′) 转移,DAWM 使得依赖单步 TD 学习的保守离线 RL 算法(TD3BC、IQL)得以应用,提供了一种计算上比迭代扩散规划器更高效的替代方案。
- 实证性能: 论文表明,保守的离线 RL 算法受益于在这些增强轨迹上的训练,在多个 D4RL 运动控制任务中始终优于先前的基于扩散的基线(DWM、DD)。
- 合成数据的可行性: 结果表明,在 DAWM 生成的合成数据上训练的智能体,其性能可与在真实离线数据集上训练的智能体相当甚至超越,突显了合成轨迹作为实用替代方案的潜力。
4. 实验结果
实验在 9 个标准的 D4RL 运动控制基准(Hopper、Walker2d、HalfCheetah)上进行,涵盖不同的数据质量(Medium、Medium-Replay、Medium-Expert)。
- 与 DWM 的比较: DAWM 始终优于无动作的 DWM 基线。使用 TD3BC 时,DAWM 平均提升了9.3%,使用 IQL 时提升了9.5%。在 Walker2d 等复杂控制任务中,提升尤为显著。
- 与基于规划方法的比较(DD): 在归一化回报方面,DAWM 优于决策扩散器(DD)。此外,DAWM 表现出显著更高的效率,推理速度比 DD 快约4.0 倍,因为它在推理过程中避免了迭代采样。
- 与真实数据的比较: 在 DAWM 生成数据上训练的智能体,其归一化回报与使用标准 TD3BC/IQL 在真实数据上训练的智能体相当,在某些情况下(例如使用 TD3BC 的 Hopper-MR)甚至优于后者。虽然 SSORL(一种在真实数据上使用 IDM 的基线)表现良好,但作者指出,SSORL 受益于对最长轨迹的筛选,而这一因素在 DAWM 的固定长度生成中并不存在。
- 消融研究:
- 数据量(DAWM-T): 将条件对的数量减少 8 倍(DAWM-T)仅导致性能小幅下降,表明动作完成机制比单纯的数据量更为关键。
- 生成视野: DAWM 在不同的生成视野(H=1,3,7)下均保持了稳健的性能,表明无论 rollout 长度如何,单步 TD 学习框架都是稳定的。
5. 意义与主张
论文声称 DAWM 弥合了高效生成建模与基于 TD 的策略学习之间的鸿沟。其主要意义在于:
- 实现单步 TD 学习: 它提供了一种机制,使得扩散生成的数据可用于标准的、稳定的离线 RL 算法,而这些算法此前与无动作世界模型不兼容。
- 计算效率: 通过降低与迭代规划方法相比的推理成本,它为大规模生成式离线 RL 提供了一种实用解决方案。
- 实用替代方案: 结果表明,通过这种模块化方法生成的合成轨迹可以作为真实离线数据集的可行、高质量替代方案,有望缓解现实世界应用中因探索昂贵或危险而导致的数据稀缺问题。
作者总结道,虽然该方法显示出前景,但未来的工作将研究将其扩展到视觉控制、高维机器人领域以及在不完美的动力学下的鲁棒性。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。