← 最新论文
🤖 machine learning

DAWM: Diffusion Action World Models for Offline Reinforcement Learning via Action-Inferred Transitions

本文提出了DAWM,这是一种模块化的基于扩散的世界模型,能够根据当前状态和动作生成未来的状态 - 奖励轨迹,并搭配一个逆动力学模型以推断动作,从而为离线强化学习实现高效的一步时序差分训练,并在D4RL基准测试中超越了现有基线方法。

原作者: Zongyue Li, Xiao Han, Yusong Li, Niklas Strauss, Matthias Schubert

发布于 2026-05-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Zongyue Li, Xiao Han, Yusong Li, Niklas Strauss, Matthias Schubert

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人如何行走、奔跑或跳跃。通常,你需要让机器人实际尝试这些动作数千小时,记录每一步、每一次摇晃以及它获得的每一次奖励。这就是“离线”部分:从海量预录制的过往尝试库中学习,而机器人不再与真实世界进行交互。

问题在于,这个库往往是不完整的。它可能有一段机器人摔倒的视频,但缺少导致摔倒的具体指令(即“动作”),或者缺少奖励分数。如果没有完整的故事——状态(它在哪里)、动作(它做了什么)、奖励(它做得有多好)以及下一状态(它最终到了哪里)——机器人的大脑就难以高效学习。

旧方法:遗忘细节的“梦想家”

研究人员曾尝试利用扩散模型(一种以生成逼真图像而闻名的 AI)来“构想”新场景以填补空白。可以将这些模型想象成一位富有创造力的作家,能够构想出一段机器人流畅奔跑的完美 10 秒视频。

然而,此前版本的这位“梦想家”存在一个缺陷:它们擅长构想场景(机器人的位置及其获得的分数),却不擅长记住机器人实际做了什么才达到那个结果。它们生成了电影,却忘记了剧本。由于缺乏具体的动作,它们无法使用标准且高效的学习方法(称为“单步学习”)来训练机器人,而不得不采用更慢、更复杂的变通方案。

新方案:DAWM(导演与编剧)

本文作者提出了一种名为DAWM(扩散动作世界模型)的新系统。他们通过将工作拆分为两个专业角色,就像电影制作团队一样,解决了“缺失剧本”的问题:

  1. 导演(扩散模型):这个 AI 是富有创造力的愿景家。它观察机器人当前的位置以及机器人应该瞄准的目标分数,然后“构想”出机器人未来将处于的位置以及将获得哪些奖励的逼真序列。它非常擅长预测结果,但不知道如何实现
  2. 编剧(逆动力学模型):这是一个独立的、轻量级的 AI,专门训练用于观察事件序列(机器人曾在哪里、最终到了哪里),并推断出“必须发生了哪个动作才导致了这一结果?”。它就像一名侦探,重构缺失的动作。

魔法时刻
DAWM 将导演的构想(未来状态和奖励)交给编剧。编剧填补了缺失的“动作”。突然间,你拥有了一个完整、完美的故事:这是我们的起点,这是我们采取的动作,这是获得的奖励,这是我们的终点。

为何这很重要

因为该系统现在拥有了完整的故事(状态 + 动作 + 奖励 + 下一状态),它可以使用标准且快速的学习技术来训练机器人。

  • 速度:旧方法试图一次性生成整个故事(包括动作),既缓慢又不稳定,就像试图同时撰写小说、剪辑电影和配乐。DAWM 将任务分离,使其更快、更稳定。
  • 性能:论文在 9 种不同的机器人运动任务(如跳跃机跳跃或猎豹奔跑)上测试了该方法。使用 DAWM“构想”数据进行训练的机器人,其表现优于使用旧版扩散方法训练的机器人。
  • 逼真度:在许多情况下,在这些合成、AI 生成的故事上训练的机器人,其表现与在真实、杂乱的人类收集数据上训练的机器人一样出色。

核心结论

DAWM 就像一位智能助手,能够为机器人构想完美的训练场景,并立即填补缺失的细节,使机器人能够高效地从中学习。它弥合了“创造性想象”(生成新数据)与“实践学习”(利用该数据进行改进)之间的鸿沟,使机器人能够更快、更好地学习,而无需在现实世界中实际练习每一个动作。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →