← 最新论文
🤖 machine learning

BiTrajDiff: Bidirectional Trajectory Generation with Diffusion Models for Offline Reinforcement Learning

BiTrajDiff 是一种用于离线强化学习的新型数据增强框架,它利用双向扩散模型从中间状态生成未来和过去的轨迹,从而通过探索多样化的行为模式来克服数据集分布偏差并提升策略的泛化能力。

原作者: Yunpeng Qing, Yixiao Chi, Shuo Chen, Shunyu Liu, Kexuan Zhou, Sixu Lin, Litao Liu, Changqing Zou

发布于 2026-05-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Yunpeng Qing, Yixiao Chi, Shuo Chen, Shunyu Liu, Kexuan Zhou, Sixu Lin, Litao Liu, Changqing Zou

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是关于BiTrajDiff论文的解释,将其拆解为简单概念并辅以富有创意的类比。

核心难题:机器人学习的“单行道”

想象一下,你正在教机器人如何穿越迷宫。你只有一段人类穿越迷宫的视频记录。但问题在于:视频中的人类只走过左边的走廊或右边的走廊,他们从未穿过中间的连接门。

在**离线强化学习(Offline RL)**领域,这是一个常见问题。机器人从静态数据集(视频)中学习,因为害怕犯错(“分布外”错误)而不敢尝试任何新事物。因此,它被困在左边或右边的走廊里,从未发现穿过那扇门可以获得更好的奖励。

现有方法试图利用 AI 来“想象”新路径。然而,大多数这些方法就像单行道生成器

  • 如果从左边开始,它们只会想象更多向左走的路径。
  • 如果从右边开始,它们只会想象更多向右走的路径。
  • 它们很少能构思出一条从左边 \rightarrow\rightarrow 右边的路径。它们保留了原始劣质数据中的“连通性”。

解决方案:BiTrajDiff(“双向缝合器”)

作者提出了一种名为BiTrajDiff的新方法。该方法不再仅仅向前或向后看,而是同时向两个方向观察,以在断开的路径之间搭建桥梁。

这就像一位裁缝用两块不同的布料缝制一件新裙子

  1. 锚定点(针):AI 从原始视频中选取房间中间的一个特定点(状态)。我们称之为“锚点”。
  2. 前向线程(未来):AI 问道:“如果我站在这个锚点上,一个好的未来是什么样子的?”它从该点生成一条向前移动的路径。
  3. 后向线程(历史):AI 问道:“如果我站在这个锚点上,我是如何到达这里的?”它从该点生成一条向后移动的路径。
  4. 缝合:当 AI 在锚点处将这两条线程缝合在一起时,奇迹发生了。突然,它创造了一条全新的完整路径,将“左走廊”通过门连接到“右走廊”——这是一条在原始视频中从未存在过的路径。

工作原理(分步解析)

  1. 培训裁缝:系统训练了两个独立的"AI 裁缝”(扩散模型)。一个是预测未来的专家,另一个是重构过去的专家。
  2. 生成部件:系统从旧数据中随机选取一个点。它要求“未来裁缝”绘制一条向前的路径,同时要求“过去裁缝”绘制一条向后的路径。
  3. 填补空白:AI 随后使用“逆向动力学”工具来推断需要哪些动作(移动)和奖励(分数)才能使这些绘制出的路径变为现实。
  4. 质量控制(守门员):并非每条缝合的路径都是好的。有些可能看起来很奇怪或不可能。系统设有一个“守门员”(过滤器)来检查两点:
    • 是否真实?(它看起来像是在迷宫中实际可能发生的情况吗?)
    • 是否优质?(它能带来高分吗?)
    • 如果答案是否定的,该路径就会被丢弃。如果是肯定的,它就会被添加到训练数据集中。

为何更优

该论文在D4RL 基准测试(一套标准的机器人控制任务集,包括行走、奔跑和穿越迷宫)上对此进行了测试。

  • 结果:通过将前向和后向路径缝合在一起,BiTrajDiff 在以前相互隔离的行为之间创建了“桥梁”。
  • 类比:如果旧数据是一座拥有两个互不往来的图书室的图书馆,那么 BiTrajDiff 就建造了一条连接它们的走廊。现在,机器人可以阅读左图书室的书,穿过新走廊,再阅读右图书室的书。
  • 成果:使用这种新的“缝合”数据训练的机器人,比仅使用旧数据或使用单向方法生成数据训练的机器人学得更快、表现更好。它们能够解决(例如穿越迷宫中的门)那些原始数据声称不可能完成的任务。

总结

BiTrajDiff是一种通过“想象”新体验来教导机器人的新方法。它不再仅仅猜测接下来会发生什么,而是同时猜测之前发生了什么以及接下来会发生什么,然后将它们缝合在一起,创造出一个完整且高质量的故事。这使得机器人能够从原始训练视频中缺失的“如果”情景中学习,从而克服过去经验的局限性。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →