← 最新论文
🤖 machine learning

Offline Reinforcement Learning with Generative Trajectory Policies

本文介绍了生成式轨迹策略(GTPs),这是一种统一的离线强化学习框架,通过学习基于连续时间常微分方程的轨迹解映射,弥合了缓慢的扩散模型与快速的一致性模型之间的差距,在 D4RL 基准测试中实现了最先进性能,包括在具有挑战性的 AntMaze 任务中获得满分。

原作者: Xinsong Feng, Leshu Tang, Chenan Wang, Haipeng Chen

发布于 2026-05-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Xinsong Feng, Leshu Tang, Chenan Wang, Haipeng Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人如何穿过一个复杂的迷宫。你拥有一个巨大的视频库,里面记录了其他机器人尝试完成这项任务的画面,但你无法让新机器人在现实世界中练习;它必须完全通过观看这些旧视频来学习。这就是离线强化学习所面临的挑战。

问题在于,这些视频展示了多种不同的移动方式。有时机器人向左转,有时向右转,有时它会踉跄,有时则完美滑行。一个简单的大脑可能会感到困惑,试图将这些动作“平均化”,结果导致机器人只是在原地打转。它需要一个能够同时理解所有这些不同可能性的大脑。

旧困境:慢 vs. 笨

过去,研究人员试图利用两种主要类型的工具来构建这些“聪明的大脑”,但他们面临着一个令人沮丧的权衡:

  1. 慢速艺术家(扩散模型): 想象一位艺术家,他从一个覆盖着静态噪声的空白画布开始,通过缓慢、逐步的 refinement,直到完美的图像出现。这种方法在捕捉复杂细节和不同风格(多模态行为)方面极其出色。然而,绘制一幅画需要很长时间。如果你的机器人需要每秒做出一次决策,这种缓慢的过程就太迟钝,无法实用。
  2. 快速速写者(一致性模型): 现在想象一位速写者,他试图用一两笔快速的 strokes 画出最终的画面。它极其迅速,但由于跳过了 refinement 步骤,画出来的东西往往模糊或错误。机器人移动得很快,但因为对世界的理解过于简单,它会撞墙。

新方案:“生成轨迹策略”(GTP)

这篇论文的作者 Xinsong Feng 及其同事表示:“为什么要在慢速和快速之间做选择?让我们构建一个兼具两者的机器人大脑。”

他们引入了一种名为生成轨迹策略(Generative Trajectory Policies, GTP)的新方法。要理解其工作原理,请将机器人的移动想象成不是从 A 点到 B 点的单次跳跃,而是一段连续的旅程电影

  • 统一视角: 作者意识到,“慢速艺术家”和“快速速写者”实际上只是从不同角度观看同一部电影。它们都在尝试求解一个描述机器人如何从混乱(噪声)走向秩序(完美动作)的数学方程(常微分方程,或 ODE)。
  • 魔法技巧: 与其逐帧观看电影(慢速)或瞬间猜测结局(快速),GTP 一次性学习整部电影的全图。它学习“解映射”,无论需要多少步,都能确切地告诉它如何从噪声中的任何一点到达完美的动作。

他们如何实现(两个技巧)

从头开始学习这张“整部电影的全图”非常困难。如果机器人早期猜错了,它就会陷入困惑并不断做出更糟糕的猜测。作者添加了两个巧妙的“技巧”使其变得可行:

  1. “作弊表”(分数近似):
    通常,为了学习电影全图,机器人必须反复模拟整部电影来检查其工作。这在计算上非常昂贵。
    • 类比: 想象试图通过演奏整部交响乐来检查是否击中了正确的音符,以此学习一首歌。作者说:“不,只需查看乐谱。”他们找到了一种方法,使用一个简单的直接公式(一张“作弊表”)来检查机器人的进度,而无需模拟整部电影。这使得训练既快速又稳定,防止机器人陷入混乱的螺旋。
  2. “教练的哨声”(价值驱动引导):
    仅仅复制视频是不够的;机器人需要学会比视频中更好的动作。
    • 类比: 想象一位教练观看视频库。当视频中的机器人做出导致高分的动作时,教练吹哨说:“多做那个!”当机器人做出糟糕的动作时,教练说:“别做那个。”
    • 作者建立了一个系统,其中“评论家”(教练)观察机器人的训练并加权这些教训。它告诉机器人要特别关注视频中高分的动作,实际上教会它在仅仅复制的基础上进行改进。

结果

该团队在著名的D4RL挑战集上测试了这个新机器人大脑,其中包括双足行走和穿越复杂迷宫(AntMaze)等任务。

  • 结果: GTP 击败了几乎所有其他方法。它既快得足以实用,又聪明得足以处理最困难的多步骤谜题。
  • 亮点: 在臭名昭著的"AntMaze"任务中(机器人必须穿越一个巨大且蜿蜒的迷宫),GTP 在多个关卡上取得了满分,这是以前的方法难以做到的。

总结

简而言之,作者弥合了“慢但聪明”与“快但笨”之间的鸿沟。通过将机器人移动视为连续旅程,并利用“作弊表”高效地学习它,他们创造了一种既具有高表现力(能处理复杂、多选项行为)又具有计算效率的策略。他们证明了在离线学习中,你不必为了智能而牺牲速度。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →