dVLA-RL: Reinforcement Learning over Denoising Trajectories for Discrete Diffusion Vision-Language-Action Models
本文介绍了 dVLA-RL,这是一种针对离散扩散视觉-语言-动作模型的强化学习框架,它通过优化去噪轨迹的联合概率,克服了边缘动作概率难以计算的问题,从而通过统一的、可变步长的调度方法,在机器人操控基准测试中实现了最先进的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人做一道复杂的菜肴,比如舒芙蕾。
旧方法(“复读机”问题):
以前,机器人通过观察人类厨师做一次动作,然后尝试完全复制这些动作来学习。这被称为“监督微调”(Supervised Fine-Tuning)。对于简单的任务,这种方法效果尚可,但如果厨房变得凌乱或者食材稍有不同,机器人就会陷入恐慌并失败。这就像是一个背下了练习题答案的学生,却无法解决一个新问题。
新工具(“去噪”机器人):
最近,科学家们构建了一种新型的机器人大脑,叫做 dVLA(离散扩散视觉-语言-动作模型)。这个机器人不再是瞬间做出决定,而是以一种“带有噪声”的方式进行思考。想象一下,机器人从一张布满涂鸦的白纸(噪声)开始。然后,它通过一步步擦除涂鸦,逐渐显现出完美的食谱。
- 第 1 步: 它猜出几个词。
- 第 2 步: 它根据所见内容对这些词进行精炼。
- 第 3 步: 它最终确定食谱。
这种“缓慢显现”的过程非常出色,因为它允许机器人迭代地完善它的计划,就像艺术家在勾勒线条之前先画草图一样。
缺失的一块(“强化学习”的差距):
虽然这种“缓慢显现”的机器人很聪明,但它仍然只是一个复读机。它还没有学会从自己的错误中学习。科学家们想要使用 强化学习(RL)——这是一种让机器人尝试各种操作,并根据成功获得“赞赏”(奖励)或失败获得“差评”(惩罚)来随时间不断进步的方法。
核心难题:
这里存在一个数学上的障碍。在标准的机器人大脑中,你可以很容易地计算出得到正确答案的概率。但在这种“缓慢显现”的机器人中,最终答案是经过一系列漫长且曲折的猜测路径而产生的。试图通过观察机器人可能采取的所有路径来计算最终结果的精确概率,就像是试图通过数清沙滩上的每一粒沙子来预测潮汐一样,这在数学上是无法实现的(不可计算的)。
解决方案:dVLA-RL(“旅程”法)
论文作者通过改变问题的切入点解决了这个问题,他们提出了 dVLA-RL。他们不再问:“得到最终完美答案的概率是多少?”而是问:“走完刚才那条特定路径的概率是多少?”
把这想象成电子游戏:
- 旧数学: 在比赛开始前,试图计算赢得整个锦나赛的概率。
- 新数学 (dVLA-RL): 计算你刚刚采取的具体步骤来达到下一关的概率。
通过将机器人的“缓慢显式”过程视为一个逐步进行的旅程(轨迹/trajectory),他们可以利用标准的强化学习来教导机器人。我们通过奖励机器人完成任务所采取的整个路径,而不仅仅是看最终的结果。
“混合”策略(“智能调度员”)
论文还引入了一个聪明的技巧,叫做 Hybrid dVLA-RL。
- 简单任务: 如果机器人擅长处理简单任务(比如拿起一个杯子),它不需要花费 10 个步骤去思考。它可以只用 1 或 2 个步骤。这节省了时间和能量。
- 复杂任务: 如果任务很复杂(比如堆叠积木塔),机器人可以被允许进行更多步骤来“思考”并完善计划。
这就像老师给学生布置作业:简单的题目进行快速测试,而对于复杂的科研论文,则允许采用论文的形式。这让机器人在处理简单工作时更快,在处理困难任务时更聪明。
实验结果
团队在两个主要的机器人训练场上测试了该方法:
- LIBERO: 一个用于单臂机器人的模拟环境。新方法实现了 99.7% 的成功率,几乎完美完成了所有任务。
- RoboTwin 2.0: 一个更难的、针对双臂机器人(类似人类)的模拟环境。与旧有的“复读机”版本相比,新方法将成功率提升了 30.6%,击败了其他顶尖的机器人大脑。
总结
这篇论文展示了一种教导“慢思考”机器人从自身经验中学习的方法。与其困于计算关于最终结果的无法实现的数学难题,不如教导机器人去学习它所经历的特定旅程。这使得机器人能够显著提升遵循指令的能力,并更好地处理复杂的物理任务。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。