← 最新论文
💻 computer science

TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models

该论文提出了 TEMPO,一种语义-动作解耦的强化学习框架,该框架在冻结视觉-语言骨干网络的同时,对语义投影层和动作专家采用不同的双时间尺度更新策略,以稳定高层表示并加速底层控制学习,从而在基准测试和真实世界的操控任务上均优于现有的监督学习和强化学习后训练方法。

原作者: Ziheng Liu, Quantao Yang

发布于 2026-08-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Ziheng Liu, Quantao Yang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个超级聪明的机器人做家务,比如叠衣服或做三明治。你不想手动编写每一个动作的程序;相反,你希望机器人通过观察你并亲自尝试来学习。这就是视觉-语言-动作(VLA)模型的世界。把这些模型想象成机器人的大脑,它结合了三种超能力:视觉(通过摄像头观察世界)、语言(理解你的口头指令,比如“把杯子放在桌子上”)以及动作(实际移动它的手臂去完成任务)。

在机器人能够自主学习之前,它通常会进行大规模的“预训练”,利用海量的数据库,这有点像学生在开始特定工作前读遍图书馆里的每一本书。这给了机器人对世界的通用理解。然而,当你要求它执行一项特定的新任务时,它通常需要额外的帮助。传统上,科学家们使用两种主要方式来提供这种帮助:监督式微调(SFT),这就像是给机器人看一段完美动作的视频,并要求它完全模仿;以及强化学习(RL),这就像是让机器人尝试任务,失败后得到一个“差评”,再次尝试,直到成功时得到一个“好评”。研究人员提出的核心问题是:我们如何教机器人更好地完成现实世界的任务,而不破坏它原有的聪明、通用的知识?

于是,由研究员 Ziheng Liu 和 Quantao Yang 提出的 TEMPO 方法登场了。想象一下机器人的大脑是一个由两部分组成的团队:一位理解大局和指令的学者(Scholar),以及一位研究如何通过具体肌肉运动来完成工作的杂工(Handyman)。在许多现有的方法中,当机器人试图从错误中学习时,科学家会以完全相同的速度更新整个团队。问题在于,如果你因为一次失误就让“学者”太快地改变想法,他们可能会忘记世界的通用规则,导致“杂工”感到困惑并最终失败。

TEMPO 通过拆分团队的学习进度来解决这个问题。它冻结了学者的核心知识(即“预训练的视觉-语言骨干网络”),这样他们就永远不会忘记基础知识。然后,它创建了两个独立的训练循环:学者(具体指将语言转化为计划的部分)更新得非常不频繁。这保持了机器人对任务理解的稳定性。与此同时,杂工(控制肌肉的“动作专家”)更新得非常频繁。这使得机器人能够快速从即时交互中学习,比如“哎呀,我撞到墙了,让我往左边挪挪”。

研究人员在名为 CALVIN 的虚拟世界中测试了这个想法,在这个世界里,机器人必须完成长链条的任务,比如“打开抽屉,拿起积木,然后把它放入盒子里”。他们发现 TEMPO 在处理这类长链条任务时表现最佳。在模拟实验中,TEMPO 能够连续完成全部五个步骤的成功率达到了 81.7%,超过了之前表现最好的方法(其成功率为 81.2%)。更重要的是,当他们在物理实验室中用真实的机械臂进行测试时,TEMPO 在处理棘手情况时表现得更好。例如,如果抽屉只开了一点缝,旧的方法会试图把积木塞进那个微小的缝隙中并失败;而 TEMPO 凭借其稳定的“学者”大脑,意识到它需要先将抽屉开得更大一些,然后再移动积木。

论文还探讨了“杂工”应该比“学者”学习得快多少。他们发现,每当“学者”更新 1 次时,“杂工”更新 5 次的效果是最好的。如果让他们以相同的速度更新,机器人的表现反而会变差,这证明了“双速”方法至关重要。虽然这些结果在模拟和现实测试中都非常令人振奋,但作者也建议,未来的工作可以包括教机器人更详细地理解自己“为什么”失败,而不仅仅是知道自己成功了还是失败了。目前,TEMPO 展示了有时教机器人的最好方式是:让它的双手快速移动,同时保持大脑的沉稳。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →