← 最新论文
🤖 AI

TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies

TempoVLA 引入了一种速度可控的视觉-语言-动作策略,该策略利用可变速度轨迹增强(VSTA)和显式速度调节,使机器人能够动态调整其执行速度,以实现更快的过渡阶段和更慢的精确接触阶段,从而克服了现有模型的固定速度限制。

原作者: Dong Jing, Jingchen Nie, Tianqi Zhang, Jiaqi Liu, Huaxiu Yao, Zhiwu Lu, Mingyu Ding

发布于 2026-06-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Dong Jing, Jingchen Nie, Tianqi Zhang, Jiaqi Liu, Huaxiu Yao, Zhiwu Lu, Mingyu Ding

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个机器人,它通过看人类做一次动作(比如叠杯子或折毛巾)就学会了一项任务。问题在于,这个机器人被困在了一个“单速”世界里。如果人类演示时动作很慢,机器人永远都会动得很慢;如果人类演示时很快,机器人就会永远飞速运转。它无法决定在精细工作的环节放慢速度,也无法在空旷地带移动时加快速度。

TempoVLA 是一个全新的系统,它为机器人提供了一个控制速度的“音量旋钮”。它允许同一个机器人脑在指令下,执行完全相同的任务,但速度可以分别是 0.5 倍速(极慢且谨慎)、1 倍速(正常)或 2 倍速(极快)。

以下是他们实现这一目标的步骤,分为两个简单的部分:

1. “视频剪辑师”(数据端)

在教机器人之前,研究人员必须先修复训练视频。他们开发了一个聪明的工具,叫做 VSTA(变速轨迹增强)。

把机器人的演示想象成一部电影。

  • 为了让它变快: 编辑器会将连续的多帧图像合并成一个大的跳跃。这就像跳过电影中无聊的部分直接进入精彩片段一样。
  • 为了让它变慢: 编辑器会将一个大的动作拆解成许多微小的、缓慢的步骤。这就像是在特定场景中添加“慢动作”特效一样。

至关重要的一点是,这种编辑并不会改变机器人在“做什么”(语义),而仅仅是改变了它“怎么做”(速度)。他们将一个原始的演示过程,转化成了一个包含六种不同速度的同一任务演示库。

2. “速度拨盘”(模型端)

一旦机器人拥有了这个包含快慢示例的库,研究人员就教会了它一个新技巧。他们给机器人提供了一个简单的“速度拨盘”(一个像 0.5、1.0 或 1.5 这样的数字),机器人可以在工作时看到这个数字。

  • 如果你告诉机器人:“以 1.5 倍速 执行”,机器人会查看其训练数据中的快速示例,并预测出更大、更果敢的动作。
  • 如果你说:“以 0.5 倍速 执行”,它会查看慢速示例,并预测出微小、谨慎的动作。

机器人不需要为每种新速度都从头开始重新训练。它只需要学会倾听“速度拨盘”并据此调整其肌肉运动即可。

“智能飞行员”加成

论文还展示了你可以将这个机器人与一个“智能飞行员”(大型 AI 语言模型)配对。你不再需要手动输入“减速”,而是由智能飞行员观察机器人的摄像头画面。

  • 场景: 机器人正横跨一张空桌子移动。
    • 智能飞行员: “路径清晰!加速!”(机器人加速)。
  • 场景: 机器人正准备抓取一个易碎的杯子。
    • 智能飞行员: “危险区域!减速!”(机器人放慢到爬行速度)。

这创造了一个能够自然地在安全时加速、在需要精准度时减速的机器人,且无需人工干预。

他们的发现

  • 灵活性: 机器人可以成功地在不同速度之间进行切换。
  • 性能提升: 出人意料的是,在这些混合速度上训练机器人,实际上让它在正常速度(1 倍速)下的表现比仅在正常速度下训练的机器人更好。看起来,学习以不同速度运动有助于机器人更好地理解任务。
  • 局限性: 存在物理极限。如果你要求机器人跑得太快(例如 4 倍速),机器人的物理电机和控制器就无法跟上大脑发出的指令,从而导致它错过目标。但在合理的范围内(0.5 倍速到 1.5 倍速),它的表现非常完美。

简而言之,TempoVLA 将一个僵化的单速机器人变成了一个灵活的工人,使其能够选择自己的节奏,从而让精细任务更安全,让常规任务更高效。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →