← 最新论文
💻 computer science

TBD-VLA: Temporal Block Diffusion Vision Language Action Model

TBD-VLA 是一种新颖的离散视觉-语言-动作(Vision-Language-Action)框架,它结合了自回归块生成与掩码离散扩散技术,以在机器人操控任务中同时实现高推理速度和强时间连贯性。

原作者: Sung-Wook Lee, Xuhui Kang, Yen-Ling Kuo

发布于 2026-06-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Sung-Wook Lee, Xuhui Kang, Yen-Ling Kuo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人做一道复杂的菜,比如组装一个三明治。机器人需要观察食材(视觉)、理解你的语音指令(语言),然后移动它的手臂去拿面包、抹花生酱以及放果酱(动作)。

这篇论文介绍了一种教机器人学习这种技能的新方法,叫做 TBD-VLA。为了理解它为什么特别,我们来看看目前的机器人通常是如何学习的,以及这种新方法是如何运作的。

旧方法:缓慢、循序渐进的机器人

目前大多数机器人像是一个正在一个字母一个字母写句子的人。它们决定第一个动作,然后是第二个,然后是第三个,依此类推。

  • 问题: 这非常慢。如果机器人要执行 100 个微小的动作来拿起一个杯子,它就必须连续“思考”100 次。等到它思考结束时,杯子可能已经移动了,或者机器人的反应实在太慢了。
  • 另一种选择: 一些研究人员尝试让机器人以“块”(chunk)的形式进行思考(就像一次写出一个完整的单词)来提高速度。但这种做法往往会让机器人变得笨拙,因为它会忘记这些动作在时间维度上是如何连接在一起的。这就像是在写句子时,虽然单词写得很快,但语法却是破碎的。

新方法:TBD-VLA(“块扩散”大厨)

作者创建了一个结合了两者优点的方法。他们称之为 时间块扩散(Temporal Block Diffusion)。以下是它的运作方式,我们用一个简单的类比来说明:

1. “块”策略(食谱卡)
机器人不再去思考每一个手指动作的细节,而是将任务分解成块(就像食谱中的每一页)。

  • 块与块之间: 机器人逐一思考这些“块”(第一页,然后是第二页)。这确保了故事逻辑通顺,且步骤遵循合理的顺序。
  • 块内部: 一旦它决定开始处理“第一页”,它会同时计算出该页面上的所有动作。

2. “扩散”策略(橡皮擦与铅笔)
机器人如何在块内部如此快速地确定动作?它使用了一种名为**离散扩散(Discrete Diffusion)**的技术。

  • 想象机器人从一张空白的纸开始,所有的指令都被隐藏起来了(被遮掩/masked)。
  • 它会对所有的动作同时做一个“猜测”。
  • 然后,它会观察自己的猜测,看看哪些部分错了,然后“擦掉”错误的猜测,同时保留正确的猜测。
  • 它会重复这个过程几次,同时精炼整个“块”内的动作,直到画面变得清晰。

结果: 机器人动作很快,因为它不需要按顺序思考每一个步骤。它以小组的形式进行思考,并同时精炼整个小组的动作。

“实时分块”超能力

论文强调了一个酷炫的功能,叫做实时分块(Real-Time Chunking, RTC)。

  • 场景: 假设机器人正在倒牛奶(动作 A)。在它执行动作 A 的过程中,它需要开始思考下一步要做什么(动作 B)。
  • 问题: 通常情况下,机器人必须等到动作 A 100% 完成后才能开始思考动作 B。这会导致“滞后”或延迟。
  • TBD-VLA 的解决方案: 因为该模型经过训练可以“填补空白”(一个被称为“图像修补/in-painting”的过程),所以它可以观察自己当前正在做的动作,并说:“我知道我现在在做什么,所以我可以在做当前任务的同时,开始猜测接下来的动作。”
  • 类比: 这就像一位音乐家在演奏乐曲。他们不是等整首歌结束了才去想下一个音符,而是在手指还在演奏当前音符时,就已经在哼唱下一句旋律了。这使得机器人更加快速且具有响应性。

他们证明了什么?

研究人员通过两种方式测试了这个“机器人大脑”:

  1. 在模拟环境中: 他们在虚拟世界中让机器人执行许多不同的任务(如堆叠积木或移动物体)。即使在受到光照变化或摄像机角度变化的“干扰”时,TBD-VLA 也比以往的方法更快、更成功。
  2. 在现实世界中: 他们在真实的机器人手臂(Franka Research 3)上测试了桌面任务,如将面包放入烤面包机或转移液体。
    • 结果: 在困难且多变的现实环境中,TBD-VLA 的成功率约为 67%,而之前的最佳方法仅为 50% 左右。
    • 速度: 它也明显更快,做出决策的时间不到十分之一秒,这足以满足实时控制的需求。

总结

TBD-VLA 是一种新的机器人动作规划方式。它不再是一个步骤一个步骤地缓慢思考,而是通过一组动作进行思考,并同时精炼这一组动作。这使得机器人既能保持聪明(理解事件的先后顺序),又能保持快速(实时反应),从而更好地处理现实世界中的复杂任务。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →