想象一下,你正在教一个机器人做一道复杂的菜,比如组装一个三明治。机器人需要观察食材(视觉)、理解你的语音指令(语言),然后移动它的手臂去拿面包、抹花生酱以及放果酱(动作)。
这篇论文介绍了一种教机器人学习这种技能的新方法,叫做 TBD-VLA。为了理解它为什么特别,我们来看看目前的机器人通常是如何学习的,以及这种新方法是如何运作的。
旧方法:缓慢、循序渐进的机器人
目前大多数机器人像是一个正在一个字母一个字母写句子的人。它们决定第一个动作,然后是第二个,然后是第三个,依此类推。
- 问题: 这非常慢。如果机器人要执行 100 个微小的动作来拿起一个杯子,它就必须连续“思考”100 次。等到它思考结束时,杯子可能已经移动了,或者机器人的反应实在太慢了。
- 另一种选择: 一些研究人员尝试让机器人以“块”(chunk)的形式进行思考(就像一次写出一个完整的单词)来提高速度。但这种做法往往会让机器人变得笨拙,因为它会忘记这些动作在时间维度上是如何连接在一起的。这就像是在写句子时,虽然单词写得很快,但语法却是破碎的。
新方法:TBD-VLA(“块扩散”大厨)
作者创建了一个结合了两者优点的方法。他们称之为 时间块扩散(Temporal Block Diffusion)。以下是它的运作方式,我们用一个简单的类比来说明:
1. “块”策略(食谱卡)
机器人不再去思考每一个手指动作的细节,而是将任务分解成块(就像食谱中的每一页)。
- 块与块之间: 机器人逐一思考这些“块”(第一页,然后是第二页)。这确保了故事逻辑通顺,且步骤遵循合理的顺序。
- 块内部: 一旦它决定开始处理“第一页”,它会同时计算出该页面上的所有动作。
2. “扩散”策略(橡皮擦与铅笔)
机器人如何在块内部如此快速地确定动作?它使用了一种名为**离散扩散(Discrete Diffusion)**的技术。
- 想象机器人从一张空白的纸开始,所有的指令都被隐藏起来了(被遮掩/masked)。
- 它会对所有的动作同时做一个“猜测”。
- 然后,它会观察自己的猜测,看看哪些部分错了,然后“擦掉”错误的猜测,同时保留正确的猜测。
- 它会重复这个过程几次,同时精炼整个“块”内的动作,直到画面变得清晰。
结果: 机器人动作很快,因为它不需要按顺序思考每一个步骤。它以小组的形式进行思考,并同时精炼整个小组的动作。
“实时分块”超能力
论文强调了一个酷炫的功能,叫做实时分块(Real-Time Chunking, RTC)。
- 场景: 假设机器人正在倒牛奶(动作 A)。在它执行动作 A 的过程中,它需要开始思考下一步要做什么(动作 B)。
- 问题: 通常情况下,机器人必须等到动作 A 100% 完成后才能开始思考动作 B。这会导致“滞后”或延迟。
- TBD-VLA 的解决方案: 因为该模型经过训练可以“填补空白”(一个被称为“图像修补/in-painting”的过程),所以它可以观察自己当前正在做的动作,并说:“我知道我现在在做什么,所以我可以在做当前任务的同时,开始猜测接下来的动作。”
- 类比: 这就像一位音乐家在演奏乐曲。他们不是等整首歌结束了才去想下一个音符,而是在手指还在演奏当前音符时,就已经在哼唱下一句旋律了。这使得机器人更加快速且具有响应性。
他们证明了什么?
研究人员通过两种方式测试了这个“机器人大脑”:
- 在模拟环境中: 他们在虚拟世界中让机器人执行许多不同的任务(如堆叠积木或移动物体)。即使在受到光照变化或摄像机角度变化的“干扰”时,TBD-VLA 也比以往的方法更快、更成功。
- 在现实世界中: 他们在真实的机器人手臂(Franka Research 3)上测试了桌面任务,如将面包放入烤面包机或转移液体。
- 结果: 在困难且多变的现实环境中,TBD-VLA 的成功率约为 67%,而之前的最佳方法仅为 50% 左右。
- 速度: 它也明显更快,做出决策的时间不到十分之一秒,这足以满足实时控制的需求。
总结
TBD-VLA 是一种新的机器人动作规划方式。它不再是一个步骤一个步骤地缓慢思考,而是通过一组动作进行思考,并同时精炼这一组动作。这使得机器人既能保持聪明(理解事件的先后顺序),又能保持快速(实时反应),从而更好地处理现实世界中的复杂任务。
技术摘要:TBD-VLA(时序块扩散视觉-语言-动作模型)
问题陈述
视觉-语言-动作(VLA)模型旨在将视觉观测和自然语言指令映射为可执行的机器人动作。该领域的一个核心挑战在于如何在时序相干性(temporal coherence)与推理效率之间取得平衡。
- 自回归局限性: 当前基于离散 Token 的 VLA 模型采用逐个 Token 生成动作的方式。虽然这种方式能很好地捕捉时序依赖关系,但其串行性质导致了高推理延迟,使其难以适用于高频闭环机器人控制。
- 并行解码局限性: 最近的方法尝试通过并行解码或流匹配(flow-matching)头来提高速度。然而,这些方法往往缺乏对动作块(action chunks)之间时序依赖关系的显式建模机制,可能从而损害长时程轨迹的连贯性。
- 差距: 需要一种能够将并行解码的效率与动作序列固有的时序结构相统一的框架,且不脱离视觉-语言模型(VLM)主干与动作生成过程的耦合。
方法论:TBD-VLA
作者提出了 TBD-VLA,这是一个基于离散 Token 的 VLA 框架,它将动作生成形式化为块状离散扩散(block-wise discrete diffusion)。该方法将动作序列划分为若干时序块,从而实现块内并行解码,同时保持跨块的自回归生成。
1. 模型架构与 Token 化
- 主干网络: 模型利用增强了掩码(masking)、占位符(placeholders)和动作专用 Token 的 VLM 主干(实验中具体使用 Qwen3-VL 2B)。
- 离散化: 动作特征(本体感受和控制输出)被离散化为若干分箱(bins),并使用共享词表进行 Token 化。一个动作块 At 被表示为一个 Token 序列。
- 时序块结构: 动作时界(horizon)被划分为 K 个大小为 m 的块。动作序列的概率在这些块之上进行分解:
p(a1:Hp∣o,g)=k=0∏K−1pθ(akm+1:(k+1)m∣o,g,a1:km)
2. 训练流水线
训练过程通过三个关键机制,将 VLM 的下一 Token 预测目标适配到离散扩散范式中:
- 时序级 Token 偏移(Temporal-Level Token Shift): 为了与 VLM 的自回归特性保持一致,模型经过训练,使其当前动作块中的 Token 能够预测下一个动作块。这弥合了自重建扩散与因果序列建模之间的鸿隙。
- 离散块扩散(Discrete Block Diffusion):
- 前向过程: 清洁的动作块通过随机掩码 Token 进行破坏。
- 反向过程: 模型在以“偏移预测器”块 zk 为条件的条件下,预测块 k 的清洁 Token。对于第一个块,zk 是掩码锚点;对于后续块,zk 由清洁的前序块组成。
- 损失函数: 目标是计算掩码动作 Token 的平均交叉熵。
- 双布局注意力掩码(Doubled-Layout Attention Masking): 为了同时处理块内并行性和块间自回归性,训练输入将清洁序列与加噪序列进行拼接。自定义的注意力掩码允许模型在单次传递中同时关注先前的清洁块和当前的噪声块,从而显著加速训练。
3. 推理策略
- 基于块的解码(Block-wise Decoding): 在推理时,动作块按顺序生成。在每个块内部,Token 通过 nd 个离散扩散步进行并行细化。
- 按需解码(Decode-as-Needed): 模型并不生成完整的时界,而是仅解码当前展开时界(rollout horizon)所需的块数量(Kexec),从而减少总体的去噪步数。
- 前缀 KV 缓存(Prefix KV Caching): 视觉输入、提示词以及先前生成的动作块的键-值(KV)状态会被缓存,以避免在迭代去噪步骤中进行冗余计算。
- 期望采样(Expectation Sampling): 模型并非选择概率最大的单个 Token(argmax),而是通过计算完整预测 Token 分布的期望值来解码标量动作值,从而提供更细粒度的信号。
- 实时分块(Real-Time Chunking, RTC): 为了缓解闭环控制中的延迟,TBD-VLA 支持异步执行。它冻结先前生成的动作尾部(对应于推理延迟窗口),并将其作为“内补”(in-painting)下一个动作块的上下文。这与完成部分已提交动作块的训练目标相一致。
核心贡献
- TBD-VLA 框架: 一种新型 VLA 框架,通过块状离散扩散将并行动作解码与时序级自回归相结合。
- 训练方案: 一个包含时序 Token 偏移和双布局注意力掩码的特定流水线,用于在 VLM 主干上高效训练块状扩散。
- 全面评估: 通过在多个仿真基准(LIBERO, SimplerEnv)和真实世界操纵任务中的广泛实验,证明了其强大的泛化能力和鲁棒性。
实验结果
作者在仿真和真实世界设置中,将 TBD-VLA 与最先进的模型(如 π0.5, GR00T-N1, OpenVLA-OFT)进行了对比评估。
- 仿真(LIBERO): TBD-VLA 在 LIBERO 基准测试中实现了 97.6% 的平均成功率,超越了以往的最优方法。在存在推理延迟(模拟延迟)的情况下,带有 RTC 的 TBD-VLA 保持了 93.2% 的成功率,显著高于没有 RTC 的基准模型(后者降至 72.3%)。
- 鲁棒性(LIBERO-Plus): 该模型展示了对扰动(物体布局、相机视角、光照)的高鲁棒性,实现了 83.0% 的平均成功率,比第二名高出 15.1%。
- 真实世界迁移:
- SimplerEnv: TBD-VLA 在 Widow-X 任务上实现了 66.8% 的成功率,在 Google Robot 任务(视觉匹配)上实现了 91.0% 的成功率,优于大多数基准模型。
- 物理操纵: 在真实世界的桌面任务(如“Everything in Bin”, “Load Toaster”)中,TBD-VLA 在各种扰动场景下实现了 67.1% 的平均成功率,而 π0.5 基准模型的成功率为 50.0%。
- 效率: 通过优化(KV 缓存、编译),该模型实现了 0.086s 的推理延迟(在 NVIDIA RTX A40 GPU 上),在保持时序连贯性的同时,具备与其他快速 VLA 模型竞争力的速度。
意义与主张
论文声称 TBD-VLA 为快速、具备时序感知能力的离散 VLA 模型提供了一条可扩展的路径。通过统一时序自回归和并行解码,该框架解决了推理速度与动作连贯性之间的权衡问题。
作者强调,显式的时序建模使得异步执行(通过 RTC)成为可能,这对于实时控制至关重要。结果表明,块扩散是提高机器人策略泛化性和鲁棒性的一个有前景的方向,且不会牺牲闭环控制所需的效率。
论文对其局限性保持了谦逊的态度,指出其重点在于将块扩散应用于 VLA,并将探索替代训练策略(例如与辅助目标共同训练)以及更深层次理解 VLM 表示如何转化为可执行动作作为未来的工作。同时也承认,尽管具有鲁棒性,但在极端分布外条件(例如液体转移任务中显著的相机视角变化)下,模型仍可能失效。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。