能够观察、理解并拥有类人灵巧度的机器人,长期以来一直是自动化领域的圣杯。多年来,研究人员一直致力于构建能够识别桌上杯子或根据“把它捡起来”这一口头指令进行操作的系统。然而,将这种理解转化为流畅、实时的物理运动仍然是一个顽固的瓶颈。核心难点在于时机:机器人必须不断观察世界、处理图像、决定下一步行动,然后移动手臂,而这一切都必须在几分之一秒内完成。如果思考过程耗时过长,机器人就会落后,基于过时信息进行操作并错过目标。这种延迟在被称为“视觉-语言-动作”(Vision-Language-Action)模型的最新一代机器人大脑中尤为突出。这些系统非常强大,因为它们结合了视觉、阅读与规划运动的能力,但它们也同样缓慢。它们通常通过将一个动作分解成许多小块,并在将指令发送给电机之前,通过一系列重复且耗时的计算来不断完善每一个小块。其结果是机器人会出现犹豫、停顿或滞后,使得精细任务无法完成。
为了解决这个问题,来自加州大学圣地亚哥分校和麻省理工学院的研究团队推出了一种名为 FlashVLA 的新框架,旨在让这些机器人大脑能够同时进行思考与运动,而不是先后顺序执行。想象一条工厂流水线,如果工人必须等待一件成品被完全检查完毕后才开始处理下一个产品,那么生产线就会不断停顿;FlashVila 改变了这种工作流程,使工人能够同时处理处于不同阶段的产品。用技术术语来说,研究人员用一种“流式”(streaming)方法取代了旧有的每次解码一个完整动作的方法。该系统不再等待一个完整的运动计划变得完美后再采取行动,而是维护着一个包含处于不同完成阶段的若干运动计划的缓冲区。其中一些计划已接近完成并准备好执行,而另一些则刚刚开始并仍在完善中。系统会一次性同时更新所有这些计划,并在单步内完成,随后立即将完成度最高的计划发送给机器人的电机。这使得机器人在计算机仍在构思后续步骤时仍能保持运动,有效地隐藏了思考所需的时间。
这种改变带来的影响是巨大的。在测试中,研究人员发现,与标准方法相比,这种流式方法将生成单个动作所需的时间缩短了高达二十倍。在单张显卡上,该系统实现了每秒至少三十次的控制频率,这种速度对于人类观察者来说感觉是瞬时的。更重要的是,这种速度并没有以牺牲准确性为代价。由于系统会同时处理这些运动块,未来的步骤自然会从即将发生的当前步骤中学习。这创造了一种平滑、连续的运动,避免了那些试图根据旧信息采取行动的机器人经常出现的僵硬、断续的动作。在模拟环境和真实的机械臂测试中,新系统的成功率达到或超过了较慢的传统模型,同时运行速度显著提高。
研究人员还发现,这种方法使机器人处理长周期、复杂任务的能力显著提升。当机器人需要执行一个耗时较长的动作序列时,新系统具备的前瞻能力和对即时过去的回忆能力帮助它保持在正轨上。在一次涉及长程任务(long-horizon tasks)的实验中,其成功率比之前的最佳方法提高了三十六个百分点以上。这表明,系统将当前动作与未来计划相连接的方式创造了一种类似于短期记忆的功能,有助于机器人在复杂的序列中导航而不迷失方向。团队在包括单臂和双臂系统在内的各种机器人设置上测试了这些想法,并发现速度和流畅度的提升在不同的硬件和不同类型的任务中均保持一致。
这项工作的特别意义在于,它同时解决了两个问题:计算的缓慢以及机器人所见与其实际位置之间的不匹配。以往修复缓慢问题的尝试往往导致机器人基于陈旧数据行动,而修复数据不匹配问题的尝试则往往需要复杂的额外计算,从而再次减慢机器人的速度。FlashVLA 通过将思考过程本身结构化为连续的过程,消除了这种权衡。研究人员证明,通过简单地改变机器人处理运动计划的方式——即保持一个处于不同就绪阶段的滚动计划缓冲区——他们可以实现此前难以企及的流畅度。其结果是,机器人可以快速反应、平滑运动,并以可靠的方式处理复杂的操控任务,使敏捷、现实世界的自动化梦想离现实又近了一步。
技术摘要:FlashVLA
问题陈述
视觉-语言-动作(VLA)模型,特别是基于流匹配(flow-matching,例如 π0.5)的模型,在实际机器人部署中面临一个关键瓶颈:高推理延迟和不稳定的异步执行。
- 延迟: 基于流匹配的 VLA 模型中的动作解码需要多个连续的去噪步骤(例如,每个数据块/chunk 需要 10 步),且这些步骤都以单个观测值为条件。性能分析显示,仅动作解码就消耗了每步推理时间的约 75%,导致控制循环停滞。
- 异步失配: 为了掩盖延迟,异步推理通过将预测与执行重叠来实现。然而,这迫使模型基于“陈旧”的观测值进行预测。机器人根据模型从未见过的状态执行动作,导致时间上的不匹配,且这种不匹配会随着前瞻视野(lookahead horizon)的增加而扩大。
- 困境: 现有的解决方案孤立地解决这些问题。高效的推理方法(压缩、剪枝)虽然降低了单步成本,但无法消除在数据块边界处的停顿。异步方法(未来状态调节)试图修正失配,但通常需要辅助预测器或架构变更,如果前瞻时间较长,往往会重新放大失配。
作者确定了一个共同的根本原因:隔离。目前的流匹配 VLA 将每个动作数据块从纯噪声中独立进行解码,仅以当前观测为条件。这使得所有的去噪延迟都集中在单个步骤中,并导致未来的数据块无法感知它们即将加入的轨迹。
方法论:FlashVLA
FlashVLA 引入了一种流式动作解码框架,它对动作数据块进行联合解码而非独立解码。该框架被设计为流匹配 VLA 模型的即插即用修改方案,仅需轻量级的架构变更和一次微调过程。
1. 基于数据块的自回归公式化
FlashVLA 不再将所有的去噪过程都用于单个数据块,而是维护一个包含 N 个动作数据块的流式缓冲区(Bt),这些数据块处于交错的噪声水平(τ1<τ2<⋯<τN)。
- 交错噪声: 缓冲区包含一个从几乎清晰的数据块(准备执行)到纯噪声数据块(用于未来执行)的光谱。
- 联合推进: 单次前向传播会使缓冲区中的每一个数据块向前推进一个去噪步骤。经过预热期后,系统每步发射一个可执行的数据块。这在时间上分摊了 N 个去噪步骤,将单步延迟降低了高达 20 倍。
- 基于数据块的因果注意力: 模型应用一种因果掩码,使得较晚(噪声较大)的数据块可以关注较早(较清晰)的数据块,但反之则不然。这使得正在解码未来状态的模型能够隐式地以缓冲区中已存在的近端执行数据块的轨迹为条件。这在无需显式未来状态预测器的情况下,恢复了异步连续性。
2. 流式推理算法
推理过程分为两个阶段:
- 冷启动(Cold Start): 缓冲区由 N−1 个填充数据块和一个高斯样本初始化。系统运行 N−1 个推理步骤以填充缓冲区,同时机器人执行一个安全的默认动作。这一开销在整个回合(episode)中被摊销。
- 稳态流式(Steady Streaming): 缓冲区作为一个队列运行。每一步都会推进所有数据块,弹出最清晰的数据块用于执行,移动剩余数据块,并追加一个全新的纯噪声数据块。
- 系统优化: 为了实现完整的延迟收益,作者将推理阶段编译为 CUDA 图(CUDA Graphs),并应用算子融合(kernel fusion)和 PyTorch 的 max-autotune,以消除算子启动的序列化问题。
3. 多缓冲区联合微调
预训练的 VLA 被训练为独立地对数据块进行去噪。为了使其适应流式范式,作者提出了一种打包训练策略:
- 对于单个观测值,所有 N 种可能的缓冲区配置(从冷启动到稳态)都被打包进单个训练样本中。
- 注意力掩码将样本内的不同缓冲区配置隔离开来,确保模型在共享观测编码的同时,学习处理任何有效的缓冲区前缀。
- 损失函数在所有缓冲区配置上求和,从而教会模型在任何噪声水平下,基于任何有效的历史记录进行去噪。
核心贡献
- 统一解决方案: FlashVLA 通过将动作数据块的解码逻辑从“隔离”转变为“联合解码”,同时解决了推理延迟和异步失配问题。
- 流式机制: 它引入了一个具有交错噪声水平和基于数据块因果注意力的流式缓冲区,实现了每步产生一个可执行动作,同时隐式地保持了轨迹的连续性。
- 高效性: 该方法实现了单步动作解码延迟(摊销后)降低 20 倍,并在异步设置下实现了高达 2.43 倍的端到端加速。
- 长程增益: 流式缓冲区固有的数据块级记忆(即未来数据块会关注已精炼的过去数据块)显著提升了模型在长程任务上的表现,且无需显式的记忆模块。
实验结果
作者在 LIBERO(单臂)、RoboTwin 2.0(双臂)和真实世界 Franka 任务上评估了 FlashVLA,并将其与 π0.5、VLASH、StreamingVLA 和 Realtime-VLA 进行了对比。
- 异步性能: 在具有 1 步延迟的 LIBERO 任务中,FlashVLA 将平均成功率从 96.9% 提高到 97.8%,同时将每步耗时从 53.8 ms 降低到 22.1 ms(2.43 倍加速)。在延迟 d=1 到 $4$ 时,它仍能保持较高的成功率(97.5–98.3%),优于那些随前瞻时间增加而性能大幅下降的基准模型。
- 延迟与反应速度: FlashVila 在所有配置下均实现了最低的推理延迟(例如,在 RTX 5090 上使用 3 个视角时为 20.3 ms),支持持续约 50 Hz 的策略更新。与 FASTER 基准相比,它将首次动作时间(TTFA)缩短了 1.7 倍,将反应时间(TTR)缩短了 1.6 倍。
- 长程任务: 在 RoboTwin 2.0 上,FlashVLA 在长程任务中表现出显著提升,与 π0.5 相比,成功率大幅提高了 36.6 个百分点(从 53.0% 提升至 89.6%),这归功于其隐式的块级记忆。
- 泛化能力: 该方法能有效地迁移到其他架构(如 SmolVLA、LingBot-VLA),在降低推理延迟 1.95 倍至 2.81 倍的同时,保持或提升了任务质量。
意义与主张
论文声称 FlashVLA 代表了流匹配 VLA 部署方式的根本转变。通过将动作数据块视为连续且具有因果连接的流,而非孤立的批次,它消除了低延迟推理与时间一致性之间的权衡。
- 现实可行性: 该系统能够在单 GPU 上实现 ≥30 Hz 的平滑异步执行,这在以往使用高容量流匹配模型时是难以实现的。
- 结构简单性: 该解决方案不依赖复杂的辅助预测器或大规模数据集的重训;它依赖于结构性改变(联合解码)和标准的微调程序。
- 可扩展性: 其性能增益随任务时长规模化增长,表明该方法特别适用于对时间一致性要求极高的复杂、长时间操控任务。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。