← 最新论文
💻 computer science

CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies

CF-VLA 提出了一种由粗到精的两阶段框架,将无信息的高斯噪声转化为结构化的动作初始化,随后进行单步细化,显著提升了基于流的视觉 - 语言 - 动作策略的效率与性能权衡,并在大幅降低采样延迟的同时实现了最先进的真实机器人成功率。

原作者: Fan Du, Feng Yan, Jianxiong Wu, Xinrun Xu, Weiye Zhang, Weinong Wang, Yu Guo, Bin Qian, Zhihai He

发布于 2026-04-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Fan Du, Feng Yan, Jianxiong Wu, Xinrun Xu, Weiye Zhang, Weinong Wang, Yu Guo, Bin Qian, Zhihai He

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教机器人执行一项复杂任务,比如折叠毛巾或将水倒入杯中。为此,机器人使用一种称为“视觉 - 语言 - 动作(VLA)策略”的“大脑”。这个大脑会观察摄像头画面、读取指令,并判断下一步该做什么。

长期以来,训练这些机器人的最佳方法是使用一种名为**流匹配(Flow Matching)**的技术。这就像试图在一堆巨大的、空荡荡的干草堆中找到一根特定的针。机器人从纯粹的“静态”(随机噪声)开始,必须一步步缓慢地过滤掉这些静态,才能显露出那根针(即正确的动作)。

问题所在:
这种“过滤”过程非常缓慢。机器人需要执行许多小步骤(例如 10 步或更多),才能将随机噪声转化为清晰、有用的动作。在现实世界中,机器人需要快速移动。等待 10 个步骤来决定下一步做什么,会使它们变得迟缓且低效。这就像开车时每走 10 英尺就停下来重新计算路线一样。

解决方案:CF-VLA(由粗到细)
本文的作者 CF-VLA 意识到,他们不需要加速过滤过程,而是需要改变机器人开始寻找的位置

他们不再从空白且充满噪声的干草堆开始,而是在机器人开始之前就给它一个“提示”。他们采用了一个两步流程:

  1. “粗”步骤(智能猜测):
    想象一下,你正在尝试猜测一个密码。与其从"aaaaa..."开始并尝试每一种组合,不如先查看线索,然后说:“好吧,这很可能是一个以 1 开头的 4 位数字。”
    CF-VLA 正是这样做的。它将随机噪声迅速塑造成一个“智能猜测”(即 AP 引导的初始化)。它尚不知道确切的动作,但它已经知道了解决方案的大致方向形态。它将那根针从干草堆的中间移到了边缘,那里更容易找到。

  2. “细”步骤(最终完善):
    既然机器人已经有了一个好的起点(即智能猜测),它只需要一步就能修正微小的细节。这就像在一张粗略的草图上添加最后的线条,使其完美无缺。由于起点如此出色,机器人不再需要执行 10 个步骤;它只需要一次快速的修正。

结果:
通过将工作拆分为“获取大致概念”和“修正细节”,机器人的速度变得极快。

  • 速度: 它将决策动作所需的时间缩短了75%。耗时从约 29 毫秒减少到仅 8 毫秒。
  • 性能: 尽管速度更快,但其实际表现甚至比那些较慢的旧方法更好。在测试中,它在折叠毛巾和倒水等任务上的成功率高于之前的最佳方法。

训练技巧:
教机器人执行这种两步舞蹈颇具挑战性。如果你同时教它这两个步骤,它会感到困惑,因为第一步在开始时可能很混乱。
作者通过**“预热”(Warm-Up)**策略解决了这个问题:

  • 第一阶段: 他们先教机器人仅进行“智能猜测”(即粗步骤),使用一个安全、受控的环境。
  • 第二阶段: 一旦机器人擅长做出智能猜测,他们就开启完整系统,教它如何利用这些猜测来完成最终的完美动作。

总结:
CF-VLA 就像在机器人开始行走之前给它一张地图。与其在森林(随机噪声)中盲目徘徊并指望找到出口,不如将机器人直接空降到森林边缘(即粗猜测),它只需再走几步就能到达终点线(即精细优化)。这使得机器人更快、更智能,并准备好应对现实世界的任务。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →