DriftingVLA: Native One-Step Vision-Language-Action Generation via Per-Dimension Temporal Drifting
DriftingVLA 是一种原生的单步视觉-语言-动作模型,它利用带有逐维度时间漂移(Per-Dimension Temporal Drifting)的分布漂移目标,在单次前向传播中生成完整的动作块,在基准任务上实现了最先进的性能,同时比传统的基于多步流的方法快 3.36 倍。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
能够看见、理解语言并拥有类人般流畅动作的机器人,长期以来一直是人工智能的梦想。多年来,研究人员一直在构建能够将强大的视觉和语言理解能力与机器人手臂控制能力相结合的系统。这些被称为“视觉-语言-动作模型”(vision-language-action models)的系统充当机器人的大脑,接收摄像头所见的画面和人类说的话,然后决定如何移动机器人的关节以完成任务。然而,一个显著的瓶颈阻碍了这些机器实现真正的实时响应。为了生成一段平滑的动作序列,这些模型传统上依赖于一个复杂的、多步骤的过程。想象一下,试图通过在每一条线上进行微小的、犹豫不决的修正来画出一个完美的圆圈;机器人必须计算一条路径,走一步,检查工作,然后再走下一步,为它所做的每一次移动重复这个循环。虽然这种方法能产生高质量的结果,但它很慢,引入了延迟,使得机器人在动态世界中显得迟钝且反应迟缓。
现在,一支研究团队推出了一种全新的方法,从根本上改变了机器人规划动作的方式,使其能够在瞬间生成一整套完整的动作序列。他们的工作核心是一个名为 DriftingVLA 的系统,该系统取代了缓慢的迭代修正过程,转而采用一种学习在一次性预测整个未来运动的方法。该系统不是在实际执行任务期间逐步计算路径,而是在训练阶段学习从一个随机起点到最终期望运动之间的直接联系。这种转变使得机器人在部署时可以跳过重复的计算,直接跳转到正确的动作。在涉及复杂操纵任务的测试中,这种新方法不仅达到了旧有缓慢系统的精度水平,还使机器人的速度提高了三倍以上,将决定动作所需的时间从两百多毫士降低到了不到七十毫秒。
这一突破的核心在于研究人员如何教机器人理解其不同运动部件之间的关系。机器人手臂不仅仅是做单一线的运动,它拥有多个必须协同工作的关节和自由度,例如向前移动、旋转以及打开抓取器。以往尝试加速这些系统的做法,要么将整个运动视为一个巨大的整体,要么将其分解为微小的、在时间上断开的瞬间。然而,新方法认识到,每一个特定的运动方向——比如抓取器的垂直提升或手腕的旋转——都有其独特的节奏和统计模式。研究人员开发了一种称为“每维度时间漂移”(Per-Dimension Temporal Drifting)的技术,将每个独立运动方向的历史记录视为一个独立的学习单元。这使得系统能够理解抓取器应如何开启或手腕应如何转动的细微差别,而无需强迫这些不同的动作去符合单一、僵化的数学规则。
至关重要的是,这种方法并没有牺牲机器人协调其肢体的能力。尽管系统分别学习每个运动方向的模式,但它仍然将整个动作计划作为一个统一的整体生成。机器人的大脑(理解语言和视觉的部分)保持完好,并继续引导产生动作的“动作专家”。通过训练系统在许多不同的“假设”场景中同时优化其预测,研究人员确保了单步决策的准确性与缓慢的多步计算结果一样高。这意味着机器人仍然可以执行精细的任务,例如将液体从一个容器倒入另一个容器,或者在两个手臂同步工作的情况下堆叠积木,而不会出现早期模型中存在的犹豫不决。
研究人员在模拟环境和现实世界中都对这一新系统进行了测试,以观察速度的提升是否以可靠性的下降为代价。在一系列涉及捡起物体并重新排列物体的挑战性模拟实验中,新系统实现了接近 98.3% 的成功率,略微超过了现有的最佳多步模型。当转移到配备物理机器人手臂的现实环境中时,该系统依然保持了其优势,在包括单臂和双臂协作挑战在内的六个不同任务中,试验成功率达到了 77.67%。这一表现明显高于那些试图通过缩短计算过程来加速旧系统的“单步法”,后者往往会导致准确性的显著下降。新方法证明,通过改变系统的学习方式,而非仅仅改变其计算方式,是实现速度与精度的并行的。
除了原始数据之外,研究还强调了消除重复计算循环所带来的效率提升。在现实世界中,每一分秒都至关重要,新系统将生成一段动作块所需的时间从 227.61 毫秒减少到了 67.67 毫秒。这代表了超过三倍的加速,有效地消除了让机器人感觉与环境脱节的滞后感。虽然在学习阶段处理多个“假设”场景需要稍多的计算能力,但这是一种一次性的投入。一旦机器人完成训练,它就能以精简的单步效率运行,不再需要额外的资源。这项工作表明,响应式机器人的未来可能不在于构建运行更慢算法的更快的计算机,而在于重新设计算法本身,使其天生具备直接性和即时性。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。