← 最新论文
🤖 AI

Learning Native Continuation for Action Chunking Flow Policies

本文介绍了 Legato,这是一种面向动作分块视觉语言动作模型的训练时延续方法,它通过重塑流动力学并利用随机调度条件生成更平滑、更一致的轨迹,从而在现实世界操作任务中超越了现有的实时分块方法。

原作者: Yufeng Liu, Hang Yu, Juntu Zhao, Bocheng Li, Di Zhang, Mingzhu Li, Wenxuan Wu, Yingdong Hu, Junyuan Xie, Junliang Guo, Dequan Wang, Yang Gao

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Yufeng Liu, Hang Yu, Juntu Zhao, Bocheng Li, Di Zhang, Mingzhu Li, Wenxuan Wu, Yingdong Hu, Junyuan Xie, Junliang Guo, Dequan Wang, Yang Gao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教机器人执行一项复杂任务,比如将水从一个杯子倒入另一个杯子。为此,机器人使用一个“大脑”(即视觉 - 语言 - 动作模型)来观察场景并决定下一步该做什么。

然而,这个“大脑”反应较慢,无法快到来得及为机器人每一毫秒都提供一条新指令。因此,工程师们采用了一种称为“动作分块”(Action Chunking)的技巧。它不是每次只给出一条指令,而是让“大脑”一次性预测一整段“未来动作块”(例如接下来 2 秒的运动)。

问题所在:“卡顿”

该论文指出了当前将这些动作块拼接在一起的方式中存在一个重大缺陷。

想象你正走在走廊里。你迈出一小步,接着再迈一步。如果你一次性规划接下来的三步,你或许能走得很流畅。但当你完成这三步,需要规划接下来的三步时,你的大脑必须暂停、重新评估,并开始制定新的计划。

在现有机器人中,这种暂停会在一个动作块结束、下一个动作块开始的边界处引发“卡顿”或“抽噎”。机器人可能会:

  • 犹豫(瞬间冻结)。
  • 突然朝不同方向猛 jerk 一下。
  • 改变主意,决定换用另一只手或抓取另一个物体。

论文将这种现象称为“虚假多模态切换”。用通俗的话来说:机器人在过渡点感到困惑,开始在多种可能动作之间摇摆不定,导致动作显得生硬且不自然。

旧方案:“实时分块”(RTC)

此前尝试解决这一问题的方法称为“实时分块”(Real-Time Chunking, RTC),它就像一张“便利贴提醒”。

  • 当机器人完成一个动作块后,系统会查看它刚刚做出的最后几步动作。
  • 它强制要求新的动作块必须从旧动作块结束的确切位置开始。
  • 缺陷:这是一种在机器人已经思考完毕之后才施加的外部规则。这就像告诉一位画家:“确保你下一笔要与上一笔衔接”,但画家并未学会如何自然地衔接它们。机器人内部仍然感到困惑,从而导致犹豫和生硬的动作。

新方案:"Legato"

作者提出了一种名为"Legato"的新方法(得名于音乐术语,意为“平滑连贯”)。

Legato 并非仅在末尾添加一条规则,而是教导机器人的“大脑”在学习过程中就学会如何将这些点连接起来。

以下是其工作原理,借助一个富有创意的类比:

1. “带辅助轮训练”类比
想象你正在教一个孩子骑自行车。

  • 旧方法(RTC):你让孩子骑行,如果他们在转弯结束时摇晃,你就抓住车把强行将其扶直。他们学会依赖你来修正摇晃。
  • Legato 方法:你教他们在转弯过程中就“感受”平衡。你为他们提供一份“时间表”,说明在转弯的每一秒需要多少支撑。随着他们逐渐完成转弯,你慢慢放手,但全程给予平滑引导。

2. “平滑斜坡”与“坚硬墙壁”
Legato 采用一种“呈日程表形状”的引导。

  • 当机器人开始一个新的动作块时,它确切知道前一个动作块以何种状态结束。
  • Legato 告诉机器人:“在这个新动作块的初始部分,你必须完全遵循前一条路径。”
  • 接着,它逐渐说:“好了,你可以开始稍微偏离,并做出自己的选择。”
  • 最后:“现在你可以自由规划剩余的运动了。”

这创造了一条平滑的自由度斜坡,而非一道坚硬墙壁,迫使机器人在那里突然切换模式。

3. “原生技能”
Legato 最关键之处在于它改变了机器人内部的“流动”。它重塑了机器人“大脑”内部的数学逻辑,使得连接动作块成为其思考方式的自然组成部分

  • 它不只是强迫机器人匹配过去的动作;它教导机器人,与过去保持一致是最容易且最合乎逻辑的路径。
  • 这阻止了机器人在不同想法之间犹豫不决或来回摇摆(即多模态切换)。

实验结果

研究人员在真实机器人上测试了该方法,涉及五项不同任务:堆叠碗、倾倒物品、抓取物体、打开抽屉以及折叠毛巾。

  • 更流畅的动作:Legato 驱动的机器人动作如流水般顺畅,而旧方法则像一系列生硬的步伐。
  • 更快完成:由于机器人不再在“动作块边界”处犹豫或冻结,任务完成速度提高了约10%
  • 更少困惑:机器人坚持既定计划(例如“我将使用左手”),而不再来回摇摆。

总结

可以将“动作分块”想象为机器人拍摄一系列照片来规划其运动。

  • 问题:照片无法完美对齐,导致最终影像显得抖动。
  • 旧方案:你试图在拍摄后编辑这些照片(RTC),但抖动依然存在。
  • Legato:你教导相机如何拍摄照片,使它们在拍摄过程中自然完美对齐。结果是,机器人动作自信优雅,呈现出一部平滑连贯的影片。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →