以下是论文《在潜在空间中学习高频连续动作块》的解释,将其拆解为简单概念并辅以日常类比。
核心问题:“走走停停”的机器人
想象你正在教一个机器人在白板上画一个完美的圆。
- 旧方法(低频): 你告诉机器人“移动到点 A",然后等待。接着说“移动到点 B",再等待。机器人移动、停止、思考、再次移动,然后停止。结果是一条锯齿状、颤抖的线条,就像机器人试图通过迈出一大步一大步的僵硬步伐来行走。
- 高频目标: 为了获得平滑连续的线条,机器人需要每秒移动 60 次(60 赫兹)。它需要像人手在纸上滑行一样,而不是从一个点跳到另一个点。
该论文指出,虽然我们希望机器人以这种高速移动,但当前的 AI 模型在被要求这样做时会感到困惑。如果你让一个标准的机器人大脑规划每秒 60 次的移动,它开始产生幻觉、抖动,并犯下微小的、不规则的错误。这就像要求一个人在手不受控制地剧烈颤抖时写出一句话。
解决方案第一部分:“做梦”阶段(潜在空间)
为了解决抖动问题,作者改变了机器人“思考”的地点。
- 类比: 想象你正试图向朋友描述一段复杂的舞蹈。
- 动作空间(旧方法): 你试图描述每一毫秒的每一次肌肉抽搐、手指扭动和脚部轻踏。这令人难以招架,而且你很可能搞错细节,导致舞蹈笨拙。
- 潜在空间(新方法): 与其描述每一次抽搐,不如描述舞蹈的“感觉”或“流动”。你可以说:“这是一种平滑、 sweeping 的动作。”你将复杂的细节压缩成更简单、更平滑的“梦境”或“摘要”。
该论文使用了一种称为**VAE(变分自编码器)**的工具。把 VAE 想象成一个翻译器。
- 编码器: 它将混乱的高速机器人运动翻译成平滑、压缩的“梦境语言”(潜在空间)。
- 策略: 机器人的大脑学会在这种平滑的“梦境语言”中规划动作。因为这种语言更简单、更平滑,机器人犯的错误就更少。
- 解码器: 当需要行动时,VAE 将平滑的“梦境”翻译回实际的每秒 60 次的指令。
结果: 机器人以外科医生般的精准度移动,同时拥有舞者般的流畅性。它不再胡乱抖动,因为它首先掌握了动作的本质,而不是迷失在微小的细节中。
解决方案第二部分:“无缝交接”(重用后优化)
还有第二个问题。即使机器人规划了完美的平滑动作,它也必须一遍又一遍地进行这种规划。
- 场景: 机器人规划一段动作块,执行它,然后立即规划下一个动作块。
- 故障: 因为机器人正忙于思考(规划下一个块),会有微小的延迟。当新块到达时,它可能无法完美匹配机器人此刻的实际位置。这就像接力赛中,第二名跑者在第一名完全传递接力棒之前就开始奔跑,导致绊倒或“停滞”。
作者引入了一种称为**重用后优化(Reuse-then-Refine, RTR)**的策略。
- 类比: 想象你在编辑视频。你有一段刚拍摄的片段(“旧”块)和一段即将拍摄的片段(“新”块)。
- 旧方法: 你只是将两段剪辑拼接在一起。如果光线或角度略有偏差,你就会看到生硬的跳切。
- RTR 方法: 在最终确定视频之前,你取旧片段的结尾和新片段的开头,将它们混合在一起,并通过一个“平滑滤波器”(再次使用 VAE)。这个滤波器将两个片段融合,使过渡变得不可见。
结果: 机器人在规划周期之间不会绊倒。它从一个想法滑向下一个想法,没有停顿或抖动。
现实世界的证明
该团队在三个真实的机器人任务中测试了这种方法:
- 削黄瓜皮: 机器人平滑地削去果皮,没有停顿或撕裂水果。
- 擦拭花瓶: 机器人以一次连续、流畅的动作清洁了污渍。
- 在白板上写字: 机器人画出了一条笔直、干净的线,没有旧方法中看到的“走走停停”的晃动。
核心结论:
通过教导机器人用简化、平滑的语言(潜在空间)“做梦”,然后仔细地将它们的想法融合在一起(重用后优化),作者制造出了能够高速移动而不会颤抖、停止或碰撞的机器人。他们将一个僵硬、犹豫的机器人变成了一个流畅、连续的运动者。
技术摘要:在潜在空间中学习高频连续动作块
1. 问题陈述
现代机器人策略越来越多地利用动作块(action chunking)——即预测时间上延伸的动作序列,而非单步指令——来建模复杂轨迹和长时程依赖关系。虽然该方法在中等动作频率下表现有效,但在扩展到**高频(例如 60 Hz)**时面临重大挑战。
在高频下,直接在动作空间中训练的策略往往无法生成既在时间上平滑又在空间上一致的动作。这导致:
- 抖动轨迹: 高频噪声和精度不足。
- 启停式运动: 低频离散化迫使重复加速和减速,导致速度下降和运动不连续。
- 异步推理间隙: 实时执行需要将策略推理与动作执行重叠。然而,在异步推断的块之间切换通常会在块边界处引入巨大的不连续性,导致可见的停滞、回滚和执行质量下降。
现有的替代方案,如在低频下训练并插值到高频,会放大预测误差,且无法恢复平滑控制所需的细粒度运动结构。
2. 方法论
作者提出了一种双管齐下的方法来解决这些挑战:将学习转移到潜在空间,并引入一种无需训练的名为**“先复用后细化(Reuse-then-Refine, RTR)”**的执行策略。
2.1 通过 VAE 进行潜在空间学习
策略并非直接在动作空间中预测高频动作块,而是学习在由**变分自编码器(VAE)**压缩的连续潜在空间中进行预测。
- 编码器: 将高频动作块 At∈RH×c(其中 H 为时间跨度,c 为动作维度)压缩为低维、时间下采样的潜在表示 z∈Rh×d(其中 h=H/f,f 为下采样因子)。
- 策略训练: 策略 πθ 被训练为将观测值 ot 映射到潜在向量 z,而非原始动作。
- 解码器: 固定的 VAE 解码器从预测的潜在向量重建高频动作块。
- 机制: 该公式将学习目标从细粒度、高频的命令变化转移到连贯的局部运动模式上。KL 正则化鼓励这些模式位于更平滑的潜在流形上,从而减轻了函数逼近的负担并抑制了虚假的高频干扰。
2.2 先复用后细化(RTR)
为了确保在异步推理(即推理延迟导致预测块与当前机器人状态之间出现错位)下相邻动作块之间的连续性,作者引入了 RTR。
- 复用: RTR 不是丢弃前一个块中过时的动作或新推断块中的动作,而是复用在推理窗口期间执行的动作。
- 拼接: 将这些复用的动作与新预测动作块中未过时的部分拼接,形成一个时间上错位的中间序列。
- 细化: 该拼接序列被送入 VAE 编码器以获得潜在表示,随后进行解码。
- 结果: VAE 解码器平滑了拼接序列内部的不一致性,同时保持与最近执行动作的对齐,从而无需额外的策略训练即可实现块之间的无缝过渡。
3. 主要贡献
- 潜在空间高频学习: 证明了在连续潜在空间(通过 VAE)中学习高频动作策略,相比于直接的动作空间学习,能产生显著更平滑、更精确的轨迹,特别是对于依赖离散标记化(例如 OpenVLA-OFT)的模型。
- 先复用后细化(RTR): 提出了一种无需训练的策略,以改善异步推理下的块级连续性。与先前在动作空间中基于前一块条件生成(例如 RT-C)的方法不同,RTR 利用 VAE 来细化复用动作与新动作的混合序列。
- 实证验证: 使用三种不同的策略架构(Diffusion Policy、OpenVLA-OFT、PI0.5),在三个富含接触的任务(剥黄瓜、擦拭花瓶、写白板)上提供了广泛的现实世界评估。
4. 实验结果
该论文使用精度(平均绝对误差/偏差)、平滑度(加加速度/Jerk)、安全性(超速次数)和延迟等指标评估性能。
- 精度和平滑度: 潜在策略始终优于其动作空间对应物。例如,在“写白板”任务中,OpenVLA-OFT 的潜在版本将加加速度从 5.24 降低到 0.56,并显著提高了成功率。
- 异步执行: RTR 有效消除了朴素异步执行中观察到的“停滞”和“回滚”。在 PI0.5 的“写白板”任务中,RTR 将加加速度从 4.984(原始)降低到 1.754(潜在+RTR),并消除了可见的回滚伪影。
- 延迟: 通过实现更平滑的执行(无需重复加速/减速)并减少停滞,所提出的方法实现了比低频基线和其他高频替代方案更低的端到端执行延迟。
- 消融实验: 研究证实,适度的时间压缩(例如下采样比率 f=4)优化了精度和平滑度之间的权衡,而过激的压缩会降低性能。研究还表明,将连续性方法(如 RT-C)直接应用于潜在空间是无效的,而 RTR 是专门为这种设置设计的。
5. 意义与主张
作者声称,他们的工作强调了表示与执行协同设计对于高频机器人控制的重要性。
- 实际影响: 该方法为机器人在现实世界环境中连续执行复杂、富含接触的任务提供了一条实用途径,减少了停顿和抖动运动。
- 泛化性: 该方法提高了多种架构(Diffusion、VLA/Flow-based)的性能,并且与现有的模仿学习框架兼容,无需重新训练基础策略架构,仅需添加 VAE 和 RTR 推理策略。
- 局限性: 作者指出,目前的实验受限于传感器采样率,仅在 60 Hz 下进行,且 RTR 对直接在动作空间训练的策略(无潜在策略)的适用性仍是一个开放问题,需要进一步研究。
该论文得出结论:在潜在空间学习结合 RTR 能够实现稳定、连续和平滑的机器人执行,推动了物理环境中高频控制可靠性的发展。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。