✨ 要点🔬 技术摘要
想象一下,你正在教一个机器人完成一项精细的任务,比如折叠一条毛巾或把一个积木放入锅中。你不希望机器人想的是:“把手移到这里,然后移到那里,再移到那里”,这种一次移动一小步、一小步的细碎动作。那样看起来就像是一个动作卡顿、跳跃的电子游戏角色。相反,你希望机器人的动作是平滑、流畅的,就像舞者在舞台上翩翩起舞一样。这就是视觉-语言-动作(Vision-Language-Action, VLA)模型 的世界。这些是超级智能的 AI 系统,它们可以通过摄像头“看”世界,通过阅读你的指令来“理解”,然后通过移动机械臂来进行“行动”。
长期以来,这些机器人一直有点笨拙。当它们规划一系列动作(称为“动作块”)时,它们通常只是列出一长串单独的位置,就像一个点对点的连线谜题,而点与点之间的线条是锯齿状且尖锐的。这会导致机器人在切换下一个计划时出现抖动、摇晃甚至突然停止。这就像试图通过每次只看路面一英寸的地方来开车;你会不停地左右乱晃。科学家们正在问一个大问题:我们如何教机器人以平滑的连续曲线而不是锯齿状线条进行规划,从而让它们的动作像真实的生物一样自然?
这篇论文介绍了一种利用被称为**埃尔米特曲线(Hermite Curves)**的巧妙新方法来解决这种笨拙感。把埃尔米特曲线想象成不是一份点位清单,而是一把灵活的尺子。你不需要告诉机器人每一时刻应该在哪里,你只需要告诉它起始位置、结束位置,以及它离开起点和到达终点时的速度。然后,数学会自动填充出这些点之间平滑且完美的路径。研究人员测试了将这个“灵活尺子”概念应用在机器人大脑中的三种不同方式。
最令人惊讶且最成功的发现是,使用这个工具的最佳方式并不是在实际工作中强迫机器人只能 进行这些完美的曲线运动。相反,机器人应该将这些平滑曲线作为一种训练指南 。想象一下体操运动员在平衡木上练习。他们并不需要在实际比赛中必须有平衡木才能表现出色;他们只需要通过练习来掌握那种平滑的感觉。同样地,研究人员发现,在训练过程中加入一个“平滑度惩罚”——即如果机器人的规划动作过于颠簸,就对其进行轻微的“责备”——即使在实际工作时不使用这种特殊的曲线数学,也能显著提高机器人的工作表现。
在他们的测试中,这种“仅限训练”的方法(他们称之为埃尔米特正则化/Hermite Regularization )大获成功。在名为 LIBERO 的计算机模拟实验中,它将机器人的成功率从约 96% 提升到了接近 99%。更令人印象深刻的是,在实验室的真实物理机器人上,成功率从 63.4% 大幅跃升至 90.0%。机器人的动作变得更平滑、抖动更少,而且更不容易掉落手中握持的物体。该论文表明,通过在学习阶段教机器人以平滑、连续的路径进行“思考”,我们赋予了它一种隐藏的超能力:无需额外的计算能力或降低反应速度,就能应对混乱的现实世界。事实证明,让机器人变得优雅的秘诀不在于一个更高级的引擎,而在于一种更好的教它如何起舞的方式。
技术摘要:作为视觉-语言-动作模型轨迹先验的 Hermite 曲线
问题陈述 尽管视觉-语言-动作(VLA)模型在机器人操控领域取得了成功,但其“动作块”(action chunk)接口仍然缺乏结构化。目前的先进模型通常将动作块展平为每步控制的时间序列。这种表示法将动作块视为一组独立的离散样本,缺乏连接它们的连续轨迹的明确概念。这导致了两个主要的失效模式:
块内不连贯性(Intra-chunk incoherence): 对时间步进行独立优化依赖于逐点重建损失,无法惩罚缺乏时间平滑性的锯齿状、高频运动。
块间不连续性(Inter-chunk discontinuity): 在闭环重规划过程中,相邻的动作块被直接拼接,而没有强制执行边界连续性(位置或速度)。这导致在重规划缝隙处出现突跳和速度尖峰,从而引发物理不稳定和任务失败。
作者认为,这些问题并非源于模型容量的不足,而是源于缺失归纳偏置(inductive bias)。这种扁平化的表示法未能嵌入物理运动固有的时间平滑性和边界连续性。
方法论 本文提出了 Hermite 轨迹先验 ,将动作块参数化为由端点位置和速度定义的分段三次 Hermite 曲线。这种方法通过一个固定的、可微的线性算子(D H D_H D H )将边界变量映射到稠密轨迹,从而显式地强制执行平滑性和连续性。
作者在三种不同的 VLA 建模范式中实例化了该先验,以研究如何集成轨迹结构:
Hermite Token (HERMITE-VLADH): 专为离散自回归模型设计。动作块被编码为量化的 Hermite 边界变量(端点的位置和速度)。这些变量作为 token 被自回归地预测。解码器从这些 token 中重建平滑轨迹,将自回归循环限制在轻量级的动作头而非主干网络中。
Hermite Scaffold (HERMITE-VLACH): 专为连续生成模型(如流匹配)设计。该模型将预测的干净动作分解为一个结构化的“Hermite 脚手架”(低维边界参数)和一个逐时间步的残差。脚手架确保全局连续性,而残差捕捉高频局部变化。
Hermite Regularization (HERMITE-VLAReg): 同样针对连续模型,但有一个关键区别:Hermite 算子仅被用作辅助训练目标 。一个辅助头从共享特征中预测 Hermite 边界变量,并针对地面真值(ground-truth)轨迹进行监督。在推理期间,该分支会被丢弃,原始的基准动作头和采样程序保持不变。该变体旨在提供轨迹结构的归纳偏置,而不改变运行时参数化或增加推理开销。
核心贡献
显式轨迹参数化: 本文引入了一种紧凑的三次 Hermite 算子,取代了扁平的逐时间步控制,转而使用端点位置和速度,将端点连续性和平滑性直接嵌入动作表示中。
范式无关的集成: 作者证明了该固定算子可以通过 HERMITE-VLADH 支持离散自回归建模,并通过 HERMITE-VLACH 支持连续生成建模。
仅限训练阶段的归纳偏置: HERMITE-VLAReg 的引入表明,将轨迹连续性作为训练时的结构化目标进行强制执行,比显式的运行时分解能获得更优的性能,且在实现最优结果的同时实现了零推理开销。
运动学表征: 本研究提供了对生成运动的细粒度分析,证明了该先验有效地降低了 jerk(加加速度),抑制了高频频谱成分,并减弱了缝隙处的瞬态响应。
实验结果 实验在两个仿真基准(LIBERO 和 LIBERO-plus)以及四个单臂和双臂平台的真实机器人任务上进行了。
仿真性能:
HERMITE-VLAReg 在连续策略中实现了最高的成功率,在标准 LIBERO 上将基准 π 0.5 \pi0.5 π 0.5 从 95.9% 提升至 98.7% ,在分布偏移的 LIBERO-plus 上从 85.7% 提升至 90.9% 。
HERMITE-VLADH 在 LIBERO 上将离散基准 π 0 \pi0 π 0 -FAST 从 85.5% 提升至 95.4% 。
增益在长程任务(LIBERO-10)以及存在相机/机器人扰动的情况下最为显著,表明该先验能有效缓解扩展重规划过程中的误差累积。
真实机器人性能:
在四个真实机器人任务中,HERMITE-VLAReg 实现了 90.0% 的平均成功率,较 π 0.5 \pi0.5 π 0.5 基准(63.4%)和 HERMITE-VLACH(81.7%)有显著提升。
这种提升主要源于任务的中期阶段(精确放置/折叠),在这些阶段,基准模型常因执行抖动而失败。
轨迹质量:
对 jerk(位置的三阶导数)和 SPARC(谱弧长)指标的分析证实,Hermite 变体产生的运动明显更加平滑。
HERMITE-VLAReg 相比基准模型降低了约 13% 的中值 jerk,并显著减少了重规划缝隙处的加速度尖峰(在特定任务上减少了约 50% 的缝隙不连续性)。
定性分析显示,基准模型经常表现出锯齿状的之字形路径和局部振荡,而 Hermite 变体则遵循直接且连续的轨迹。
意义与主张 本文主张,Hermite 轨迹先验的主要价值在于其作为学习阶段的归纳偏置 ,而非运行时的约束。HERMITE-VLAReg(仅训练阶段)优于 HERMITE-VLACH(运行时分解)这一发现表明,当结构化约束用于引导特征学习过程而不限制推理时的表达能力时,其效果最为理想。
作者总结道,显式构建轨迹先验解决了当前 VLA 架构中的一个根本性差距:即高层推理与底层控制之间缺乏物理运动结构。通过将边界连续性和平滑性嵌入学习目标,该方法能够在不增加计算成本或修改推理流水线的情况下,实现鲁棒、平滑的物理执行。这为增强机器人操控策略的可靠性提供了一种轻量级、即插即用的范式。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。