想象一下,你正在教一个机器人完成一项复杂的任务,比如堆叠积木或倒水。为了让机器人的动作平滑,计算机不仅仅是告诉它“手向前移动”,而是会一次性预测一整块(chunk)未来的动作——比如接下来的 20 个步骤——然后执行完这整块动作后,才会再次向计算机请求新的指令。
这种方式很高效,但有一个缺陷:机器人应该信任这份 20 步计划多久?
- 如果机器人只是在空旷的房间里行走(“可预测”阶段),它可以安全地信任整个 20 步的列表。
- 但如果机器人正准备抓取一个光滑的杯子,或者插入一把钥匙(“精密”阶段),那么信任一个 20 步前制定的计划是非常危险的。它需要立即停止、重新观察并请求一份全新的计划。
目前,大多数机器人使用一种固定规则:“始终执行 10 步,然后停止并请求新计划。”这就像开车时,无论你是在笔直的高速公路上,还是在拥挤且弯曲曲折的集市中穿行,都决定每隔 10 秒钟检查一次后视镜。
核心理念:“倾听机器人的大脑”
这篇论文的作者发现了一个关于现代“基于流”(flow-based)机器人大脑的迷人现象。这些机器人不仅仅是吐出一个答案;它们会经历一个去噪过程(denoising process)。这就像雕塑家从一块粗糙的石块(噪声)开始,通过一点点凿刻,最终显现出精美的雕像。
当机器人“雕刻”它的计划时,它会做出中间猜测。作者发现:
- 当情况简单时(在空旷空间移动),随着计划的不断完善,机器人的猜测会变得非常稳定且一致。
- 当情况困难时(接触物体或需要精度),机器人在试图弄清楚最佳动作时,其猜测会剧烈波动和摇摆。
洞察力: 机器人思考过程中的“摇摆程度”(方差/variance)是一个内置信号,告诉我们何时应该停止并重新规划。
解决方案:DVAC(去噪方差自适应分块)
团队开发了一种名为 DVAC 的方法。DVAC 不使用固定计时器或步数,而是像一个实时观察机器人大脑的智能监督员。
比喻: 想象你正在给孩子讲故事。
- 如果故事很枯燥且可预测(“猫坐在垫子上”),你可以读完一整个段落后再问:“你想继续听吗?”
- 如果故事变得刺激且令人困惑(“突然出现了一条巨龙!”),你会立即停止阅读,看着孩子,并询问:“我们接下来该怎么办?”
DVAC 的工作原理:
- 它观察机器人在最终确定动作计划时的“摇摆”(方差)。
- 如果摇摆度低(计划很稳定),它会让机器人执行较长的动作块。
- 如果摇摆度激增(计划不稳定),它会说:“停!这部分计划太不确定了。”它只执行列表中的安全、稳定的部分,并立即要求机器人为棘手的环节生成一份全新的计划。
- 它还会自动调整敏感度。如果机器处于一个普遍“摇摆”的环境中,DVAC 会变得更宽容;如果环境很“平稳”,它则会变得更严格。
他们的发现
该论文在多个机器人模拟基准测试(如 LIBERO、RoboTwin 和 CALVIN)甚至真实的物理机器人上进行了测试。
- 更高的成功率: 机器人的任务完成度更高了。例如,在一个基准测试中,成功率从 94.75% 提升到了 98.00%。
- 更少焦虑: 机器人不需要那么频繁地停下来寻求帮助。它们将“重新规划”的次数减少了约 43%。
- 现实世界的证明: 在进行堆叠方块或移动试管等真实任务的机器人上,DVAC 使机器人比使用固定规则的机器人更快、更成功。
总结
简而言之,这篇论文指出:不要靠猜来决定何时停止,要让机器人自身的思考过程来告诉你。 通过倾听机器人的预测是多么“自信”或“摇摆”,我们可以让机器人既更高效(在不停止的情况下完成更多工作),又更谨慎(在事情变得棘手时精准地停下)。
技术摘要:去噪方差自适应分块 (DVAC)
1. 问题陈述
基于流(Flow-based)的机器人策略(例如利用扩散模型或流匹配的模型)已成为生成连续动作序列的标准方法。一种常见的部署策略是动作分块(action chunking),即策略预测一个未来的动作序列,并在重新规划(replan)之前执行该序列的一个前缀。虽然分块提高了时间连贯性并摊薄了推理成本,但目前的实现依赖于固定的执行时界(fixed execution horizon)(例如,始终执行预测的 50 个动作中的前 1 10 个)。
这种固定方法存在内在的权衡:
- 可预测阶段(如机械臂在自由空间运动)通常不需要频繁重新规划即可保持效率。
- 精度关键阶段(如接触密集型交互、物体操纵)需要频繁重新规划以纠正误差。
静态时界无法适应这些变化的动力学过程,导致在执行关键任务时要么出现低效的过度重新规划,要么出现风险较高的规划不足。现有的自适应方法通常需要额外的候选分块、额外的选择启发式算法或特定任务的训练,从而增加了部署的复杂性。
2. 方法论:DVAC
作者提出了去噪方差自适应分块(Denoising-Variance Adaptive Chunking, DVAC),这是一个无需训练、在测试时运行的框架,它根据基于流的策略在推理过程中的内部动力学动态确定执行时界。
核心洞察:
在流匹配推理过程中,策略通过去噪轨迹将带噪声的动作分块迭代细化为干净的动作估计。作者观察到,在最终去噪步骤中,这些中间干净动作估计值 (x^0) 的方差可以作为任务阶段稳定性的内在信号:
- 低方差: 发生在可预测的运动阶段,表明预测稳定。
- 高方差: 发生在接触密集型或精度敏感的操作阶段,表明存在不确定性并需要重新规划。
算法概述:
- 方差估计: 对于预测时界为 H 的动作分块,DVAC 监测去噪过程的最后 L 步。它计算每个未来动作索引 k 的干净动作估计值的方差 (Vs(k))。
- 阈值设定: DVAC 没有使用固定的数值阈值(这会随任务和 Rollout 而变化),而是采用了尺度自适应阈值 (τs)。它维护一个近期方差统计数据的滚动缓冲区,以计算局部均值 (μs) 和标准差 (σs)。阈值设定为 τs=μs+ασs,其中 α 是定义不确定性容忍度的超参数。
- 自适应执行: 策略执行方差保持在阈值以下的动作最长前缀。一旦方差超过 τs(表明即将进入不稳定阶段),执行停止,并触发重新规划。
- 约束: 执行长度受到最小 (Nmin) 和最大 (Nmax) 限制,以确保稳定性并防止过度重新规划。
3. 主要贡献
- 识别内在信号: 本文确立了去噪收敛稳定性是基于流的策略中进行自适应执行的一种内在、无需训练的信号,该信号与接触密集型和精度敏感型任务阶段直接相关。
- DVAC 框架: 提出了一种即插即用、无需训练的推理时方法,利用去噪方差和在线尺度自适应阈值来调整执行时界。
- 实证验证: 在多个基准测试(LIBERO、RoboTwin、CALVIN)、多种基于流的骨干网络(包括 π0.5、Qwen2.5-VL 和 GR00T)以及现实世界操纵任务中进行了全面的评估。
4. 实验结果
作者在仿真基准测试和真实硬件上对 DVAC 进行了评估,并将其与固定时界基线和其他自适应方法进行了比较。
- LIBERO 基准测试: 使用基于 π0.5 的策略,DVAC 将平均成功率从 94.75% 提高到 98.00%,同时将重新规划频率降低了 43.0%(从每回合 32.6 次降至 18.6 次)。它优于其他自适应基线,如 AAC 和 AutoHorizon。
- RoboTwin 与 CALVIN: DVAC 将 RoboTwin 上的平均成功率从 0.359 提高到 0.416,并将 CALVIN-5 上的平均完成子任务数从 3.905 增加到 4.040。值得注意的是,固定阈值变体在 CALVIN 上表现较差,凸显了 DVAC 尺度自适应设计的必要性。
- 骨干网络的可迁移性: 该方法展示了“即插即用”的能力,在无需重新训练的情况下,提高了不同模型架构(如 Qwen2.5-VL 和 Qwen3-VL-GR00T)的性能。
- 现实世界操纵: 在涉及放置方块、堆叠和移动试管的任务中,DVAC 一致地比固定时界基线(例如,方块放置任务中为 0.867 对比 0.800)实现了更高的成功率,同时显著减少了任务时间和重新规划次数。
- 阶段相关性: 分析确认,DVAC 成功地在操作敏感阶段缩短了执行时界,并在运动阶段延长了执行时界,这与理论动机相符。
5. 意义与主张
论文声称 DVAC 为分块机器人策略的置信度感知部署提供了一种简单且有效的机制。通过利用推理过程中已经计算出的去噪轨迹,DVAC 消除了对以下内容的依赖:
- 额外的训练。
- 额外的候选动作生成。
- 数值阈值的任务特定调优。
作者认为,去噪稳定性是一个现成的、内在的信号,允许策略在动态响应性(在必要时重新规划)与推理效率(在稳定时执行更长的分块)之间取得平衡。这种方法在提高任务成功率的同时,也降低了频繁重新规划带来的计算开销,解决了大规模视觉运动策略部署中的一个关键瓶颈。
承认的局限性:
作者指出,DVAC 使用去噪方差作为一种经验性的代理,而非经过校准的不确定性估计。目前它仅限于能够暴露中间轨迹的流式或扩散式策略,并假设可以访问这些内部状态。现实世界的评估在任务多样性和具身规模方面仍有局限。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。