← 最新论文
💻 computer science

Denoising Tells When to Replan: Denoising-Variance Adaptive Chunking for Flow-Based Robot Policies

本文提出了 DVAC,这是一种测试时方法,通过监测基于流(flow-based)策略中的去噪方差来自适应地确定动作块(action chunk)的执行长度,从而在多种操控基准测试中提高任务成功率并减少不必要的重新规划。

原作者: Xiangdong Feng, Yuxuan Cheng, Chen Shi, Boyao Han, Yuxuan Yan, Yitong Hong, Zhuotao Tian, Li Jiang

发布于 2026-06-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiangdong Feng, Yuxuan Cheng, Chen Shi, Boyao Han, Yuxuan Yan, Yitong Hong, Zhuotao Tian, Li Jiang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人完成一项复杂的任务,比如堆叠积木或倒水。为了让机器人的动作平滑,计算机不仅仅是告诉它“手向前移动”,而是会一次性预测一整块(chunk)未来的动作——比如接下来的 20 个步骤——然后执行完这整块动作后,才会再次向计算机请求新的指令。

这种方式很高效,但有一个缺陷:机器人应该信任这份 20 步计划多久?

  • 如果机器人只是在空旷的房间里行走(“可预测”阶段),它可以安全地信任整个 20 步的列表。
  • 但如果机器人正准备抓取一个光滑的杯子,或者插入一把钥匙(“精密”阶段),那么信任一个 20 步前制定的计划是非常危险的。它需要立即停止、重新观察并请求一份全新的计划。

目前,大多数机器人使用一种固定规则:“始终执行 10 步,然后停止并请求新计划。”这就像开车时,无论你是在笔直的高速公路上,还是在拥挤且弯曲曲折的集市中穿行,都决定每隔 10 秒钟检查一次后视镜。

核心理念:“倾听机器人的大脑”

这篇论文的作者发现了一个关于现代“基于流”(flow-based)机器人大脑的迷人现象。这些机器人不仅仅是吐出一个答案;它们会经历一个去噪过程(denoising process)。这就像雕塑家从一块粗糙的石块(噪声)开始,通过一点点凿刻,最终显现出精美的雕像。

当机器人“雕刻”它的计划时,它会做出中间猜测。作者发现:

  1. 当情况简单时(在空旷空间移动),随着计划的不断完善,机器人的猜测会变得非常稳定且一致。
  2. 当情况困难时(接触物体或需要精度),机器人在试图弄清楚最佳动作时,其猜测会剧烈波动和摇摆。

洞察力: 机器人思考过程中的“摇摆程度”(方差/variance)是一个内置信号,告诉我们何时应该停止并重新规划。

解决方案:DVAC(去噪方差自适应分块)

团队开发了一种名为 DVAC 的方法。DVAC 不使用固定计时器或步数,而是像一个实时观察机器人大脑的智能监督员。

  • 比喻: 想象你正在给孩子讲故事。

    • 如果故事很枯燥且可预测(“猫坐在垫子上”),你可以读完一整个段落后再问:“你想继续听吗?”
    • 如果故事变得刺激且令人困惑(“突然出现了一条巨龙!”),你会立即停止阅读,看着孩子,并询问:“我们接下来该怎么办?”
  • DVAC 的工作原理:

    1. 它观察机器人在最终确定动作计划时的“摇摆”(方差)。
    2. 如果摇摆度低(计划很稳定),它会让机器人执行较长的动作块。
    3. 如果摇摆度激增(计划不稳定),它会说:“停!这部分计划太不确定了。”它只执行列表中的安全、稳定的部分,并立即要求机器人为棘手的环节生成一份全新的计划。
    4. 它还会自动调整敏感度。如果机器处于一个普遍“摇摆”的环境中,DVAC 会变得更宽容;如果环境很“平稳”,它则会变得更严格。

他们的发现

该论文在多个机器人模拟基准测试(如 LIBERO、RoboTwin 和 CALVIN)甚至真实的物理机器人上进行了测试。

  • 更高的成功率: 机器人的任务完成度更高了。例如,在一个基准测试中,成功率从 94.75% 提升到了 98.00%。
  • 更少焦虑: 机器人不需要那么频繁地停下来寻求帮助。它们将“重新规划”的次数减少了约 43%。
  • 现实世界的证明: 在进行堆叠方块或移动试管等真实任务的机器人上,DVAC 使机器人比使用固定规则的机器人更快、更成功。

总结

简而言之,这篇论文指出:不要靠猜来决定何时停止,要让机器人自身的思考过程来告诉你。 通过倾听机器人的预测是多么“自信”或“摇摆”,我们可以让机器人既更高效(在不停止的情况下完成更多工作),又更谨慎(在事情变得棘手时精准地停下)。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →