← 最新论文
💻 computer science

DiscreteRTC: Discrete Diffusion Policies are Natural Asynchronous Executors

本文提出了 DiscreteRTC,这是一个利用离散扩散策略原生去掩码能力的框架,旨在为物理人工智能实现高效且无需微调的异步执行,与现有的基于流匹配的方法相比,其成功率高出显著且推理成本更低。

原作者: Pengcheng Wang, Kaiwen Hong, Chensheng Peng, Katherine Driggs-Campbell, Masayoshi Tomizuka, Chenfeng Xu, Chen Tang

发布于 2026-04-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Pengcheng Wang, Kaiwen Hong, Chensheng Peng, Katherine Driggs-Campbell, Masayoshi Tomizuka, Chenfeng Xu, Chen Tang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用简单语言和日常类比对论文《DiscreteRTC:离散扩散策略是自然的异步执行器》的解释。

核心难题:“思考”与“行动”的两难困境

想象你正在玩一款快节奏的电子游戏,比如与电脑进行网球比赛。

  • 机器人的任务: 机器人需要击球。
  • 问题所在: 机器人的大脑(AI)需要一点时间来计算完美的挥拍动作。在它“思考”期间,球仍在飞行。
  • 旧方法(同步式): 机器人停下来,思考,计算,然后才挥拍。等到它挥拍时,球已经飞过去了。这对动态任务来说是致命的。
  • 更好的方法(异步式): 机器人需要在已经行动的同时进行思考。它应根据上一次思考的结果继续挥拍,同时计算下一次挥拍的动作。

现有方案:“实时分块”(RTC)

为了解决这个问题,工程师们使用了一种称为**实时分块(Real-Time Chunking, RTC)**的方法。

  • 类比: 想象机器人每次以 10 个词为一块来写故事。
    1. 它写下第 1 到第 10 个词。
    2. 当它正在写第 11 到第 20 个词时,它开始执行第 1 到第 10 个词的内容。
    3. 故障点: 当机器人从第一块切换到第二块时,过渡可能会显得生硬。这就像作家在句子中间突然改变笔迹风格。机器人可能会因为新计划与旧计划不完全匹配而猛地抽动手臂。

为了消除这种生硬感,目前最好的方法(使用流匹配 Flow-Matching)试图“覆盖”过渡区域。它会冻结已经写好的词,并尝试“修复(inpaint)”句子的其余部分,使其变得平滑。

  • 局限性: 这种“修复”就像要求画家在仍在调色时去修补画作。它需要一个特殊且复杂的指南(启发式规则)来告诉 AI 如何融合新旧内容。这种方法速度慢,需要额外的训练,而且往往显得笨拙。

新方案:DiscreteRTC

作者提出了一种名为DiscreteRTC的新方法。他们将机器人的“大脑”(策略)替换为离散扩散策略(Discrete Diffusion Policy)。

类比:“填空题”游戏
想象机器人并不是从头开始写故事。相反,它正在玩一个**“填空题”**游戏(类似于 Mad Libs 或填字游戏)。

  • 工作原理: 机器人被训练为观察带有隐藏(掩码)单词的句子,并猜测缺失的单词是什么。
  • 神奇之处: 因为机器人已经是猜测缺失单词的专家,所以它不需要学习一种特殊的技巧来“修复”过渡。它只需做它天生擅长的事。

根据论文,这种新方法之所以能带来变革,原因如下:

1. 无需额外训练(免微调)

  • 旧方法: 你必须在机器人训练完成后,教给它一种特殊的“过渡技能”,这既困难又充满风险。
  • 新方法: 机器人已经被训练为填空。当它需要切换分块时,只需将过渡视为一个新的“填空题”。它开箱即用,效果完美。

2. 自然引导(无需复杂规则)

  • 旧方法: 工程师必须编写复杂的手动规则(启发式规则)来告诉 AI 如何融合新旧动作。这就像给司机一本关于如何转向的手册,而不是让他们直接开车。
  • 新方法: 机器人自然地知道如何处理过渡。如果它已经想出了新分块的前几个词,它就停在那里,等待下一个想法。那些“未掩码”的单词自然地引导下一步,无需手册。

3. 更快更省钱(更低的推理成本)

  • 旧方法: “覆盖”方法要求机器人做双倍的工作(计算原始计划加上修正),导致速度变慢。
  • 新方法: 由于机器人只需“解掩码”(揭示)它尚未确定的单词,它跳过了已经完成的计算。这就像读一本书,你只读尚未看过的页面,而不是每次翻页时都重读整本书。
    • 结果: 它比旧方法快约30%(计算量为 0.7 倍)。

结果:它真的有效吗?

作者通过两种方式测试了这一点:

  1. 模拟世界(Kinetix): 一个拥有移动目标的数字游乐场。
    • 结果: 新方法比旧方法更频繁地完成任务,并且更好地处理了延迟。
  2. 真实机器人(现实世界): 一个物理机械臂试图抓取移动物体并将其放置在移动平台上。
    • 结果: 在最具挑战性的移动任务中,旧方法完全失败(0% 成功率)。而新方法的成功率达到了95–100%。
    • 速度: 新方法在实时执行中也更快。

一句话总结

DiscreteRTC 是一种让机器人在移动中思考的新方法,它将动作规划视为“填空题”游戏,与当前笨拙的方法相比,它更自然、更平滑、更快速,且无需任何额外训练。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →