← 最新论文
💻 computer science

DIA: Denoising Intermediate Advantage for Diffusion Policy Optimization

本文介绍了去噪中间优势(Denoising Intermediate Advantage, DIA),这是一种通过为中间去噪步骤分配状态相关信度的策略梯度方法,旨在增强基于扩散的机器人策略,从而实现比现有微调方法更高效的探索和更卓越的任务性能。

原作者: Arjun Sohal, Yuchi Zhao, Miroslav Bogdanovic, Alan Aspuru-Guzik

发布于 2026-09-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Arjun Sohal, Yuchi Zhao, Miroslav Bogdanovic, Alan Aspuru-Guzik

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

让机器人能够像人类一样灵活地操纵物体一直是人工智能的一个长期目标,但教它们如何做到这一点却是一种微妙的平衡艺术。多年来,最有效的方法一直是“行为克隆”(behavior cloning),即机器人通过观看人类执行任务的视频来学习,并模仿这些动作。这种方法催生了一类强大的新型机器人控制器,其核心技术被称为“扩散”(diffusion)。就像雕塑家从一块粗糙的石块开始,逐渐凿去材料以显现出雕像一样,这些扩散模型从随机噪声开始,并缓慢将其细化为精确的动作序列。虽然这种方法在捕捉人类演示的多样性和细微差别方面表现出色,但它有一个根本性的局限:机器人的表现严格受限于其所展示数据的质量和多样性。如果训练视频从未展示过机器人以新的方式解决问题,那么当面对现实世界中的这类问题时,机器人很可能会失败。为了克服这一点,研究人员开始将这些扩散模型与“强化学习”(reinforcement learning)相结合——这是一种智能体通过试错来学习的技术,通过获得良好结果获得奖励,并通过犯错受到惩罚。然而,挑战在于扩散模型并不会一次性做出单一决策;它们是通过一个漫长的、循序渐进的细化过程来生成动作的。确定在这条长链中究竟是哪一步导致了成功或失败,已被证明是现有方法中一个难以破解的谜题。

来自多伦多大学和向量研究所(Vector Institute)的一个研究小组提出了一种针对该问题的全新解决方案,称为“去噪中间优势”(Denoising Intermediate Advantage,简称 DIA)。他们的工作解决了当前系统在如何向机器人的学习过程分配功劳方面存在的特定缺陷。在标准方法中,当机器人在经过一长串细化步骤后成功完成任务时,系统会将相同的功劳分配给该序列中的每一个步骤。这就像是一组画家正合作完成一幅壁画,而经理平等地表扬了每一次笔触,无论那一笔是微小的细节,还是定义了整个图像的关键线条。研究人员认为这是低效的,因为生成过程中的中间步骤包含了关于机器人正朝着哪个方向前进的有价值信息。由于之前的研究方法将整个细化链视为一个整体,因此错失了从每个阶段所做的具体决策中学习的机会。

为了解决这个问题,DIA 方法引入了一种评估机器人在细化过程中每一步进展的方式,而不仅仅是在结束时进行评估。该系统学会了在动作成型过程中,随着其一步步演进,去预测该动作的价值。这使得机器人能够理解某些中间决策对于最终结果比其他决策更为关键。系统不再等待任务完成后才观察结果,而是在生成过程中提供反馈,引导机器人在早期阶段做出更好的选择。这创造了一种更细致的学习信号,帮助机器人区分出是“运气好而成功”还是“执行了良好的策略”。研究人员在四组不同的机器人任务上测试了这种方法,涵盖了从简单的物体操纵到需要机器人长时间协调移动手臂的复杂多步组装任务。

测试结果一致且显著。在被称为 Robomimic 的标准基准测试集上(包括提升物体、移动罐子和画正方形等任务),DIA 方法的表现始终优于现有技术。在最具挑战性的任务——即机器人必须使用双臂移动物体的双臂运输挑战中,新方法在保持同样高成功率的同时,比之前的最佳方法实现了 23% 的更高奖励得分。这种进步不仅在于完成任务的频率,更在于完成得更好。使用 DIA 训练的机器人能更快地达到成功状态,完成任务所需的步骤也更少。在一项特定测试中,机器人成功所需的时间减少了 21%。这表明机器人不仅仅是在偶然撞见解决方案,而是正在学习一条通往目标的更高效路径。

当研究人员在训练数据不完整或缺失完整解决方案的任务上测试该方法时,其威力变得更加明显。在一个厨房模拟场景中,机器人需要执行一系列子任务,如打开炉灶或打开橱柜,而标准的训练数据通常只展示了完整序列的一部分。以往的方法在这里表现挣扎,往往会陷入循环或重复无关动作,因为它们过于依赖训练视频中的精确模式。然而,DIA 方法能够重新组合它所看到的局部演示,从而创造出全新的、成功的动作序列。在最具挑战性的版本测试中,没有任何单一的演示展示了完整的任务,基准方法完全失败,成功率为零。相比之下,DIA 方法成功了 69% 的时间。它成功地拼凑出了完成任务所需的步骤,有效地学习了一种在原始训练示例中并未明确存在的策略。

这些发现表明,通过关注决策过程中的中间步骤,机器人可以摆脱训练数据的限制。该方法使它们能够探索新的策略,并发现解决问题更有效的方式,而不仅仅是简单地模仿所见之物。虽然实验是在模拟环境中进行的,但结果指向了一个未来:机器人可以更灵活地适应复杂的现实环境。研究人员指出,下一步将在物理机器人上测试这些想法,这一转变将需要克服现实世界中收集数据的实际挑战。目前,这项工作证明了,通过将功劳归于机器人思考过程中的正确时刻,可以造就更聪明、更强大的机器。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →