← 最新论文
🤖 AI

CHDP: Cooperative Hybrid Diffusion Policies for Reinforcement Learning in Parameterized Action Space

该论文提出了 CHDP,一种协作式混合扩散策略框架,通过采用两个具有顺序更新机制的协作扩散智能体以及用于离散动作的基于码本的低维嵌入,解决了参数化动作空间带来的挑战,并在混合动作基准测试上实现了最先进的性能。

原作者: Bingyi Liu, Jinbo He, Haiyong Shi, Enshu Wang, Weizhen Han, Jingxiang Hao, Peixi Wang, Zhuangzhuang Zhang

发布于 2026-06-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Bingyi Liu, Jinbo He, Haiyong Shi, Enshu Wang, Weizhen Han, Jingxiang Hao, Peixi Wang, Zhuangzhuang Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人玩一款复杂的视频游戏,或者控制一个机械臂。在许多现实世界的场景中,机器人不仅仅需要选择做“一件事”;它必须同时做出两个部分的决策:

  1. 离散选择(The Discrete Choice): “我应该拿起哪种工具?”或者“我是该跳跃、奔跑还是飞行?”(这些是截然不同、独立的选项)。
  2. 连续调整(The Continuous Adjustment): “我应该用多大的力气推?”或者“我应该以精确的角度转动多少度?”(这些是精细、流动的数值)。

这种组合被称为混合动作空间(Hybrid Action Space)。这就像是在决定要演奏哪种乐器(离散)的同时,还要决定精确的音量和节奏(连续)。

这篇论文介绍了一种名为 CHDP(协作式混合扩散策略,Cooperative Hybrid Diffusion Policies)的新方法,旨在帮助机器人掌握这种棘手的平衡艺术。以下是通过简单的类比对该方法的解释:

问题所在:“一刀切”的失败

以往的方法试图通过使用“单峰(unimodal)”方法来解决这个问题。想象一个机器人,当被要求射门得分时,它试图取所有最佳踢球方式的平均值。它可能会决定用“左半脚、右半脚结合”的力量以及“中等”的力度来踢球。但在现实中,那是一个非常糟糕的踢法!射门通常要么是用左脚踢,要么是用右脚踢,且每种踢法都有其特定的力量。

旧的方法往往会陷入中间地带,产生微弱、平庸的动作,或者坍缩到只做一种类型的动作,从而错失其他成功的策略。此外,当选项数量变得巨大时(例如有数百种不同的工具可供选择),它们也会表现得难以应对,导致机器人感到不知所措且陷入混乱。

解决方案:协作双子星 (CHDP)

作者提出将机器人的大脑视为两个协作智能体组成的团队,而不是一个孤独的思考者。

1. “建筑师”(离散智能体)

  • 角色: 这个智能体决定动作的类别。它挑选工具或模式(例如,“使用锤子”)。
  • 诀窍: 它并没有仅仅挑选一个数字,而是使用了扩散策略(Diffusion Policy)。把扩散想象成一位雕塑家从一块充满噪声的大理石块开始,通过一点点剔除噪声,最终显现出完美的雕像。这使得“建筑师”能够探索复杂且多维的可能性,并找到最合适的类别,即使存在许多不同的成功方式。
  • 码本(The Codebook): 为了处理庞大的选择列表(比如 1,000 种工具),“建筑师”并不会逐一观察每件工具。相反,它使用了一个码本,这就像是一个“概念卡片库”。“建筑师”会从库中挑选一张代表一组相似工具的卡片。这让决策过程保持紧凑且易于管理,解决了“不知所措”的问题。

2. “匠人”(连续智能体)

  • 角色: 一旦“建筑师”选定了类别(例如,“锤子”),“匠人”就会负责确定精确细节(例如,“以 4.2 牛顿的力在 15 度角进行打击”)。
  • 联系: “匠人”受到“建筑师”选择的约束(Conditioned)。这就像一位画家,只有在建筑师选定画布尺寸之后,才会开始调色。 “匠人”同样使用这种“雕塑”(扩散)技术,来寻找与所选类别相匹配的完美连续数值。

核心秘诀:轮流上阵

如果两个智能体试图在学习和改变想法时完全同步进行,它们可能会互相干扰。想象两位舞者在尝试学习一段舞步,而音乐和舞步也在不断变化,他们会互相绊倒。

CHDP 使用了顺序更新机制(Sequential Update Scheme)

  1. 首先,**“建筑师”**学习并确定一个计划。
  2. 然后,**“匠人”**学习如何执行该特定计划。
  3. 它们通过轮流更新来工作,确保它们能够平滑地相互适应,而不会产生冲突。

实验结果

作者在几个困难的基准测试(如机器人操控和游戏 AI)上测试了这个系统。

  • 更高的成功率: CHDP 比之前的最优方法高出多达 19.3%
  • 多策略掌控力: 在一次测试中,当其他机器人陷入重复做同一种动作时,CHDP 发现了三种不同的成功策略来解决同一个问题(例如,以不同的角度和力量击中目标)。
  • 可扩展性: 它能够处理巨大的选择数量(高达 1,024 种不同的离散选项)而不会感到困惑,而其他方法则在此类情况下会失败。

总结

简而言之,CHDP 是一种训练 AI 的新方法,它将复杂的决策视为**“策略家”与“调优师”之间的团队协作**。通过使用先进的“雕塑”数学(扩散)来寻找最佳选项,并通过轮流学习,它使机器人能够掌握既需要宏观选择又需要精细调整的复杂任务,其表现显著优于以往的方法。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →