← 最新论文
🤖 machine learning

A Self-Evolving Default Action for Cooperative Tasks with Continuous Action Space

本文提出了 SAFE,一种新颖的多智能体强化学习框架,该框架利用自演化默认动作来构建无偏的反事实基准,从而有效地将反事实信用分配扩展到连续动作协作任务中,并在无需额外模拟或先验知识的情况下确保收敛至局部最优。

原作者: Shuangyao Huang

发布于 2026-07-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Shuangyao Huang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个机器人、无人机或自动驾驶汽车群体需要像完美的编舞舞团一样协同工作的世界。它们不仅仅是在遵循剧本;它们在边做边学,试图弄清楚谁做得对,谁搞砸了,同时还要在一个动作不仅仅是“左”或“右”,而是可以在两者之间进行任何微小、精准移动的世界中穿行。这就是多智能体强化学习(MARL)的领域。把它想象成一场高风险的捉迷藏游戏,玩家在玩的过程中也在学习规则。巨大的挑战在于:当动作是连续的(比如平滑地转动方向盘,而不是直接切入新车道)时,要公平地为每个成员在团队成功中所做的贡献进行“信用分配”会变得极其困难。如果团队赢了,是因为领队转向完美,还是因为跟随者只是运气好?如果团队撞车了,又是谁的错?准确实现这种“信用分配”是教会这些数字团队在没有人类持续监督的情况下进行协作的关键。

于是,一种名为 SAFE(基于经验的自进化默认动作,Self-evolving default Action From Experiences)的新型框架应运而生,这是一个旨在帮助这些机器人团队学习得更好、更快、更公平的巧妙解决方案。SAFE 背后的研究人员注意到,以往的方法试图猜测如果一个机器人采取了不同的行动会发生什么,但当动作是连续的时候,这些猜测往往基于随机的、未经训练的样本。这就像是在问一个刚学会骑自行车的人,如果尝试骑独轮车会怎么做一样;那个答案并不会很有帮助。SAFE 通过使用一种“自进化的默认动作”改变了游戏规则。它不再进行随机猜测,而是观察机器人自身的历史动作,以找到一个代表其平均行为的“默认”动作。通过将机器人的实际动作与其个性化的平均值进行比较,系统可以准确计算出该特定动作对团队的贡献或损害。

论文证明,这种方法在协作驾驶任务中表现出色,在这些任务中,车辆必须在充满障碍物的公路上行驶而不发生碰撞。在涉及多达七辆车和两个障碍物的模拟场景中,SAFE 始终优于现有的最先进模型,如 VDN、QMIX 和 COMA。研究人员从数学上证明了他们的方法不会在学习过程中引入“偏差”,这意味着机器人被保证会收敛到一个好的解决方案,而不是陷入一个坏的方案中。至关重要的是,他们表明这种成功来自于他们分配信用的新方式,而不仅仅是因为系统能够处理连续动作。更有趣的是,他们的实验表明,使用来自机器人记忆的一个经过精心挑选的“默认”动作,实际上比尝试平均化大量不同的动作效果更好。简而言之,SAFE 给机器人团队提供了一种更聪明的方式来反思过去的动作,帮助它们学会如何共同起舞,而不至于互相绊脚。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →