← 最新论文
🤖 machine learning

\textit{Stochastic} MeanFlow Policies: One-Step Generative Control with Entropic Mirror Descent

本文介绍了随机均值流策略(SMFP),这是一类单步生成式策略,它将可处理的熵估计与离线策略镜像下降相结合,以有效处理多模态动作分布,同时在 MuJoCo 基准测试中保持推理效率和训练稳定性。

原作者: Zeyuan Wang, Da Li, Yulin Chen, Yuehu Gong, Yanming Guo, Ye Shi, Liang Bai, Tianyuan Yu, Yanwei Fu

发布于 2026-05-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Zeyuan Wang, Da Li, Yulin Chen, Yuehu Gong, Yanming Guo, Ye Shi, Liang Bai, Tianyuan Yu, Yanwei Fu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人走路、跑步或跳舞。为此,机器人需要一个“大脑”(即策略),让它能根据所见决定下一步做什么动作。本文介绍了一种构建这种“大脑”的更智能的新方法,称为随机均值流策略(Stochastic MeanFlow Policies, SMFP)

以下是通过简单类比来解释这种新方法如何运作的故事。

问题所在:“一刀切”与“慢速艺术家”

在机器人学习领域,传统上主要有两类“大脑”,而它们都存在一个重大缺陷:

  1. 高斯大脑(快速、简单的思考者):

    • 工作原理: 就像一个总是选择“平均”动作的机器人。如果它需要跳跃,它会计算出完美的高度然后跳起。
    • 优点: 计算极其快速且简单。
    • 缺点: 过于简单。如果一个任务有多种成功方式(例如向左或向右跳过障碍物),这种大脑就会困惑。它试图将两种选项取平均,结果导致直接撞向障碍物。它一次只能处理一种“行为模式”。
  2. 生成式大脑(缓慢、富有创造力的艺术家):

    • 工作原理: 就像一个机器人,它会想象成千上万种可能的动作,将它们勾勒出来,然后选出最好的一个。它能够处理具有多种不同解决方案(多模态)的复杂情况。
    • 优点: 表现力极强,能够找到富有创造性的解决方案。
    • 缺点: 速度慢。因为它必须经过许多步骤,所以“绘制”每个动作都需要很长时间。此外,很难衡量其“创造力”或“探索性”程度,这使得教导机器人安全地尝试新事物变得困难。

目标:兼得两者之长

研究人员希望结合“简单思考者”的速度与“创意艺术家”的创造力。他们还希望使用两种特定的教学策略:

  • 探索(SAC): 鼓励机器人尝试随机、有风险的动作,以加快学习速度。
  • 稳定性(镜像下降): 确保机器人不会过于剧烈地改变其习惯,以免忘记已掌握的知识。

问题在于:当你混合这两种教学策略时,机器人应该瞄准的“完美”动作会变成一个复杂的多峰形状(就像拥有多个山峰的山脉)。简单思考者(高斯)只能看到一个山峰,因此会失败。创意艺术家(生成式)能看到所有山峰,但速度太慢且难以控制。

解决方案:SMFP(“一步”魔法)

作者创造了SMFP,这是一种解决该谜题的新型“大脑”。以下是通过一个富有创意的隐喻来解释其工作原理:

“均值流”(MeanFlow)概念:
想象你试图引导一艘船从平静的湖泊(噪声)驶向特定的目的地(动作)。

  • 旧的生成式方法: 船必须穿过蜿蜒的河流,随着时间的推移做出许多微小的调整才能到达。这很慢。
  • SMFP: 研究人员意识到,他们可以计算出从湖泊到目的地所需的平均速度和方向,从而一次性跃迁到达。这就像将船直接瞬移到正确的位置,而不是缓慢航行。

“随机”(Stochastic)的转折:
通常,这种“瞬移”方法是确定性的(它总是去往完全相同的位置)。但为了教导机器人进行探索,我们需要它具有一定的不可预测性。

  • SMFP 添加了一个“模糊”因子。这就像说:“瞬移到目的地,但留有一点回旋余地。”
  • 关键在于,这种“回旋余地”在数学上很容易衡量。这使得机器人能够确切地知道自己在多大程度上进行了探索,而无需进行复杂的计算。

为何这很重要

  1. 速度: 因为它只需一步就能决定动作(而不是像旧生成式方法那样需要 20 步),机器人可以几乎瞬间做出思考。它的速度与旧的“简单思考者”一样快。
  2. 智能: 因为它使用了“瞬移”逻辑,它能够处理具有多种解决方案的复杂情况(就像创意艺术家一样)。
  3. 稳定性: 它成功结合了“尝试新事物”(探索)和“不要改变太快”(稳定性)的教学方法。这创造了一个足够复杂的靶标,让机器人能够学习困难的任务,同时机器人仍能高效地抵达该靶标。

结果

研究人员在七种不同的机器人模拟任务(如机器人跑步、行走或站立)上测试了这种新“大脑”。

  • 性能: SMFP 击败或持平了现有的最佳方法,包括那些缓慢且复杂的方法。
  • 效率: 它在做出决策几乎没有任何延迟的情况下,以极快的速度实现了这些高分。

简而言之: SMFP 是一种教导机器人的新方法,其速度快到足以用于实时场景,又聪明到足以处理复杂的多选项问题,同时在整个学习过程中保持机器人的稳定性和安全性。它弥合了“快但简单”与“聪明但慢”之间的鸿沟。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →