← 最新论文
🤖 machine learning

Learning When to Stop: Prefix-Optimal Dynamic Diffusion Policies for Continuous Control

本文引入了前缀最优生成策略(Prefix-Optimal Generative Policies, POGP),该框架通过学习一个前缀价值函数来实现扩散去噪过程的自适应提前停止,在显著降低计算成本的同时,也提升了连续控制任务中的最终性能。

原作者: Rohit Kumar Salla, Manoj Saravanan, Simon Stepputtis

发布于 2026-08-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Rohit Kumar Salla, Manoj Saravanan, Simon Stepputtis

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

懂得何时止步的艺术

想象一下,你正在试图教一个机器人如何走路、跳舞或接球。长期以来,科学家们一直使用一种被称为**强化学习(Reinforcement Learning)的方法,这就像用零食训练狗狗:机器人尝试各种动作,如果做得好,就会得到一份“奖励”(零食),从而学会重复这些动作。最近,一种名为扩散(Diffusion)**的强大新技术变得非常流行。你可以把扩散想象成一位雕塑家,从一块充满噪点和静电感的粘土块开始,通过一点点剔除噪声,最终显现出一尊完美的雕像。在机器人的大脑中,这种“剔除”过程是通过一系列步骤完成的,将随机的猜测转化为平滑、精准的动作。

然而,这里有一个难点。目前这种做法就像是强迫雕塑家无论如何都必须对每一件作品进行恰好 20 次的剔除工作。如果机器人只是需要向前迈出简单的一步,那么进行 20 步的剔除就是浪费时间和精力。但如果机器人正试图从突然的推搡或湿滑的地板中恢复平衡,它可能迫切需要用完这 20 步才能做对。科学家们面临的大问题是:我们如何教会机器人知道什么时候已经“剔除”得足够了,可以停下来,从而将其能量保留在真正关键的时刻?

“智能雕塑家”解决方案

这篇论文介绍了一种名为 POGP(前缀最优生成策略,Prefix-Optimal Generative Policies)的新方法,它扮演着“智能雕塑家”的角色,学习如何判断自身的进度。POGP 不再只是等待 20 步过程结束才去观察雕像是否完美,而是教会机器人通过每一步来检查自己的工作。

它是如何运作的呢?我们可以用一个简单的类比:想象你正在写一个故事。在旧的方法中,你会写完整个故事,然后只看最后一句是否通顺。如果故事写得不好,你就必须重写整个故事。POGP 则不同,它教会作者在写作的过程中观察每一个段落。在每一步,机器人都会自问:“如果我现在停止写作,并将这一句作为结尾,这会是一个好故事吗?”

为了实现这一点,研究人员为机器人配备了一个特殊的“价值计量器”(称为前缀价值函数,Prefix Value Function),它与主学习过程同步运行。这个计量器会根据当前尚未完成的动作版本,预测最终动作的效果。如果计量器说:“嘿,这看起来已经很棒了,我们可以结束了!”机器人就会立即停止。如果计量器说:“这还是有点乱,继续加油,”机器人则会继续剔除噪声。

研究发现

研究人员在四个不同的虚拟机器人环境(例如奔跑的猎豹、平衡行走的人、以及爬行的蚂蚁)中测试了这个想法,并将其与 12 种其他顶尖方法进行了对比。结果令人印象深刻:

  • 更聪明,而不只是更快: 通过教会机器人评估每一个中间步骤,最终的动作实际上变得比以前更好了。即使在被迫运行全部 20 步的情况下,POGP 的表现也比现有的最佳方法高出约 3.5%。这表明,在过程中检查你的工作不仅能节省时间,还能帮你做得更好。
  • 节省电池: 真正的魔力发生在机器人可以选择何时停止的时候。在这些测试中,PPGP 能够将所需的步骤减少约 2.7 倍(这意味着它比标准的固定 20 步链条减少了大约 18.2% 的迭代次数),同时仍保持了 97.8% 的性能。
  • 应对麻烦: 机器人学会了如何聪明地分配能量。在一项测试中,当机器人走得平稳时,它仅使用了约 3 到 5 步就做出了决策。但当研究人员突然推搡机器人使其失去平衡时,机器人会立即切换到使用 15 到 20 步来恢复平衡,只在真正需要时才投入额外的精力。

为什么这很重要

这篇论文表明,这种方法解决了让机器人走向实际应用的一个主要瓶颈。目前,机器人在处理简单任务时经常会浪费能量进行不必要的计算。POGP 展示了通过赋予机器人一种“倾听”自身进度的方式,它可以变得更加高效,同时不会丧失处理复杂、混乱情况的能力。这是迈向实用化机器人的重要一步——它们不再仅仅是遵循死板的脚本,而是知道在每一次动作中究竟该投入多少努力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →