← 最新论文
💻 computer science

Normalizing Flows are Capable Models for Bi-manual Visuomotor Policy

本文提出了基于条件归一化流的 NF-P 双臂视觉运动策略,该策略通过单次前向采样实现轨迹生成与可计算似然,结合随机批量选择与梯度优化等推理策略,在提升任务成功率的同时显著降低了训练与推理延迟,为实时且具备不确定性感知能力的机器人控制提供了一种高效且具竞争力的解决方案。

原作者: Jialong Li, Simon Kristoffersson Lind, Wenrui Xie, Maj Stenmark, Volker Krüger

发布于 2026-02-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Jialong Li, Simon Kristoffersson Lind, Wenrui Xie, Maj Stenmark, Volker Krüger

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种让机器人变得更聪明、更灵活的新方法,叫做**“归一化流策略”(NF-P)**。

为了让你轻松理解,我们可以把机器人学习做任务(比如双手配合叠积木、擦桌子)想象成学习做一道复杂的菜。

1. 现状:以前的机器人像“死记硬背的学生”

以前的主流方法(比如扩散模型 Diffusion Models)就像是一个正在努力画画的艺术家。

  • 怎么学? 它看着人类演示(比如倒水),然后试图一点点“去噪”,从一团乱麻中慢慢画出正确的动作。
  • 缺点:
    • 太慢了: 就像画画要一笔一笔描,它需要很多步才能算出下一步动作,导致机器人反应迟钝,没法做需要快速反应的事。
    • 心里没底: 它画完了,但不知道自己画得对不对,也不知道有没有更好的画法。它只能“蒙”一个结果。

2. 新方案:NF-P 像“拥有完美地图的导航员”

这篇论文提出的 NF-P 方法,换了一种思路。它不像是在画画,而像是在学习如何把复杂的动作“压缩”成简单的信号,再“解压”回动作。

  • 核心魔法(归一化流):
    想象一下,机器人的动作空间(所有可能的手部动作)是一个形状怪异的迷宫。
    • 以前的模型是在迷宫里乱撞,试图找到出口。
    • NF-P 则像是一个拥有神奇魔法的导航员。它能把这个怪异的迷宫,瞬间拉伸、扭曲成一个完美的圆形广场(高斯分布,也就是最简单的形状)。
    • 在圆形广场上,它随便扔个飞镖(采样),都能轻松算出这个飞镖落在哪里的概率。
    • 然后,它利用魔法把广场反向折叠回原来的迷宫,那个飞镖就变成了一个完美的动作指令。

3. 为什么它更厉害?(两大绝招)

因为 NF-P 知道“每个动作发生的概率是多少”(就像导航员知道哪条路最通畅),它有了两个以前模型没有的超能力:

绝招一:海选法(Stochastic Batch Selection)

  • 比喻: 就像你要选一个最佳方案,以前模型只能随机选一个,然后硬着头皮做。
  • NF-P 的做法: 它瞬间生成 128 个 可能的动作方案(就像 128 个不同的厨师同时做菜)。因为它知道每个方案的“成功率”(概率),它直接挑出那个最靠谱、最像人类演示的方案来执行。
  • 结果: 机器人动作更精准,不容易出错。

绝招二:微调法(Gradient Refinement)

  • 比喻: 就像你写了一封邮件,觉得有点别扭。
  • NF-P 的做法: 它先随机生成一个动作,然后利用“概率地图”告诉它:“往左一点,成功率更高;往右一点,风险更大”。它顺着这个指引,像爬山一样,一步步把动作调整到“山顶”(最完美的动作)。
  • 结果: 即使初始想法有点偏,它也能迅速修正,让动作更流畅。

4. 实验结果:快、准、稳

作者在电脑模拟和真实的双机械臂机器人(Kuka 机器人)上做了测试:

  • 任务: 叠积木、叠毛巾、把东西递过去等。
  • 表现:
    • 成功率更高: 在叠积木任务中,旧方法经常卡在第一步(比如手伸过去却抓不住),而 NF-P 几乎都能成功开始,并且最终成功率高达 60%-75%。
    • 速度快: 旧方法算一次动作可能要很久,NF-P 像按快门一样,一次就搞定,速度极快,适合实时控制。
    • 训练更省: 它学得更快,用的数据更少。

5. 总结:为什么这很重要?

这就好比以前的机器人是**“笨拙的学徒”,虽然能干活,但反应慢、容易慌、不知道自己在干嘛。
而 NF-P 让机器人变成了
“经验丰富的老手”**:

  1. 心里有数: 它知道自己做的动作有多大概率是对的(不确定性量化)。
  2. 反应神速: 不需要慢慢“去噪”,瞬间就能给出指令。
  3. 自我修正: 遇到复杂的双手配合任务(比如叠毛巾),它能迅速调整,不会像以前那样卡住不动。

一句话总结:
这篇论文证明,用**“归一化流”这种数学工具,可以让机器人像人类一样,既快又稳地学会复杂的双手配合任务,而且还能实时知道自己做得对不对**,是未来让机器人真正走进家庭、工厂的关键一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →