← 最新论文
💻 computer science

PRISM: PRior-guided Imagination Sampling in world Models

PRISM 是一个轻量级、任务无关的框架,它通过直接从冻结的 JEPA 式世界模型中提取状态条件动作先验,并利用无参数的高斯乘积(Product-of-Gaussians)更新将其集成到采样过程中,从而增强了连续控制规划,在不增加架构冗余或推理开销的情况下显著提高了成功率。

原作者: Yuhai Wang, Jiawei Xia, Rongxuan Zhou, Xiao Hu, Yongliang Shi, Jing Du, Yang Ye

发布于 2026-06-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuhai Wang, Jiawei Xia, Rongxuan Zhou, Xiao Hu, Yongliang Shi, Jing Du, Yang Ye

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人将一个方块推到桌上的特定位置。为了完成这个任务,机器人需要一个“世界模型”——一个心理模拟过程,让它能够想象:“如果我向左推,方块会到这里;如果我向右推,方块会到那里。”

问题不在于机器人无法想象未来,而在于它首先要决定去想象什么

问题所在:在黑暗中盲目射击

目前,大多数机器人使用“世界模型”来进行规划,但它们的规划过程是从盲目猜测开始的。这就像是在一个巨大的、漆黑的仓库里寻找一把特定的钥匙。

  • 旧方法(原生 MPPI): 机器人从空中随机投掷数千把钥匙(候选动作),希望能有一把正好落在锁孔里。它检查每一把,保留那些看起来有希望的,然后再次尝试。这虽然可行,但既慢又浪费。它需要投掷数百把钥匙才能找到正确的那把。
  • 缺陷: 机器人忽略了它已经通过过去的经验学会了如何移动这一事实。它丢弃了在学习观察世界时所获得的“直觉”。

解决方案:PRISM(直觉引导)

作者提出了 PRISM,其全称为 PRior-guided Imagination Sampling(先验引导的想象采样)。

把 PRISM 想象成在机器人开始投掷钥匙之前,给了它一把手电筒和一张心理地图

  1. 同一个大脑,两项任务: 机器人使用与其学习如何观察世界时完全相同的“大脑”(神经网络)。通常,这个大脑只预测“接下来会发生什么”。PRISM 为这个大脑增加了一个微小的、轻量级的附件(一个小“头”),它会询问一个不同的问题:“基于我所看到的,现在最可能采取的动作是什么?”
  2. 高斯先验(“信心”测量计): 这个附件不仅仅是猜测一个动作,它还会猜测一个动作的范围,并且至关重要的是,它会猜测自己对这个猜测有多自信
    • 高信心: “我 99% 确定方块需要被稍微向左推一点。”(范围很窄)。
    • 低信心: “我不知道该做什么。”(范围很宽)。
  3. 神奇的融合(高斯乘积): 当机器人开始规划时,它并不只是随机猜测。它将自己的“随机猜测”与这种“直觉猜测”进行融合。
    • 如果直觉很有信心,机器人就会将搜索紧紧围绕在这个想法周围,从而节省时间。
    • 如果直觉不确定(例如,机器人处于一个奇怪的新情况中),数学会自动忽略直觉,恢复到安全的随机猜测方法。这是一种“优雅失败”机制——它绝不会让一个错误的猜测毁掉整个计划。

结果:更聪明,而非更努力

作者在两个任务上测试了该方法:推动一个 T 形块和移动一个立方体。

  • 极高的效率: 与旧方法相比,在相同的计算能力下,使用 PRISM 的机器人在立方体任务上的成功率提高了 35%,在 T 形块任务上的成功率提高了 32%
  • 小预算,大回报: 最显著的改进发生在机器人被允许进行极少次数猜测(“小样本预算”)的情况下。这就像是因为你知道该往哪儿看,所以第一次尝试就找到了钥匙,而不是在整个仓库里到处乱找。
  • 真实机器人: 他们甚至在真实的物理机器人(Franka 手臂和 ARX 手臂)上进行了测试,且无需更改代码或降低机器人速度即可奏效。

类比总结

  • 旧方法: 一名侦探通过在城市里随机敲每一扇门的方式,逐一寻找一名嫌疑人。
  • PRISM: 一名侦探拥有基于以往案例的“直觉”(先验)。如果直觉很强,他们只会检查嫌疑人可能隐藏的特定街区。如果直觉很弱,他们会回到随机检查房门的模式。
  • 结果: 侦探能更快、更轻松地找到嫌疑人,而且由于知道何时信任直觉、何时忽略直觉,他们永远不会陷入困境。

为什么这很重要

论文声称,你不需要一个庞大、昂贵的超级计算机或一个单独的“专家级”AI 来引导机器人。你可以直接从机器人现有的“世界模型”大脑中提取这种引导能力。这是一种让机器人在规划时变得更聪明,而无需让它们运行起来更沉重或更缓慢的方法。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →