想象一下,你正在试图教一只机械手完成一项精细的任务,比如转动螺丝刀或弹射硬币。问题在于,现实世界是混乱且多变的。螺丝刀可能会很滑,阀门可能会生锈,或者水桶的形状可能与预期不符。如果机器人不知道这些细节,它可能会用对付普通螺丝钉的力量去转动一个光滑的螺丝,导致工具掉落。
这篇论文介绍了一种名为 PLUME(概率隐变量统一世界建模与参数估计)的新方法。你可以将 PLUME 理解为一个不仅是在“背诵”动作,而是在学习如何在玩游戏的过程中猜出隐藏的游戏规则的机器人。
以下是它的工作原理,通过简单的概念进行拆解:
1. “神秘盒子”问题
在现实世界中,机器人无法看到一切。它看不见表面的“摩擦力”,也看不见它手中物体的精确“形状”。这些都是隐藏变量。
- 旧方法: 传统的机器人试图学习一种“一劳永逸”的策略。这就像是通过只在干燥路面上练习开车,然后期望在遇到冰面、雨天和碎石路时也能不改变驾驶风格地应对。
- PLUME 的方式: PLUME 承认自己并不知道确切的情况。相反,它维持着一种**“信念”**——即关于当前隐藏规则的一套猜测。
2. “水晶球”与“赌徒”
PLUME 使用了一个巧妙的两步过程,就像是一个水晶球和一个赌徒在协同工作:
- 水晶球(参数估计): 当机器人移动时,它会观察发生了什么(例如:“我尝试转动螺丝,但它稍微滑动了一下”)。它利用这一点来更新它对隐藏参数的“信念”。这就像侦探更新嫌疑人名单一样:“好吧,摩擦力一定很低,而且螺丝可能很松。”
- 赌徒(规划): 一旦机器人对隐藏规则有了更好的猜测,它不会立即行动。它会在脑海中运行数千个“如果……会怎样”的情景(模拟)。它会问自己:“如果摩擦力很低,如果我抓紧一点会发生什么?如果物体很重,如果我抬得快一点会发生什么?”
3. “计分卡”
在运行完这些脑内模拟后,机器人会对每条潜在路径进行评分。它不仅仅寻找能带来最高回报(如“螺丝转动了!”)的路径,还会检查其可能性。
- 类比: 想象一个在赛马中下注的赌徒。一个天真的赌徒会把赌注押在“可能”获胜的马身上。而一个聪明的赌徒会把赌注押在那些“极有可能”获胜,且“确实有能力”跑那么快的马身上。
- PLUME 会拒绝那些在理论上看起来很好,但在其当前对世界的“信念”下在物理上是不可能的计划。这防止了机器人尝试危险或不可能的动作。
4. 从“混合数据”中学习
通常,机器人需要完美的数据来进行学习。如果机器人在视频中掉落了螺丝刀,这些数据通常会被丢弃。
- PLUME 的超能力: 它能从“混合包”的数据中学习,包括失败的数据。因为它不断更新关于“为什么失败”的“信念”(例如:“啊,我掉落是因为我以为摩擦力很高,但实际上摩擦力很低”),所以它可以利用失败的数据来学习更好的规则。它将失败的尝试视为线索,而非垃圾。
5. 结果:从模拟到现实
研究人员在几个棘手的任务上测试了 PLUME:
- 转动螺丝刀(在计算机模拟和真实机器人上)。
- 转动阀门。
- 将圆盘弹射过桌面。
- 提着一个把手复杂的桶。
结果:
PLUME 能够将完全在计算机模拟中训练的策略应用到真实机器人上,而无需任何额外的调优(这被称为“零样本迁移”)。它的表现显著优于其他最先进的方法。
- 在真实的螺丝刀任务中,PL \UME 的成功率达到了 93%,而排名第二的方法仅为 86%。
- 它在避免灾难性失败(如掉落螺丝刀)方面表现得好得多。
总结
简而言之,PLUME 是一个会说“我不知道这个物体的确切物理特性,但我可以在移动过程中猜出它们”的机器人大脑。它利用这些猜测来模拟数千条未来的路径,并选择一条既有回报又符合物理现实的路径。这使得它能够比那些试图遵循僵化、预设脚本的机器人更好地处理现实世界中混乱且不可预测的本质。
技术摘要:PLUME
问题陈述
灵巧的多指操纵对物理参数(如物体形状、姿态和摩擦系数)高度敏感。这些参数在部署时往往是不确定的,导致系统动力学未知。虽然仿真允许通过已知参数进行大规模数据收集,但通过标准领域随机化(domain randomization)训练的策略往往无法泛化到精确任务(例如转动螺丝刀),因为最优操纵策略可能会根据特定的参数值而发生变化。此外,收集复杂多指任务的高质量数据具有挑战性,往往会导致包含次优轨迹或失败案例的异构数据集。现有的世界模型方法通常依赖于固定时界的历史记录来隐式处理动力学变化,这对于对这类变化敏感的精确任务而言是不够的。此外,离线强化学习方法通常并不关注系统辨识与策略学习的联合问题,而在线系统辨识方法则往往需要复杂的奖励工程,且不支持规划。
方法论
作者提出了 PLUME(概率潜在统一世界模型与参数估计,Probabilistic Latent Unified world Modeling and parameter Estimation),这是一个联合学习世界模型并估计潜在物理参数信念的框架。
核心架构
PLUME 由三个端到端训练的主要组件组成:
- 参数表示学习: 一个带有 Transformer 主干的 Wasserstein 自编码器(WAE)学习异构变量(包括物理参数如摩擦力、形状以及奖励)的统一潜在表示(zt)。编码器对这些输入进行标记化(tokenization),并使用交叉注意力池化(cross-attention pooling)生成潜在嵌入。通过施加标准正态先验,以促进参数信念的合理初始化。
- 历史建模: 一个 Mamba-2 编码器将轨迹历史(过去的动作和观测)压缩为上下文向量(ct),保留了简单的马尔可夫假设可能会丢失的有用历史上下文,尤其是在存在噪声观测或有限粒子数的情况下。
- 联合流匹配(Joint Flow Matching): 一个流匹配模型作为统一的世界模型。它学习估计潜在参数,并基于这些参数对系统动力学进行建模。该模型使用 Transformer 主干和一个辅助掩码来处理不同的条件分布:
- 参数估计: p(Zt+1∣Zt,yt,ut+1,yt+1,ct)
- 展开生成(Rollout Generation): p(ut+1,yt+1,Zt+1∣Zt,yt,ct)
- 逆动力学: p(ut+1∣Zt,yt,Zt+1,yt+1,ct)
训练与推理
- 训练: 该模型在包含不同参数值的轨迹离线数据集上进行训练。损失函数结合了参数重构损失、用于将潜在空间与标准正态分布对齐的极大均值差异(MMD)正则化,以及流匹配损失。至关重要的是,来自流匹配损失的梯度不会反向传播到参数编码器,以防止模型为了优化自身目标而牺牲表示能力。
- 规划(部署): 在部署时,PLUME 维护一个由粒子集(Zt)表示的潜在参数信念。它采用一种后退时界(receding-horizon)轨迹采样方法:
- 展开(Rollout): 模型根据当前的观测、历史和粒子信念,自回归地采样多条轨迹。
- 评分(Scoring): 轨迹根据解码后的奖励和估计的转移似然度进行评分。似然度通过逆动力学模型进行估计;低似然度会惩罚那些表现出不真实动力学的高奖励轨迹(即离群检测/Out-of-Distribution detection)。
- 执行与更新: 执行得分最高的轨迹的第一步动作。随后利用新的观测值在线更新潜在信念,使世界模型能够适应真实的动力学,而无需重新训练或微调。
核心贡献
- 统一流匹配世界模型: 一个通过估计系统参数来调节其世界模型展开过程的模型,从而使单一策略能够适应变化的动力学。
- 端到端潜在表示: 一种学习定性不同参数(摩擦力、形状)和奖励的统一潜在空间的方法,并与世界模型联合优化,以使其对动力学学习有用。
- 似然加权规划: 一种利用世界模型展开和估计的转移似然度来优化机器人动作的规划策略,有效地过滤掉不切实际的高奖励计划。
实验结果
作者在四个仿真任务(转动螺丝刀、转动阀门、弹拨圆盘、提桶)和一个硬件任务(转动螺丝刀)上评估了 PLUME。
- 基准模型: 与统一世界模型(UWM)、流 Q 学习(FQL)和决策扩散器(Decision Diffuser, DD)进行了对比。
- 性能表现:
- 仿真螺丝刀任务: PLUME 实现了 81.3% 的有效率,显著优于 UWM (70.7%)、FQL (21.3%) 和 DD (19.3%)。与表现最好的基准模型相比,它还将目标距离缩减了 31%。
- 硬件螺丝刀任务: PLUME 实现了 93.3% 的有效率(30 次试验中 28 次成功),实现了从仿真的零样本迁移(zero-shot transfer),优于 UWM (86.7%)。
- 其他任务: PLUME 在转动阀门和弹拨圆盘任务中显著优于所有基准模型(以目标距离衡量),并且是唯一能持续成功完成 DexArt 提桶任务的方法。
- 消融实验: 文中指出,PLUME 能够对部分可观测状态变量(位置、速度、朝向)以及物理参数进行推理,这有助于其成功,这一点从准确的奖励估计中得到了证实。
意义与主张
论文声称,对于精确且敏感的多指操纵任务,显式地估计并以系统参数的表示为条件,比学习参数无关策略或隐式建模变化的方法具有更优越的性能。
主要主张包括:
- 零样本迁移: PLUME 可以将仿真训练的策略部署到硬件任务(转动螺丝刀)中,无需微调,通过在线参数推理来适应真实的动力学。
- 对数据质量的鲁棒性: 该方法可以从包含次优轨迹和失败案例的异构数据集中学习有用的模型,利用奖励标签将失败数据用于动力学学习,同时通过规划避免产生问题动作。
- 适应性: 与需要重新训练或微调的方法不同,PLUME 通过在部署时更新其参数信念来使其世界模型与真实动力学对齐,从而使单一模型能够处理多种物理条件。
作者承认存在局限性,特别是训练期间需要地面真值(ground-truth)参数值(在仿真中可用,但在现实世界中并不总是可用),以及 Transformer 随粒子数量增加而产生的二次方内存缩放问题。他们建议未来的工作可以包括在现实世界数据上微调预训练模型,以便在不需要地面真值标签的情况下对齐先验。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。