想象一下,一只装有机械手的机器人手臂正试图从桌子上拿起一个咖啡杯。问题在于,机器人的视觉并不完美,它既不知道杯子有多滑,也不知道桌子表面有多软。这就像在黑暗中戴着厚手套去抓一块湿肥皂一样。
大多数机器人试图通过计算“平均”场景来解决这个问题:“如果肥皂通常这么滑,我就用这么大的力去抓。”但这很冒险。如果肥皂恰好格外滑(这是一种罕见的“尾部”事件),平均计划就会失败,机器人就会掉落杯子。
本文介绍了一种让机器人思考这些风险的新方法,称为变分神经信念(Variational Neural Belief, VNB)。以下是其工作原理,分解为简单的概念:
1. 旧方法:“猜谜游戏”(粒子滤波)
想象机器人试图通过在纸上画 100 个小点来猜测杯子的位置和滑度。每个点代表一种可能的现实(例如,“也许杯子在这里”,“也许在那里”,“也许非常滑”)。
- 问题:为了做出决定,机器人必须查看所有 100 个点,挑选出最好的点,然后重新绘制它们。这既缓慢又“笨拙”。因为这些点是离散的(你不能拥有半个点),机器人无法使用平滑的数学方法来计算如何改进其计划。这就像试图通过只看像素网格而不是平滑的道路来驾驶汽车。
2. 新方法:“平滑云”(变分神经信念)
作者教导机器人不再绘制 100 个分离的点,而是想象一个平滑、连续的可能性云团。
- 类比:将旧方法想象成一桶弹珠。如果你想移动这桶弹珠,你必须一颗一颗地移动每一颗弹珠。而新方法则像一团雾气。你可以平滑且瞬间地拉伸、缩小或移动整个云团。
- 为何有效:因为这个“云团”在数学上是平滑的,机器人可以使用强大的计算器(梯度下降)来瞬间精确计算出如何调整其手指,以使云团更安全。这就像拥有一个不仅向你显示路线,还能在你遇到坑洼之前就告诉你如何转向以避免它的 GPS。
3. 关注最坏情况(风险敏感规划)
大多数机器人只为“平均”结果做计划。本文教导机器人在该云团内为最坏情况的结果做计划。
- 隐喻:想象你在为旅行打包行李。一个“平均”规划者因为晴天最可能而只为晴天打包。而一个“风险敏感”规划者(如本文中的那个)查看天气预报后说:“虽然发生飓风的可能性很小,但即使可能性不大,我也需要带上雨衣和雨伞以防万一。”
- 机器人专门查看其概率云团的“尾部”——那些物体可能滑落的罕见且危险的场景——并优化其抓握方式,以在这些特定的糟糕日子里生存下来。
4. 边做边学(神经信念动力学)
机器人并非只猜测一次,而是在接触物体时进行学习。
- 工作原理:当机器人的手指接触物体时,它会获得新数据(触觉传感器)。机器人不是更新静态地图,而是使用“神经网络”(一种人工智能大脑)来瞬间更新其“可能性云团”。
- 结果:如果机器人感觉到物体很滑,云团会立即偏移以反映“高滑移风险”,机器人会立即收紧抓握。这比旧的“弹珠”方法快得多。
他们的发现(结果)
作者在真实的机器人手臂和高保真计算机模拟中测试了这种方法。
- 速度:新方法比旧的“弹珠”方法快约10 倍。
- 成功率:当他们用突然的力(如猛推)推动物体,或改变物体的滑度时,新方法能更好地保持抓握。
- 准确性:机器人关于失败可能性的“猜测”要准确得多。旧方法经常认为自己是安全的,其实不然;或者认为自己注定失败,其实安然无恙。新方法保持了一个非常准确的“风险计”。
总结
简而言之,本文为机器人提供了一种更好的“想象”未来的方法。它们不再用 handful 粗糙的点来猜测,而是使用一个平滑的数学云团,使它们能够瞬间计算出抓取物体的最安全方式,即使该物体可能很滑、很重或处于奇怪的位置。这使得机器人掉落物品的可能性降低,并且能更快地弄清楚如何握住它们。
以下是论文《多模态不确定性下鲁棒灵巧抓取的变分神经信念参数化》的详细技术总结。
1. 问题陈述
本文解决了在显著不确定性下进行灵巧机器人抓取的挑战。具体而言,一个拥有多指手的机器人必须抓取一个位姿未知且接触属性(摩擦系数、表面顺应性、接触模式)不确定的物体。
- 核心挑战: 传统的抓取规划器通常优化期望质量,而忽略了“尾部结果”(罕见但灾难性的失败)。如果真实的物理参数位于其概率分布的尾部,那么一个“期望”的抓取可能会灾难性地失败。
- 现有方法的局限性:
- 分析/数据驱动方法: 通常忽略不确定性,或仅优化平均性能。
- 粒子滤波(PF)信念: 虽然它们能处理多模态不确定性,但存在以下缺陷:
- 可扩展性差且计算成本高。
- 离散的随机性(重采样)阻碍了路径梯度传播,使其无法与高效的基于梯度的优化兼容。
- 在估计尾部风险(如条件风险价值 CVaR)时,近似值具有高方差。
2. 方法论:变分神经信念(VNB)
作者提出了一个框架,将抓取获取建模为在连续、可微信念空间上的**风险敏感模型预测控制(MPC)**问题。
A. 可微高斯混合信念
作者不使用离散粒子,而是将潜在状态(物体位姿 ξo 和接触参数 ψ)的信念表示为高斯混合模型(GMM)。
- 重参数化: 为了实现基于梯度的优化,作者使用了两种技术:
- Gumbel-Softmax: 对用于选择混合分量的分类分布进行松弛,使分量选择变得可微。
- 位置 - 尺度重参数化: 样本生成形式为 θ=μ+σ⊙ϵ,其中 ϵ 是标准噪声。
- 结果: 信念样本成为信念参数(ϕ)的平滑、可微函数,允许梯度直接从成本函数流向信念分布。
B. 神经信念动力学
系统使用神经网络而非手工设计的物理模型来学习信念更新过程:
- 预测网络(ftrans): 根据先前状态和动作更新潜在嵌入。
- 校正网络(fobs): 利用观测值(触觉力、关节编码器和视觉位姿估计)校正预测。
- 解码器: 将潜在嵌入映射回 GMM 参数(πk,μk,σk)。
C. 通过平滑 CVaR 进行风险敏感优化
目标是最小化抓取成本的条件风险价值(CVaR),即对最差的 (1−β) 部分结果取平均值。
- 平滑代理: 作者使用SoftPlus近似铰链函数,构建可微的 CVaR 估计器。
- 路径梯度: 由于信念经过重参数化,CVaR 目标关于控制动作的梯度可以通过反向传播直接计算,避免了粒子滤波中使用的基于采样的梯度估计器的高方差。
- 复合目标: MPC 最小化以下各项的加权和:
- 抓取成本的 CVaR: 鼓励对最坏情况接触场景的鲁棒性。
- 期望成本: 确保平均性能。
- 视觉感知成本: 惩罚不确定的视觉状态。
- 信念熵: 鼓励收集信息的动作以减少不确定性。
D. 每分量动作优化
由于信念是多模态的(表示关于接触/位姿的不同假设),控制器独立优化每个混合分量的动作,并选择风险感知成本最低的动作。这使得机器人能够对冲位姿模糊性(例如,移动手指以区分两个可能的物体位置)。
3. 主要贡献
- 可微 GMM 信念: 一种连续的信念表示,支持所有分布参数的路径梯度,填补了粒子滤波留下的优化空白。
- 平滑 CVaR 代理: 一种可微的风险度量,无需重采样即可实现对尾部鲁棒性的直接基于梯度的优化。
- 神经信念动力学: 学习的转换和观测模型,以完全可微的方式更新信念。
- 风险感知 MPC 框架: 一个规划器,显式地对整个后验分布进行推理,以选择在不确定性下最大化力封闭的手指运动。
4. 实验结果
仿真(MuJoCo)
- 设置: 在具有 11 自由度手的 6 自由度机械臂上进行了测试,涵盖三种摩擦机制:标称、宽(高不确定性)和双模态(多模态摩擦)。
- 性能:
- 鲁棒性: 在鲁棒成功率(承受高达 12N 的横向剪切力)方面,VNB 显著优于基线方法(粒子滤波、高斯 MPC、交叉熵方法)。
- 效率: 与粒子滤波 MPC 相比,VNB 将规划时间减少了约一个数量级。
- 校准: VNB 实现了**< 0.14** 的平均绝对校准误差(MACE),显著优于交叉熵方法(0.58),意味着机器人预测的失败概率与实际失败率高度吻合。
硬件实验
- 设置: 在配备 RealHand L6(压阻式触觉传感器)和双 RGB-D 相机的 FAIR Innovation FR3 机械臂上进行真实世界测试。
- 协议: 在具有 4 个不同偏移量的物体位姿不确定性下进行测试。
- 结果:
- VNB 和高斯基线在测试集中均达到了 100% 的成功率。
- 效率: VNB 收敛更快(中位数 6 步 vs. 高斯的 7 步),且运行时方差更低。
- 质量: VNB 实现了更高的终端触觉抓取质量(ϵ^T),且方差更低。
- 鲁棒性: 在仿真压力测试中,当基线方法(如 CEM)失败并掉落物体时,VNB 在扰动下仍保持了力封闭。
5. 意义
这项工作弥合了概率机器人学与可微优化之间的差距。通过将离散粒子滤波替换为连续的变分神经信念,作者使得高效的基于梯度的优化器能够用于风险敏感控制。
- 安全性: 显式优化尾部风险(CVaR)的能力确保了机器人不会选择那些“平均表现良好”但在不利条件下容易发生灾难性失败的抓取。
- 效率: 该方法比基于粒子滤波的方法快得多,使得实时、风险感知的灵巧操作成为可能。
- 校准: 该框架产生校准良好的不确定性估计,使机器人能够准确评估自身的失败风险,这是安全的人机交互和在非结构化环境中自主运行的关键能力。
每周获取最佳 electrical engineering 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。