想象一下,你正在教一个机器人执行一项复杂任务,比如堆叠积木或将玩具放入盒子。目前,大多数机器人就像一个在考试中紧张的学生:它们查看指令,思考一刹那,然后立即写下一个答案。如果这个初步猜测稍有偏差,机器人就会失败,考试也就结束了。这被称为“单次推理”,而论文认为,这正是机器人有时显得笨拙或不稳定的主要原因。
这篇论文的作者提出了名为TapSampling的不同方法。他们不是强迫机器人快速做出一次猜测,而是给它一个机会“大声思考”,通过生成许多可能的动作,然后从中挑选最佳的一个。
以下是他们系统的运作方式,分为三个简单部分:
1. “创意生成器”(动作变分自编码器,Action-VAE)
通常,要让机器人尝试不同的动作,你必须让主机器人脑反复运行模拟。这非常缓慢,就像让一位厨师为了看看哪道菜味道最好,而把同一道菜做十遍一样。
作者构建了一种名为**动作变分自编码器(Action-VAE)**的特殊工具。你可以把它想象成一位“创意助手”。
- 首先,主机器人脑提出几个起始动作(就像厨师为餐食提出三个粗略的想法)。
- 动作变分自编码器将这些少数想法压缩成“良好动作”的“蓝图”。
- 基于这个蓝图,它能瞬间生成数十种高质量的新变体,而无需主机器人脑再次承担繁重的计算工作。
- 类比:这就像一位爵士乐手。主机器人演奏几个音符,而动作变分自编码器随即根据这种风格即兴创作出一整段全新的独奏,让你能非常快速地获得许多选项供选择。
2. “进度教练”(任务进度验证器)
现在,机器人拥有一堆 20 或 30 个可能的动作。它如何知道该选哪一个?过去,机器人没有一种方法来“理解”某个动作是否真的有助于完成任务。
作者训练了一个验证器(Verifier),它充当一位进度教练。
- 这位教练不仅查看机器人当前的位置,还会审视机器人即将采取的动作,并问道:“如果你这样做,你会更接近完成任务吗?”
- 这位教练是通过观察专家人类执行任务而训练出来的。它学会了将积木向目标方向移动是“好”的(正向进展),而将其撞离则是“坏”的(负向进展)。
- 类比:想象你在组装家具。验证器就是站在你旁边的那个人,他会说:“如果你现在把那个螺丝拧进去,架子就会稳固。但如果你试图强行把那块部件装在这里,整个东西都会摇晃。”它根据每个动作对完成工作的帮助程度,给每个动作打分。
3. 最终决策
有了“创意生成器”创造众多选项,以及“进度教练”对这些选项进行评分,机器人只需选择得分最高的动作即可。
- 如果一个动作得到负分(教练说“不,那会弄坏它”),机器人就会忽略它。
- 如果一个动作得到很高的正分(教练说“是的,这让我们向前迈进了一步”),机器人就会执行它。
为什么这很重要
该论文在计算机模拟和实验室的真实机器人上测试了这种方法。他们发现,通过使用这种“生成多个,挑选最佳”的策略:
- 机器人变得更加可靠:即使使用相同的训练数据,它们的失败率也降低了。
- 速度很快:由于“创意生成器”效率极高,机器人无需长时间等待就能想出选项。
- 适用于任何机器人:他们无需重新训练主机器人脑;只需像安装配件一样将这个新系统接入即可。
简而言之:TapSampling 阻止机器人仓促地做出单一且可能糟糕的决定。相反,它让机器人头脑风暴出几个选项,咨询一位理解目标的教练,然后自信地选择那个真正能完成任务的动作。
技术摘要:TapSampling
问题陈述
现有的具身控制研究主要集中于通过扩展训练数据和模型规模来提升机器人操作策略的性能。尽管非确定性生成模型(如扩散模型和自回归大型语言模型)已展现出卓越的能力,但其性能根本上受限于单次推理范式。由于这些模型的随机性,相同的环境条件在某些实例中可能产生成功结果,而在其他实例中则导致失败。当前机器人领域的推理时策略通常存在两个主要局限:
- 采样效率或保真度问题:直接从策略模型中重复采样会显著增加推理延迟(数量级增加),而从简单的高斯分布中采样则忽略了动作块(action chunks)维度间的相互关联,导致生成的候选动作偏离真实的动作分布。
- 验证挑战:缺乏能够理解和解释底层机器人动作的现成模型。现有的验证方法通常依赖于手工设计的函数、离线强化学习或偏好学习,这些方法可能缺乏可解释性,或与特定策略架构紧密耦合,限制了其即插即用的适用性。
方法论
作者提出了TapSampling,这是一种即插即用、与策略无关的推理时采样框架,旨在无需进一步微调即可提升通用机器人策略的性能。该框架通过两个主要组件运行:
1. 基于学习后验的高效动作采样
为了解决采样效率与动作质量之间的权衡,TapSampling 引入了一个动作变分自编码器(Action-VAE)。
- 架构:Action-VAE 采用基于 Transformer 的编码器和解码器。
- 过程:
- 从基础策略 π 中采样一小部分初始动作(N)。
- 编码器将这些动作压缩为潜在高斯分布(均值 μ 和对角协方差 σ2)。
- 通过平均初始样本的潜在分布,构建一个混合后验分布。
- 从该压缩后的后验分布中抽取任意数量的新潜在样本,并将其解码为候选动作。
- 优势:该方法捕捉了动作维度块内的相关性,确保生成的候选动作既紧密贴合真实策略分布,又比重复策略采样快得多(约快 5 倍)。
2. 通过任务进度验证实现可解释的动作选择
为了在候选动作中选择最优动作,TapSampling 采用了一个任务进度理解验证器。
- 训练数据构建:验证器利用专家机器人轨迹的内在序列结构进行训练。通过假设任务进度随时间线性增长,作者直接从现有数据集中构建正样本(导致进展的前向动作序列)和负样本(导致退步的反向动作序列),无需额外的人工标注。
- 架构:验证器基于视觉 - 语言 - 动作(VLA)骨干网络(具体为 Qwen2.5-0.5B)。它接收当前状态、任务指令和一个查询动作作为输入,以预测预期的任务进度变化(Δp)。
- 选择机制:预测分数具有明确的语义含义(例如,负分表示阻碍,大正分表示快速进展)。在推理过程中,低于阈值的候选动作会被丢弃,剩余候选动作的分数加权平均值将被计算以生成最终动作。
- 效率:视觉语言模型(VLM)骨干网络每对“观察 - 指令”仅执行一次。隐藏状态在所有候选动作间共享,随后通过轻量级动作头并行评估,从而实现高吞吐量的验证。
主要贡献
- 与策略无关的框架:一种即插即用系统,可在无需额外微调的情况下增强预训练的通用策略。
- 基于学习后验的采样:一种基于 Action-VAE 的策略,将动作编码为压缩分布,从而能够高效生成符合策略分布的多样化、高质量动作候选。
- 任务进度验证:训练验证器以预测底层动作对任务进度的影响,从而实现基于明确语义分数而非黑盒奖励信号的可解释动作选择。
- 实证验证:证明了在多样化的模拟和真实世界环境中性能显著提升。
实验结果
作者在模拟基准测试(CALVIN、LIBERO)和真实世界机器人设置上评估了 TapSampling。
- CALVIN 基准(模拟):TapSampling 提高了多种非确定性策略的平均成功长度:
- Diffusion Policy:从 2.41 提升至 2.58。
- OpenVLA:从 3.30 提升至 3.51。
- VPP:从 4.39 提升至 4.46。
- 在不同任务步骤(1–5)中改进一致,表明长期稳定性更好。
- LIBERO-Long 基准(模拟):应用于 π0.5 策略,该方法将成功率从 96.8% 提升至 98.0%。
- 真实世界实验:使用 Franka Research 3 机械臂,TapSampling 将 π0 策略的平均成功率从 78.3% 提升至 83.3%。值得注意的是,它提高了需要空间对齐和接触感知放置的任务(如堆叠和放置物体)的精度。
- 效率分析:
- 采样:与高斯采样相比,学习后验采样带来的额外延迟可忽略不计(<0.01 秒),同时比重复策略采样快得多。
- 验证:由于采用了批处理评估架构,在评估 16 个候选动作时,TapSampling 的验证延迟比 RoboMonkey(使用 LLaVA-7B)快约 12 倍。
- 保真度:最大均值差异(MMD)分析证实,通过学习后验采样生成的动作比高斯采样生成的动作更紧密地贴合真实策略分布。
意义与主张
该论文提出,将计算资源分配给推理时提供了一条有效且与模型无关的途径,可提升通用机器人策略的可靠性和性能,作为扩展训练数据的一个补充维度。
作者声称,TapSampling 通过以下方式解决了单次推理固有的不稳定性:
- 提供了一种机制来纠正由随机方差引起的失败,而无需重新训练策略。
- 通过理解任务进度的验证器实现可解释的动作选择,而非依赖黑盒评分。
- 通过学习后验采样策略平衡了效率与有效性,既避免了重复策略查询的高延迟,又保持了高动作保真度。
这项工作表明,推理时策略,特别是那些基于任务进度理解的策略,是在复杂真实世界场景中部署鲁棒机器人操作系统的可行且必要的方向。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。