PACT-WAM: Predicting Actions and Visual Foresight with Compact Temporal Encoding for Robot Manipulation
PACT-WAM 是一种紧凑的世界动作模型,它通过分层时间编码和条件流采样,高效地预测 16 步动作轨迹及相应的多视图视觉预测,在机器人操控任务中实现了高成功率,同时支持基于视觉-语言的提议审查以进一步提升性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
技术摘要:PACT-WAM
问题陈述
机器人操控策略需要两种形式的时间信息:历史信息(history),用于为运动和先前的交互提供上下文;以及视觉预见(visual foresight),用于预测状态变化并评估拟议的操作。虽然世界-动作模型(World-Action Models, WAMs)能有效地连接历史、动作与未来观测,但它们面临着显著的计算瓶颈。密集表示的历史和未来观测会产生高昂的处理成本;例如,编码 16 帧历史图像(每帧 64 个 token)需要每视图 1,024 个 token;而多步预测则会增加额外的视觉潜变量序列。现有方法通常孤立地解决这些挑战——要么压缩历史,要么使用带有独立控制器的模块化视觉预见,或者在推理阶段省略未来生成。核心挑战在于设计一种既能保持历史覆盖范围,又能提供每个转换点处独立可解码状态的紧凑表示,同时建立一套协议,利用这些预见来指导执行,且不会产生过高的计算开销。
方法论:PACT-WAM
作者提出了 PACT-WAM(通过紧凑时间编码进行动作预测与视觉预见),这是一种世界-动作模型,通过条件流采样(conditional flow sampling)共同生成 16 步动作轨迹及其在时间上对应的多视图视觉预测。该架构依赖于三个关键设计选择:
1. 层级化历史编码
PACT-WAM 没有采用均匀编码,而是采用了基于近时性的历史分配(recency-based history allocation)。它为较旧的观测分配粗粒度的空间表示,为较新的观测分配细粒度的表示。
- 机制: 使用冻结的 DINOv3 ViT-B/16 骨干网络,模型处理 16 帧历史记录。最旧的 8 帧被压缩为每视图 4 个 token,中间的 6 帧为 16 个 token,最新的 2 帧为 64 个 token。
- 效率: 这使得模型仅使用 256 个 token 每视图即可保留所有 16 帧观测,相比密集编码(1,024 个 token)实现了 75% 的缩减,同时保持了高水平的时间覆盖。
- 集成: 这些压缩后的特征被合并并投影到 Qwen3-VL-4B 语言模型中,与任务指令一起形成共享上下文 。
2. 联合动作-视觉流生成
PACT-WAM 利用具有**逐转换因果注意力(transition-wise causal attention)**的共享流变换器(flow transformer),共同更新连续动作和视觉状态。
- 视觉潜变量: 未来图像由连续的 TiTok-VAE 潜变量(每幅图像 个位置)表示,且不进行时间下采样。这确保了每一个动作都与一个可独立解码的后续视觉状态相匹配。
- 共享骨干网络: 变换器接收噪声动作和视觉状态、流时间嵌入以及固定上下文。它使用块因果掩码(block-causal mask),其中第 块(代表第 个转换)中的查询可以关注所有属于 块的位置。
- 双头结构: 两个模态特定的速度头(动作速度头 和视觉速度头 )分别在归一化空间内预测速度。在采样过程中,由于它们对允许的时间前缀内的噪声状态具有共享依赖性,两种模态会进行信息交换。
- 训练: 模型使用条件流匹配(conditional flow matching)进行训练,采用线性路径速度回归目标,优化压缩分支、上下文路径、流变换器和输出头,同时保持 DINOv3 和 TiTok-VAE 编码器/解码器处于冻结状态。
3. 提议评审 (Proposal Review, PR)
为了指导执行,PACT-WAM 引入了一个使用视觉语言模型(VLM)的提议评审机制。
- 流程: 四个并行的 VLM 请求分别评估在第 4、8、12 和 16 步时的嵌套预测前缀。它们评估任务一致性的进展并检测可见的失败(如对准偏差、碰撞)。
- 执行逻辑: 控制器选择在任何报告的否决(veto)之前,连续获得批准的最大前缀。如果提议被拒绝,系统会在限定预算内进行联合重采样(最多三次尝试)。如果所有尝试均失败,则终止该回合(episode)。
核心贡献
- 基于近时性的历史分配: 本文提出了一种通过优先考虑近期帧来分配 256 个 token 每视图的策略。在 LIBERO 基准测试中,该策略的表现优于相同 16 帧的均匀编码(98.6% 对比 87.5% 成功率),并以 75% 更少的历史 token 达到了与密集编码(98.0%)相当的性能。
- 在紧凑潜空间中的联合生成: PACT-WAM 在紧凑的单图潜空间中共同生成动作轨迹和视觉状态,为每个物理转换提供可独立解码的预测。这使得通过验证嵌套前缀来执行 Proposal Review 成为可能,并在集成紧凑历史编码和提议评审的基础上,扩展了统一的世界-动作框架。
- 具备测试时增强性能: 基础策略在仿真和现实世界基准测试中均取得了较高的成功率。加入 Proposal Review 后,通过提升鲁棒性实现了测试时的显著性能提升,而无需重新训练核心策略。
实验结果
模型在 LIBERO、RoboTwin 2.0 以及真实的 AgileX Piper 平台上进行了评估。
- LIBERO (仿真环境):
- 无 PR 时:平均成功率 98.6%。
- 有 PR 时:平均成功率 99.5%(在 Object 和 Goal 子任务中达到 100%)。
- RoboTwin 2.0 (仿真环境):
- 无 PR 时:50 项双臂任务的平均成功率为 92.3%。
- 有 PR 时:平均成功率为 93.4%。
- 真实世界 Piper 机器人:
- 无 PR 时:在 Sorting、Handover 和 Cleanup 任务中的平均成功率为 78.0%。
- 有 PR 时:平均成功率为 86.7%。
- 消融实验:
- 历史 (History): 8:6:2 的 token 层级结构在效率和成功率方面显著优于均匀编码和密集编码。
- 联合生成 (Joint Generation): 联合训练动作和视觉比仅动作(93.6%)或仅视觉辅助(96.4%)变体能提高更高的控制成功率(98.6%)。
- 视觉容量 (Visual Capacity): 将潜变量容量从 增加到 会提高预测保真度(PSNR, SSIM),但会略微降低控制成功率(97.3% 对比 98.6%),这表明存在一个平衡性能与计算成本的权衡,默认的 达到了较好的平衡。
- 提议评审 (Proposal Review): PR 有效地过滤掉了失败的轨迹;与仅使用当前观测相比,通过预测预览可以减少错误拒绝率。
意义与主张
本文声称 PACT-WAM 成功解决了表示成本与执行决策所需的视觉预见可用性之间的权衡。通过将层级化历史编码与紧凑且可解码的视觉潜变量相结合,该模型实现了对时间配对的动作和预测进行联合采样。这种架构允许使用 Proposal Review 协议,通过验证嵌套前缀来指导执行,从而增强了在复杂操控任务中的鲁棒性。
作者强调,其方法在大幅减少历史所需 token 数量的同时,保留了对于动作选择至关重要的时间信息。他们指出,虽然基础策略已具竞争力,但将视觉预见与基于 VLM 的评审机制相结合,为提高复杂操控任务的可靠性提供了一条独特的路径。这项工作凸显了较高的预测保真度并不总是与更高的控制成功率相关联,这表明对于决策而言,预测的**效用(utility)**比原始重建质量更为关键。
作者注明的局限性: 当前系统使用固定的基于近时性的分配方式,无法根据任务相关性进行调整;采用固定的 16 步时界(horizon);且评审过程可能会错过检查点之间的短暂失败。未来的工作建议探索任务自适应压缩和可变时界的生成。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。