想象一下,你有一个才华横溢的机器人学生,他们曾在完美受控、安静的教室(即“实验室”)里苦读多年。他们在灯火通明、桌面整洁且老师给出精确指令时,非常擅长解决谜题。但一旦你把他们带进一个繁忙、嘈杂的厨房去实际做晚餐,他们就会陷入僵局。他们不知道如何应对摇晃的椅子、湿滑的勺子或移动的地板。
这篇论文介绍了 LingBot-VLA 2.0,这是一个重大的升级,旨在将那个“教室机器人”转变为“厨房就绪型机器人”。作者认为,要让机器人对现实世界有用,我们需要解决三个特定问题:多样性、运动能力和预见性。
以下是他们是如何实现的,通过简单的类比来解释:
1. “超级学生”训练营(泛化能力)
问题: 之前的机器人是在非常具体、有限的数据上进行训练的。这就像是教一个学生只在一条单一、空旷的赛道上开车。他们无法处理不同的车或雨中的路面。
解决方案: 团队建立了一个规模宏大的“训练营”,拥有 60,000 小时 的视频素材。
- 混合构成: 他们不仅仅使用一种类型的机器人。他们收集了来自 20 种不同机器人躯体 的数据(有些只有一个手臂,有些有两个,有些有轮子,有些有腿)。
- 人类触感: 他们还加入了 10,000 小时 从人类视角拍摄的视频(就像戴在头上的 GoPro),展示了人类如何自然地移动双手和身体来完成任务。
- 结果: 通过喂给机器人这种“多样化的饮食”,它学会了成为一名通才。它不再是某个房间里的专才,而是一个能够适应不同机器人躯体和复杂环境的杂家。
2. “全身舞步”(扩展动作空间)
问题: 大多数机器人的训练目标仅限于移动手臂,就像一个人坐在椅子上,双手被固定在桌子上。它们无法转动头部观察四周、扭转腰部、在轮子上滚动或使用灵巧的手指。
解决方案: LingBot-VLA 2.0 学会了控制其全身。
- 类比: 想象一位钢琴家,此前只被允许用手指按键。现在,他还可以站起来,走到钢琴旁,调整凳子,转头阅读乐谱,甚至用脚趾敲击节奏。
- 能力: 新模型可以控制机器人的头部、腰部、移动底座(轮子)以及灵巧的手部。这使得机器人能够处理需要协调能力的复杂工作,比如走近冰箱、打开门并抓取一个瓶子,并完成一连串流畅的动作。
3. “水晶球”(预测动力学)
问题: 旧的机器人只能对它们“当下”看到的东西做出反应。如果一个球开始滚动,它们会等到球撞到它们时才做出反应。它们缺乏“时间推理”能力——即思考“接下来会发生什么”的能力。
解决方案: 团队教会了机器人预测未来。
- 类比: 机器人不再只是看着棋盘移动棋子,而是正在玩一场游戏,在做出移动之前,它必须猜出三步之后棋盘会是什么样子。
- 运作方式: 他们使用了两位“老师”来帮助机器人学习:
- 深度老师: 向机器人展示物体距离有多远(几何结构)。
- 视频老师: 向机器人展示事物随时间变化的规律(因果关系)。
- 结果: 机器人现在可以“想象”场景的未来状态。它知道如果它推一下杯子,杯子会滑动;如果它打开门,门会摆动。这有助于它提前规划,而不是仅仅做出反应。
证明:通过“现实世界考试”
为了测试这些变化是否奏效,研究人员让机器人参加了一系列被称为 GM-100 基准测试 的困难挑战。
- 任务: 这些不是像“拿起一个方块”这样简单的任务,而是复杂的、多步骤的工作,例如“将零食分类放入容器”、“从盘子里捡起玩具骨头”或“从微波炉里取出碗”。
- 结果: LingBot-VLA 2.0 的表现显著优于之前的版本和其他顶尖模型。它不仅完成任务的成功率更高,而且能更好地处理混乱的现实世界变化。它还展示了自己能够处理长序列、复杂的任务(例如从一个房间移动到另一个房间去清理炉灶)而不会迷失方向。
总结
简而言之,LingBot-VLA 2.0 是一个经过升级的机器人大脑,使其变得:
- 更具适应性(经过 20 种不同机器人类型和人类视频的训练)。
- 更具移动性(可以移动全身,而不只是手臂)。
- 更具前瞻性(可以预测世界在接下来的几秒钟内会如何变化)。
该论文声称,这使机器人智能从“实验室成功”迈向了“实际应用”,使它们准备好真正进入我们的家庭和工作场所提供帮助。
技术摘要:LingBot-VLA 2.0
问题陈述
尽管视觉-语言-动作(VLA)基础模型近期取得了显著进展,但实验室基准测试与现实世界机器人部署之间仍存在巨大的差距。目前的 VLA 系统在向实际应用转型时,通常面临三个主要局限性:
- 泛化能力有限: 现有的模型在跨越多样化机器人形态(异构配置)和数据源时经常失败,因为它们通常是在狭窄的任务集或特定的硬件上进行训练的。
- 动作空间受限: 许多系统仅限于标准的双臂操作,缺乏控制全身自由度(DoF)的能力,例如移动底座、腰部、头部和灵巧手,而这些对于复杂的现实世界任务至关重要。
- 时间推理能力薄弱: 当前的模型往往是对即时观测做出反应,而不是预判未来的场景演变和动作后果,这限制了它们在动态环境中的有效性。
方法论
作者提出了 LingBot-VLA 2.0,这是一个改进的 VLA 系统,旨在弥合基础能力与实际部署之间的鸿沟。该方法论侧重于三个功能领域:
1. 大规模、多形态数据策展
为了增强泛化能力,作者重新设计了数据处理流水线,以策展约 60,000 小时 的预训练语料库:
- 机器人数据: 约 50,000 小时的轨迹,涵盖 20 种不同的机器人配置(包括单臂、双臂、半人型和全人型平台),具有变化的自由度(手臂、手部、腰部、移动底座)。
- 第一视角数据: 约 10,000 小时的人类视频。
- 处理流水线: 该流水线采用了严格的过滤机制,包括:
- 质量控制: 丢弃存在轨迹不连续、异常速度/加速度(Jerk)或静态信号(持续时间 >95%)的片段。
- 对齐验证: 使用 URDF 投影和人工标注,确保视频帧与状态信号之间的一致性。
- 第一视角重建: 对于无动作的人类视频,系统使用 SLAM 进行相机位姿估计和手部姿态估计(MANO 参数),以在世界坐标系中重建连续的手部轨迹。
- 统一表示: 使用一个 55 维的规范向量表示,将异构控制(手臂、夹持器、手部、腰部、头部、移动性)统一到一个单一的动作空间中,并对缺失的维度进行填充。
2. 扩展动作空间与架构
该模型进行了扩展,以支持超越标准双臂设置的更广泛动作空间,能够容纳:
- 全身控制: 头部(2D)、腰部(4D)、移动底座(3D)、灵巧手(6D/12D)以及手臂(6D/7D)。
- 混合专家(MoE)架构: 作者在动作专家内部引入了 Token 级、无损的稀疏 MoE。
- 结构: 用一个共享专家(用于通用先验)和多个路由专家(用于专门化建模)的组合,取代了标准的前馈网络(FFN)。
- 路由: 利用基于 Sigmoid 的路由机制(受 DeepSeek-V3 启发),允许 Token 独立激活多个专家,从而避免了 Softmax 引起的竞争。
- 负载均衡: 采用了一种使用路由修正偏差的辅助无损策略,以确保在不向主要目标注入显式负载均衡损失的情况下,实现平衡的专家利用率。
3. 通过双查询蒸馏实现预测动力学
为了提高时间推理能力,该系统通过 双查询蒸馏(Dual-Query Distillation) 框架将未来预测构建为一个代理任务:
- 双查询: 将两个可学习的查询 Qt(当前)和 Qt+T(未来)附加到视觉和文本 Token 上。
- 教师模型:
- LingBot-Depth: 通过为当前和未来帧蒸馏深度表示,提供几何监督。
- DINO-Video: 一个机器人感知视频表示模型(基于 DINOv3 并带有因果时间注意力),提供语义先验和运动感知的视觉特征。
- 目标: 模型被训练去预测当前和未来时间步的深度和视频特征,从而鼓励 VLA 对未来场景演变和动作后果进行推理。
核心贡献
- 数据规模与多样性: 创建了一个 60,000 小时的预训练数据集,涵盖 20 种多样化的机器人形态和第一视角人类视频,并通过一种新型流水线统一了异构数据源。
- 全身动作建模: 通过统一的动作表示,将 VLA 的能力扩展到控制复杂的全身自由度(头部、腰部、移动底座、灵巧手)。
- 架构创新: 实现了一种 Token 级、无损的稀疏 MoE 架构,在高效扩展模型容量的同时,保持了平衡的专家利用率。
- 时间推理: 引入了双查询蒸馏框架,利用深度和视频表示模型来增强模型预测未来状态和进行因果推理的能力。
实验结果
作者在 GM-100 基准测试(9 个双臂操作任务)和两个长程移动操作任务上评估了 LingBot-VLA 2.0。
双臂操作 (GM-100):
- 在 Agilex Cobot Magic 平台上,LingBot-VLA 2.0 实现了 66.2% 的进度得分和 34.4% 的成功率,优于 LingBot-VLA 1.0 (58.2%/30.0%) 和 π0.5 (59.1%/32.2%)。
- 在 Galaxea R1 Pro 平台上,它实现了 34.6% 的进度和 15.6% 的成功率,超过了 π0.5 (27.4%/8.9%)。
- 改进在需要精确物体定位和目标导向执行的任务中最为显著(例如,“检索钥匙扣”达到了 100% 的成功率)。
长程移动操作:
- 在 Astribot S1(冰箱分类)和 Cobot Magic-ARX X5(炉灶清洁)上进行了评估。
- LingBot-VLA 2.0 在域内(in-domain)和分布外(OOD)设置下均一致优于 π0.5。
- 在 OOD 设置(扰动的初始姿态和未见过的物体)中,LingBot-VLA 2.0 在成功率方面保持了明显的优势,展示了完成完整任务轨迹的鲁棒性。
消融实验:
- 动作目标: 相对关节动作明显优于绝对动作(55.0% 对比 33.7% 的成功率)。
- 归一化: MeanStd 归一化取得了最佳结果 (55.0%),优于 MinMax 或 Q01-Q99,因为它保留了相对动作分布的长尾结构。
- 损失函数: L2 损失整体表现最好,但在“挤压番茄酱”等富接触任务中,L1 表现更优。
意义与主张
论文声称,LingBot-VLA 2.0 代表了推动 VLA 基础模型从实验室成功走向现实世界适用性的务实步骤。作者认为,实际的 VLA 系统必须超越单纯的模型和数据规模的扩大,转而解决特定的现实需求:
- 更广泛的形态支持: 处理异构机器人配置。
- 更丰富的动作空间: 实现对全身动力学的控制。
- 预测性理解: 通过强化时间推理来预判动态场景的变化。
实验结果证实,通过联合增强泛化性、动作空间覆盖度和预测动力学建模,可以带来对实际机器人能力的持续提升。这项工作不仅将 LingBot-VLA 2.0 定位为一个模型的改进,更是一个将基础级 VLA 能力与现实世界部署复杂性相对齐的框架。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。