✨ 要点🔬 技术摘要
想象一下,你建造了一个机器人,它在阅读指令和观察图片方面极其聪明。它知道什么是“杯子”,明白“倾倒”的含义,并能流利地谈论这些。这就像一个拥有理论博士学位却缺乏现实世界经验的机器人。如果你让它去接住传送带上移动的球,或者在不弄碎的情况下拧下灯泡,它可能会僵住,因为它不理解运动 、记忆 或触觉 。
这篇论文介绍了RLDX-1 ,一种旨在解决这一问题的新型机器人“大脑”。不妨将 RLDX-1 不仅仅视为一个聪明的阅读者,而是一位大师级工匠 ,它将三种新的超能力与其现有的智能相结合:
1. 超能力:运动、记忆与触觉
运动感知(“杂耍者”): 大多数机器人看着静止的照片猜测下一步该做什么。但现实世界是动态的。如果一个盒子在传送带上滑动,静态照片就毫无用处。RLDX-1 就像一个杂耍者,它不仅仅盯着球看,而是观察球在空中飞行的整个视频 。它理解速度和方向,使其能够接住其他机器人会错过的移动物体。
长期记忆(“夏洛克·福尔摩斯”): 有些任务需要时间。想象一个三杯猜球游戏,人类将立方体藏在三个杯子中的一个下面,走开后让机器人寻找。只有“短期记忆”的机器人能看到杯子,却忘记了人类触碰了哪一个。RLDX-1 会保留过去几秒或几分钟发生事件的“笔记本”。它记得事件序列,使其能够解决需要回顾过去的谜题。
物理感知(“温柔之手”): 视觉很棒,但你无法看到插座内部,也无法感觉到你捏易碎鸡蛋的力度。RLDX-1 可以通过其传感器“感觉”。它能读取关节中的扭矩 (扭转力)以及皮肤传来的触觉 信号。这就像一个蒙着眼睛的人,能确切地知道插头何时完全插入插座,或鸡蛋何时即将破裂,并瞬间调整抓握力度。
2. 训练:它是如何学习的
你不能仅仅通过给机器人看几段视频就教会它这些技能。RLDX-1 经历了三阶段训练营 :
第一阶段:通才(预训练): 它观看了数百万段不同机器人(机械臂、机械手、人形机器人)做简单事情的视频。这让它对世界如何运作有了广泛的理解。
第二阶段:专才(中期训练): 在这里,它学习了新的超能力。它专门针对“运动”、“记忆”和“触觉”模块进行练习。为此,研究人员使用了一个巧妙的技巧:他们利用AI 视频生成器 创建数千种新的罕见场景(例如,在一个不存在的厨房里,机器人正在倒汤),然后利用数学计算出机器人应该 做什么。这填补了现实世界数据缺失的空白。
第三阶段:精修(后期训练): 最后,它在特定的现实世界任务中进行练习,从自己的错误中学习。如果它没能拿起杯子,它会再试一次,使用一种强化学习方法,这种方法就像教练提供即时反馈以改善其表现。
3. 速度:在快车道上运行
即使是最聪明的大脑,如果太慢也是无用的。如果机器人思考需要 0.1 秒,等到它行动时,世界可能已经改变了。论文指出,RLDX-1 经过优化,运行速度比标准系统快 1.6 倍 。
类比: 想象一位送货司机,他在每一个红绿灯前都停下来查看地图(标准处理)。RLDX-1 则像是一位已经预先规划好整个路线、确切知道哪些灯会变绿、并能不停车直接穿过的司机。这使其能够在实时中做出反应,即使在高速移动的装配线上也是如此。
4. 结果:事实胜于雄辩
研究人员通过两种方式将 RLDX-1 与其他顶级机器人大脑(如 π 0.5 \pi0.5 π 0.5 和 GR00T N1.6)进行了测试:
在模拟中(电子游戏): RLDX-1 在复杂的厨房任务和移动物体挑战中 consistently 击败了其他对手。
在现实世界中(测试):
传送带: 当物体快速移动时,RLDX-1 的成功率为87.5% ,而表现第二好的机器人失败率接近 70%。
三杯猜球游戏: 当被要求根据记忆寻找隐藏物体时,RLDX-1 的正确率为91.7% 。其他机器人随机猜测,正确率仅为 30% 左右。
灯泡: 当被要求拧动灯泡直到它亮起时,RLDX-1 学会完成该任务所需的尝试次数,比人类教练演示的次数还要少。
总结
RLDX-1 是一种机器人策略,它超越了单纯的“看见和理解”,转向灵巧地行动 。通过将强大的视觉大脑与针对运动 、记忆 和触觉 的专用模块相结合,并在现实世界与 AI 生成数据的巨大混合体上进行训练,它在以往机器人难以应对的复杂、动态和精细任务中实现了类人的技能。这是迈向机器人真正能够在混乱、移动且充满触觉的现实世界中与我们并肩工作的重要一步。
技术摘要:RLDX-1
问题陈述
尽管视觉 - 语言 - 动作模型(VLAs)在“通用智能”方面取得了显著进展——即理解多样化视觉场景、遵循语言指令以及在任务间泛化的能力——但它们往往难以应对需要更广泛功能能力的复杂现实世界操作任务。具体而言,现有的 VLA 缺乏明确的运动感知 机制(在包含移动物体的动态环境中执行动作)、长期记忆 机制(在短期帧之外的扩展交互历史中进行推理)以及物理感知 机制(在遮挡或细微视觉变化下推断接触力和力矩)。这些局限性阻碍了通用机器人在动态、接触丰富且长视野场景中的部署。
方法论
作者引入了RLDX-1 ,这是一种专为类人灵巧操作设计的通用机器人策略。该系统将多样化的功能能力整合到一个涵盖架构、数据、训练和推理的统一框架中。
1. 神经架构:多流动作 Transformer(MSAT)
RLDX-1 基于流匹配 VLA 架构构建,但通过三个关键功能模块和一个新颖的 Transformer 设计对其进行了扩展:
运动感知 :视觉 - 语言模型(VLM)主干网络通过运动模块 进行增强,该模块将时空自相似性(STSS)整合到视觉编码器中以捕捉时间动态。此外,过去的视频帧被压缩为单个上下文令牌,以高效地建模时间上下文。
长期记忆 :一个明确的记忆模块 维护过去认知特征的队列,使模型能够针对长期观察历史进行推理(例如用于猜盒游戏或多步骤任务)。
物理感知 :专用的物理流 独立于视觉和语言输入处理物理信号(力矩和触觉数据)。该流与动作一起预测未来的物理信号,鼓励模型内化接触动力学。
MSAT 架构 :为了处理这些异构模态,作者提出了多流动作 Transformer。它为认知(视觉/语言)、动作(本体感觉/含噪动作)和物理(触觉/力矩)分配了专用流。这些流通过联合自注意力进行交互,同时保持模态特定的参数,从而在交换跨模态信息的同时不失表示保真度。
2. 训练数据与流程
训练策略依赖于三阶段流程和多样化的数据混合:
数据源 :模型在以下数据的组合上进行训练:(a) 大规模公开真实世界数据集(Open-X-Embodiment、DROID、Galaxea、Agibot World 等),(b) 来自 ALLEX 人形机器人和传感器增强型 Franka Research 3(FR3)平台的内部数据,以及 (c) 合成数据 。
合成数据生成 :为解决罕见灵巧场景的数据稀缺问题,作者采用了一条利用视频生成模型(图像到视频)来增强场景和任务的流水线。随后通过逆动力学模型(IDM)进行动作标注,并经过严格的两个阶段过滤过程:视频质量过滤 (使用 VLM)和运动一致性过滤 (将模拟器 rollout 与生成的视频进行比较)。
三阶段训练 :
预训练 :在多样化的多具身数据上进行训练,以学习通用操作先验。
中期训练 :在特定具身数据(ALLEX 和 FR3)上进行专门训练,利用内部数据和合成数据注入功能能力(运动、记忆、物理)。
后训练 :针对特定任务进行微调,可选地利用基于 VLM 导出的评论家(RECAP 框架)的强化学习(RL)来增强在挑战性任务上的性能。
3. 推理优化
为了在真实机器人上实现实时控制,作者实施了一个两阶段推理优化流水线:
图捕获优化 :将模型转换为静态 CUDA 图,以消除内核启动开销和图碎片化。
内核优化 :设计自定义融合内核(例如融合 RMSNorm、RoPE 和注意力机制),以减少内存流量并提高短预填充工作负载上的执行效率。 这些优化将 NVIDIA RTX 5090 上的每步延迟从约 71.2 毫秒降低至43.7 毫秒 ,实现了1.63 倍 的加速。
关键结果
RLDX-1 在 OpenArm、ALLEX 和 Franka Research 3 平台上的仿真基准测试和真实世界实验中进行了评估,其表现优于 π 0.5 \pi0.5 π 0.5 和 GR00T N1.6 等最先进基线。
仿真基准测试 :RLDX-1 在所有基准测试中均取得了最高的成功率,包括 LIBERO(97.8%)、RoboCasa Kitchen(70.6%)和 GR-1 Tabletop(58.7%)。值得注意的是,与基线相比,它在 LIBERO-Plus 和 SIMPLER 变体中表现出更强的鲁棒性。
真实世界通用性(OpenArm) :在需要遵循指令并泛化到未见物体/任务的任务中,RLDX-1 显著优于基线,在未见物体上的成功率为 54.2%,而 π 0.5 \pi0.5 π 0.5 为 37.5%。
功能能力(ALLEX & FR3) :
运动感知 :在速度变化的传送带任务中,RLDX-1 实现了 86.8% 的平均成功率,而基线在未见速度下崩溃至约 40% 或失败。
长期记忆 :在“盒中物体选择”和“猜盒游戏”任务中,RLDX-1 分别取得了 91.7% 和 91.7% 的成功率,而基线的表现接近随机水平(约 30-50%)。
物理感知 :在“插头插入”和“鸡蛋抓取放置”等接触丰富的任务中,RLDX-1 利用力矩和触觉反馈,分别实现了 33.3% 和 61.1% 的成功率,显著优于那些在接触力方面挣扎的基线。
推理性能 :优化后的流水线实现了 1.63 倍的加速,使得实时部署成为可能。
意义与主张
该论文声称,RLDX-1 代表了向可靠的 VLA 迈出的重要一步,使其能够应对复杂、接触丰富且动态的现实世界灵巧操作任务。通过将运动感知 、长期记忆 和物理感知 明确整合到统一的端到端架构中,从而超越“通用智能”,RLDX-1 解决了当前通用机器人策略中的关键差距。
作者强调,他们的方法不仅仅是现有 VLA 模型的扩展,而是将实现类人操作所必需的功能能力进行了结构性整合。合成数据流水线在增强真实世界数据方面的成功,以及三阶段训练程序的有效性,证明了在多样化具身平台上部署通用策略的可扩展路径。在 ALLEX 人形机器人上的结果表明,RLDX-1 在功能任务上的成功率约为 90%,而前沿模型仅为 40% 左右,这突显了该模型在多样化功能需求下控制高自由度机器人的能力。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。