← 最新论文
🤖 machine learning

RLDX-1 Technical Report

本文介绍了RLDX-1,这是一种基于多流动作Transformer(MSAT)架构构建的通用机器人策略,它融合了异构模态与专用系统设计,在复杂、高接触且动态的真实世界灵巧操作任务中显著优于现有的视觉 - 语言 - 动作模型。

原作者: Dongyoung Kim, Huiwon Jang, Myungkyu Koo, Suhyeok Jang, Taeyoung Kim, Beomjun Kim, Byungjun Yoon, Changsung Jang, Daewon Choi, Dongsu Han, Donguk Lee, Heeseung Kwon, Hojin Jeon, Jaehyun Kang, Jaekyoun
发布于 2026-05-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Dongyoung Kim, Huiwon Jang, Myungkyu Koo, Suhyeok Jang, Taeyoung Kim, Beomjun Kim, Byungjun Yoon, Changsung Jang, Daewon Choi, Dongsu Han, Donguk Lee, Heeseung Kwon, Hojin Jeon, Jaehyun Kang, Jaekyoung Bae, Jihyuk Lee, Jimin Lee, John Won, Joonwoo Ahn, Junhyeong Park, Junyoung Sung, Kyungmin Lee, Minseong Han, Minsung Yoon, Sejune Joo, Seonil Son, Seungcheol Park, Seunggeun Cho, Seungjun Moon, Seungku Kim, Yonghoon Dong, Yongjin Cho, Youngchan Kim, Chang Hwan Kim, Dohyeon Kim, Hazel Lee, Heecheol Kim, Hensen Ahn, Hyungkyu Ryu, Hyunsoo Choi, Hyunsoo Shin, Jaeheon Jung, Jaewoo Kim, Jinwook Kim, Joochul Chang, Joonsoo Kim, Junghun Park, Jungwoo Park, Junho Cho, Junhyeok Park, Junwon Lee, Kangwook Lee, Kwanghoon Kim, Kyoungwhan Choe, Manoj Bhadu, Nayoung Oh, Sangjun Kim, Sangwoo Kim, Seunghoon Shim, Seunghyun Kim, Seungjun Lee, Seungyup Ka, Sungryol Yang, Wook Jung, Yashu Shukla, Yeonjae Lee, Yeonwoo Bae, Jinwoo Shin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你建造了一个机器人,它在阅读指令和观察图片方面极其聪明。它知道什么是“杯子”,明白“倾倒”的含义,并能流利地谈论这些。这就像一个拥有理论博士学位却缺乏现实世界经验的机器人。如果你让它去接住传送带上移动的球,或者在不弄碎的情况下拧下灯泡,它可能会僵住,因为它不理解运动记忆触觉

这篇论文介绍了RLDX-1,一种旨在解决这一问题的新型机器人“大脑”。不妨将 RLDX-1 不仅仅视为一个聪明的阅读者,而是一位大师级工匠,它将三种新的超能力与其现有的智能相结合:

1. 超能力:运动、记忆与触觉

  • 运动感知(“杂耍者”):
    大多数机器人看着静止的照片猜测下一步该做什么。但现实世界是动态的。如果一个盒子在传送带上滑动,静态照片就毫无用处。RLDX-1 就像一个杂耍者,它不仅仅盯着球看,而是观察球在空中飞行的整个视频。它理解速度和方向,使其能够接住其他机器人会错过的移动物体。
  • 长期记忆(“夏洛克·福尔摩斯”):
    有些任务需要时间。想象一个三杯猜球游戏,人类将立方体藏在三个杯子中的一个下面,走开后让机器人寻找。只有“短期记忆”的机器人能看到杯子,却忘记了人类触碰了哪一个。RLDX-1 会保留过去几秒或几分钟发生事件的“笔记本”。它记得事件序列,使其能够解决需要回顾过去的谜题。
  • 物理感知(“温柔之手”):
    视觉很棒,但你无法看到插座内部,也无法感觉到你捏易碎鸡蛋的力度。RLDX-1 可以通过其传感器“感觉”。它能读取关节中的扭矩(扭转力)以及皮肤传来的触觉信号。这就像一个蒙着眼睛的人,能确切地知道插头何时完全插入插座,或鸡蛋何时即将破裂,并瞬间调整抓握力度。

2. 训练:它是如何学习的

你不能仅仅通过给机器人看几段视频就教会它这些技能。RLDX-1 经历了三阶段训练营

  • 第一阶段:通才(预训练): 它观看了数百万段不同机器人(机械臂、机械手、人形机器人)做简单事情的视频。这让它对世界如何运作有了广泛的理解。
  • 第二阶段:专才(中期训练): 在这里,它学习了新的超能力。它专门针对“运动”、“记忆”和“触觉”模块进行练习。为此,研究人员使用了一个巧妙的技巧:他们利用AI 视频生成器创建数千种新的罕见场景(例如,在一个不存在的厨房里,机器人正在倒汤),然后利用数学计算出机器人应该做什么。这填补了现实世界数据缺失的空白。
  • 第三阶段:精修(后期训练): 最后,它在特定的现实世界任务中进行练习,从自己的错误中学习。如果它没能拿起杯子,它会再试一次,使用一种强化学习方法,这种方法就像教练提供即时反馈以改善其表现。

3. 速度:在快车道上运行

即使是最聪明的大脑,如果太慢也是无用的。如果机器人思考需要 0.1 秒,等到它行动时,世界可能已经改变了。论文指出,RLDX-1 经过优化,运行速度比标准系统快 1.6 倍

  • 类比: 想象一位送货司机,他在每一个红绿灯前都停下来查看地图(标准处理)。RLDX-1 则像是一位已经预先规划好整个路线、确切知道哪些灯会变绿、并能不停车直接穿过的司机。这使其能够在实时中做出反应,即使在高速移动的装配线上也是如此。

4. 结果:事实胜于雄辩

研究人员通过两种方式将 RLDX-1 与其他顶级机器人大脑(如 π0.5\pi0.5 和 GR00T N1.6)进行了测试:

  • 在模拟中(电子游戏): RLDX-1 在复杂的厨房任务和移动物体挑战中 consistently 击败了其他对手。
  • 在现实世界中(测试):
    • 传送带: 当物体快速移动时,RLDX-1 的成功率为87.5%,而表现第二好的机器人失败率接近 70%。
    • 三杯猜球游戏: 当被要求根据记忆寻找隐藏物体时,RLDX-1 的正确率为91.7%。其他机器人随机猜测,正确率仅为 30% 左右。
    • 灯泡: 当被要求拧动灯泡直到它亮起时,RLDX-1 学会完成该任务所需的尝试次数,比人类教练演示的次数还要少。

总结

RLDX-1 是一种机器人策略,它超越了单纯的“看见和理解”,转向灵巧地行动。通过将强大的视觉大脑与针对运动记忆触觉的专用模块相结合,并在现实世界与 AI 生成数据的巨大混合体上进行训练,它在以往机器人难以应对的复杂、动态和精细任务中实现了类人的技能。这是迈向机器人真正能够在混乱、移动且充满触觉的现实世界中与我们并肩工作的重要一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →