← 最新论文
🤖 machine learning

Qwen-RobotManip Technical Report: Alignment Unlocks Scale for Robotic Manipulation Foundation Models

Qwen-RobotManip 是一个通用的视觉-语言-动作(Vision-Language-Action)基础模型,它利用跨越表示、运动和行为维度的统一对齐框架,实现了在约 38,100 小时开源语料库上的大规模训练,并在多种机器人平台和分布外(out-of-distribution)基准测试中实现了最先进的性能和涌现的泛化能力。

原作者: Haoqi Yuan, Zhixuan Liang, Anzhe Chen, Ye Wang, Haoyang Li, Pei Lin, Yiyang Huang, Zixing Lei, Tong Zhang, Jiazhao Zhang, Jie Zhang, Jingyang Fan, Gengze Zhou, Qihang Peng, Chenxu Lv, Xiaoyue Chen, An
发布于 2026-06-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Haoqi Yuan, Zhixuan Liang, Anzhe Chen, Ye Wang, Haoyang Li, Pei Lin, Yiyang Huang, Zixing Lei, Tong Zhang, Jiazhao Zhang, Jie Zhang, Jingyang Fan, Gengze Zhou, Qihang Peng, Chenxu Lv, Xiaoyue Chen, An Yang, Fei Huang, Junyang Lin, Dayiheng Liu, Jingren Zhou, Chenfei Wu, Xiong-Hui Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是关于 Qwen-RobotManip 技术报告的解释,已将其转化为使用类比的简单、日常语言。

核心理念:教机器人像人类一样“思考”

想象一下,你想教一个机器人做家务。在过去,科学家尝试通过向机器人展示成千上万段其他机器人执行特定任务的视频来教导它们。但这就像试图通过给一只狗看其他狗下棋的视频来教它下棋一样。这既昂贵,数据又稀缺,而且如果新机器人的样子稍有不同(比如手臂形状不同),它就会感到困惑。

Qwen-RobotManip 团队提出了一个不同的问题:我们能否利用让 AI 聊天机器人变得如此聪明的“规模化配方”来教导机器人?

聊天机器人之所以变得聪明,是因为它们阅读了互联网上的一切——书籍、论坛、文章和视频。它们学会了连接各种概念,因为所有的文本都是“对齐”的(都使用了相同的语言)。该团队想要看看是否也能对机器人这样做:将所有可用的机器人数据(即使来自不同的机器人)以及所有可用的真人手部动作视频混合在一起,从而教导机器人理解通用的世界,而不仅仅是某一个特定的任务。

问题所在:“机器人之间的语言障碍”

团队意识到存在一个巨大的问题。文本很容易对齐;在每本书中,“猫”的意思都是一样的。但机器人数据却是混乱的。

  • 不同的身体: 一个机器人有一条长手臂;另一个则短一些。一个有两个手,另一个只有一个。
  • 不同的视角: 一个摄像头从上方观察;另一个从侧面观察。
  • 不同的语言: 一个机器人记录的是“关节角度”(肘部弯曲了多少);另一个记录的是“3D 空间”(手在房间里的位置)。

如果你只是把这些数据丢进搅拌机,机器人会感到头痛。这就像是在没有翻译官的情况下,试图通过同时听取法语、日语和西班牙语说话者的声音来学习一门语言。信号会发生冲突,导致机器人学不到任何东西。

解决方案:“通用翻译器”

为了解决这个问题,团队构建了 Qwen-RobotManip,这是一个充当通用翻译器的机器人大脑。他们并没有直接倾倒数据,而是创建了一套严格的规则,在教导机器人之前将一切转化为一种通用的语言。

他们对齐了三个方面:

  1. 身体(表示形式): 他们创建了一个“标准化身体地图”。无论机器人的手臂是类人型的还是简单的抓取器,大脑都会将其动作转化为单一的、共享的格式。
  2. 视角(运动): 他们不再告诉机器人“将你的肘部转动 30 度”,而是教它“将你的手移向那个杯子”。他们将所有动作锚定在摄像头的视角上。如果摄像头看到杯子向左移动,机器人就会学习向左移动,而不论它自身的关节是如何运作的。这就像是通过观察路面来学习开车,而不是通过背诵方向盘转动了多少度来学习。
  3. 上下文(行为): 他们给了机器人一个“记忆窗口”。在做出动作之前,机器人会观察它在前一秒做了什么。这有助于它进行即时调整,就像人类在感觉到盒子打滑时调整握力一样。

数据:“人到机器人”的魔术技巧

团队需要海量的数据来训练这个大脑。他们并没有拥有数百万小时昂贵的机器人录制数据。因此,他们使用了一个聪明的技巧:人到机器人的合成(Human-to-Robot Synthesis)

  • 来源: 他们收集了数千小时以第一视角(类似于佩戴 GoPro)拍摄的人类执行任务(如烹饪或清洁)的视频。
  • 魔术: 他们使用 AI 将视频中的人类手部“替换”为机器人手臂。
    • 类比: 想象一段人类厨师切菜的视频。AI 观察人类手的移动,计算出刀具的位置,然后将人类的手数字化替换为机器人手臂,渲染出机器人手臂正在进行完全相同的切割动作。
  • 结果: 他们将 1,900 小时的人类视频转化成了涵盖 15 种不同类型机器人24,800 小时机器人数据。

总计,他们建立了一个包含 38,100 小时数据的训练库,且仅使用开源数据(没有使用秘密的企业数据)。

结果:它真的有效吗?

团队通过两种方式测试了这个机器人大脑:

  1. “教科书”测试: 标准测试,机器人看到的房间和物体与它接受训练时完全一致。在这里,机器人表现良好,但许多其他模型也表现得很好。
  2. “现实世界”测试 (OOD): 这是见证奇迹的地方。他们在全新的房间、新的物体、不同的光照环境,甚至是在它从未见过的机器人上进行了测试。

研究发现:

  • 泛化能力: 当灯光改变或桌子移动时,其他机器人可能会失败,但 Qwen-RobotManip 依然能正常工作。它理解的是任务的“概念”,而不仅仅是视觉模式。
  • 跨身体迁移: 他们在一个拥有双臂的机器人(AgileX)上进行训练,然后在完全不同的机器人(如 Franka 或 UR5 手臂)上进行测试。它在其他模型失败的地方取得了成功。
  • 自我纠正: 在现实测试中,如果机器人掉落了物体,它不会直接放弃。它会尝试再次尝试,并调整握力,就像人类一样。
  • 指令遵循: 如果你告诉它“拿起红色的杯子”,它就会拿起红色的杯子,即使杯子的位置很奇怪或者光照很差。其他模型经常会忽略指令,直接抓取最近的东西。

总结

该论文认为,让机器人变得聪明的秘诀不仅仅是收集更多的数据,而是先将这些数据进行正确的对齐

这就像是在建造一座图书馆。如果你把不同语言、不同尺寸和不同格式的书籍堆在一起,没有人能阅读。但如果你将它们全部翻译成一种标准语言,并整理在同样的书架上,你就可以阅读任何内容

Qwen-RobotManip 证明了,通过将所有机器人和人类数据转化为一种“共同语言”(基于摄像头的动作对齐),你可以训练出一个真正的通用型机器人——它能够学习新任务,并在不同的身体结构上工作,而无需从头开始重新训练。他们仅使用免费的开源数据就实现了这一点,这表明只要我们拥有正确的“翻译工具”,构建智能机器人的门槛可能比我们想象的要低。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →