← 最新论文
💻 computer science

Qwen-RobotNav Technical Report: A Scalable Navigation Model Designed for an Agentic Navigation System

Qwen-RobotNav 是一个可扩展的参数化导航模型,经过 1560 万个样本训练,使智能体系统能够在推理时动态重构观测策略和任务模式而无需改变架构,从而在多种基准测试和真实世界机器人中实现了最先进的性能和强大的零样本泛化能力。

原作者: Jiazhao Zhang, Gengze Zhou, Hale Yin, Yiyang Huang, Zixing Lei, Qihang Peng, Haoqi Yuan, Jie Zhang, Xudong Guo, Xiaoyue Chen, An Yang, Fei Huang, Junyang Lin, Dayiheng Liu, Jingren Zhou, Zhuoyuan Yu
发布于 2026-06-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiazhao Zhang, Gengze Zhou, Hale Yin, Yiyang Huang, Zixing Lei, Qihang Peng, Haoqi Yuan, Jie Zhang, Xudong Guo, Xiaoyue Chen, An Yang, Fei Huang, Junyang Lin, Dayiheng Liu, Jingren Zhou, Zhuoyuan Yu, Jingyang Fan, Zhixuan Liang, Pei Lin, Ye Wang, Anzhe Chen, Kun Yan, Xiao Xu, Jiahao Li, Lulu Hu, Minying Zhang, Shurui Li, Wenhu Xiao, Shuai Bai, Xuancheng Ren, Chenxu Lv, Chenfei Wu, Xiong-Hui Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一只超级聪明的机器狗或者一辆自动驾驶汽车。你想让它做很多不同的事情:比如听从口头指令“去厨房”,或者追逐一个移动的人,或者寻找丢失的一组钥匙,亦或是安全地在车流中穿行。

通常情况下,要构建一个能完成所有这些任务的机器人,就像是试图雇佣一个人,让他同时精通大厨、赛车手和侦探的所有技能。这非常困难,因为每种工作都需要一种不同的观察世界的方式。侦探需要记住几小时前的线索,而赛车手则只关心此时此刻眼前发生的事情。

Qwen-RobotNav 是一个为机器人设计的全新“大脑”,它解决了这个问题。研究人员并没有为每种工作都构建一个独立的脑子,而是构建了一个灵活的大脑,它可以根据正在做的事情来更换它的“眼镜”。

以下是它的工作原理,我们使用简单的类比来解释:

1. “瑞士军刀”式大脑

把 Qwen-RobotNav 想象成一把瑞士军刀。大多数导航机器人就像一把单功能的螺丝刀;它们擅长一件事,但在其他方面却毫无用处。Qwen-RobotNav 则是整套工具。

  • 模式切换: 它有一个“模式开关”。如果你告诉它“跟随那个人”,它就会切换到追踪模式(Tracking Mode)。在这种模式下,它会戴上“快速眼镜”,只关注过去几秒钟的视频,忽略旧的历史信息,以便能够做出即时反应。
  • 记忆力: 如果你告诉它“寻找红色的沙发”,它会切换到搜索模式(Search Mode)。在这里,它会戴上“广角眼镜”,记住过去 10 分钟内看到的一切,这样它就不会原地打转。
  • 神奇之处: 最棒的部分是,你不需要为了更换这些“眼镜”而去重新训练机器人。你只需告诉它要做什么,它就会立即调整如何关注这个世界。

2. 眼睛的“智能预算”

机器人处理视觉信息的能力是有极限的(就像电脑运行内存不足一样)。

  • 问题: 如果机器人观察 100 帧视频,它可能会感到应接不暇;如果它只看 1 帧,它可能会错过关键细节。
  • 解决方案: Qwen-RobotNav 使用了智能预算(Smart Budget)。想象一下,你有 100 美元可以用来购买房间的照片。
    • 如果你在开车,你会把大部分钱花在“现在”路面的照片上(前视图),而花很少的钱在后视图上。
    • 如果你在寻找丢失的物品,你会把钱分散开来,购买过去几分钟内整个房间的照片。
    • 机器人学会了自动进行这种计算。它会根据任务,决定为每个摄像头和每个时刻保留多少“像素”(视觉细节)。

3. 从“超级混合体验”中学习

为了教导这个机器人,研究人员并没有只给它看一种类型的视频。他们喂给它一个包含 1560 万种不同体验的巨大“奶昔”:

  • 指令遵循: “在蓝色椅子处左转。”
  • 点对点导航: “前往坐标 (5, 2)。”
  • 物体搜索: “找到电视遥控器。”
  • 追踪: “跟随戴黑帽子的那个人。”
  • 驾驶: “安全地通过一个路口。”

他们还加入了通用的“世界知识”(例如阅读标牌或识别物体),这样机器人在学习移动的同时,不会忘记如何理解语言。这防止了机器人变成一个只会机械反应、不假思索的“无脑反射机器”。

4. “管理者与工人”系统

对于非常漫长且复杂的任务(例如“去咖啡馆找到那把绿色雨伞,并告诉我它是否在那里”),机器人是一个团队在协作:

  • 管理者(上层规划器): 这是一个高层 AI,负责将大目标分解成小步骤。它会决定:“首先,去走廊。然后,寻找咖啡馆。”
  • 工人(Qwen-RobotNav): 这是导航模型。管理者会告诉工人:“去咖啡馆,但要使用你的‘搜索模式’并配备大的记忆预算。”
  • 循环过程: 工人出发,找到店面,然后汇报:“我到了,但没看到雨伞。”管理者更新其记忆并说:“好吧,检查下一张桌子。”这个过程不断重复,直到任务完成。

5. 现实世界的结果

论文表明,这个机器人不仅仅是一个模拟实验中的技巧。

  • 它赢得了比赛: 在跟随指令、寻找物体和追踪移动目标等测试中,它击败了其他顶尖机器人。
  • 它能驾驶: 它学会了在复杂的交通模拟中安全驾驶汽车。
  • 它能在真实机器人上运行: 团队在一个从未见过的真实建筑里,用真实的机器狗测试了它。他们给出了诸如“走到医疗室,然后转身倒着走”之类的口头指令。机器人成功地在陌生的建筑中导航,利用地标找到了路径,甚至完全按照要求完成了倒退行走。

总结: Qwen-RobotNav 是一个通用的导航大脑,它学会了如何“调节”自己的注意力。它知道何时专注于当下,何时记住过去,这使得单个机器人可以同时成为驾驶员、追踪者和搜索者。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →