← 최신 논문
💻 computer science

Qwen-RobotNav Technical Report: A Scalable Navigation Model Designed for an Agentic Navigation System

Qwen-RobotNav는 1,560만 개의 샘플로 학습된 확장 가능한 파라미터화된 내비게이션 모델로서, 구조적 변경 없이도 추론 시점에 에이전트 시스템이 관측 전략과 작업 모드를 동적으로 재구성할 수 있도록 하여, 다양한 벤치마크와 실제 로봇 환경에서 최첨단 성능과 강력한 제로샷 일반화 능력을 달성합니다.

원저자: Jiazhao Zhang, Gengze Zhou, Hale Yin, Yiyang Huang, Zixing Lei, Qihang Peng, Haoqi Yuan, Jie Zhang, Xudong Guo, Xiaoyue Chen, An Yang, Fei Huang, Junyang Lin, Dayiheng Liu, Jingren Zhou, Zhuoyuan Yu
게시일 2026-06-17
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jiazhao Zhang, Gengze Zhou, Hale Yin, Yiyang Huang, Zixing Lei, Qihang Peng, Haoqi Yuan, Jie Zhang, Xudong Guo, Xiaoyue Chen, An Yang, Fei Huang, Junyang Lin, Dayiheng Liu, Jingren Zhou, Zhuoyuan Yu, Jingyang Fan, Zhixuan Liang, Pei Lin, Ye Wang, Anzhe Chen, Kun Yan, Xiao Xu, Jiahao Li, Lulu Hu, Minying Zhang, Shurui Li, Wenhu Xiao, Shuai Bai, Xuancheng Ren, Chenxu Lv, Chenfei Wu, Xiong-Hui Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 아주 똑똑한 로봇 개나 자율주행 자동차가 있다고 상상해 보세요. 당신은 이것이 여러 가지 다양한 일을 하기를 원합니다. "주방으로 가라"는 음성 명령을 따르거나, 움직이는 사람을 추격하거나, 잃어버린 열쇠 꾸러미를 찾거나, 교통 흐름 속에서 안전하게 운전하는 일 같은 것들 말이죠.

보통 이런 모든 일을 할 수 있는 로봇을 만드는 것은, 한 명의 사람에게 마스터 셰프, 레이싱 카 드라이버, 그리고 탐정 역할을 모두 맡기려는 것과 같습니다. 각 직업은 세상을 바라보는 방식이 완전히 다르기 때문에 이는 매우 어려운 일입니다. 탐정은 몇 시간 전의 단서들을 기억해야 하지만, 레이싱 카 드라이버는 바로 지금 이 순간 눈앞에 벌어지는 일에만 집중해야 합니다.

Qwen-RobotNav는 로봇을 위한 새로운 "두뇌"로, 이 문제를 해결합니다. 연구진들은 모든 작업마다 별도의 두뇌를 만드는 대신, 하는 일에 따라 "안경"을 바꿀 수 있는 유연한 하나의 두뇌를 만들었습니다.

작동 원리는 다음과 같습니다. 쉬운 비유를 들어 설명하겠습니다.

1. "맥가이버 칼" 같은 두뇌

Qwen-RobotNav를 맥가이버 칼이라고 생각해 보세요. 대부분의 내비게이션 로봇은 단일 드라이버와 같아서 한 가지 일에는 뛰어나지만 다른 일에는 쓸모가 없습니다. Qwen-RobotNav는 이 모든 도구를 갖춘 도구입니다.

  • 스위치: 이 모델에는 "모드 스위치"가 있습니다. 만약 당신이 "저 사람을 따라가"라고 말하면, 로봇은 **추적 모드(Tracking Mode)**로 전환합니다. 이 모드에서는 즉각적으로 반응하기 위해 과거의 기록은 무시하고 지난 몇 초간의 영상만을 보는 "빠른 안경"을 씁니다.
  • 기억력: 만약 당신이 "빨간 소파를 찾아"라고 말하면, 로로봇은 **탐색 모드(Search Mode)**로 전환합니다. 이때는 뱅뱅 돌지 않도록 지난 10분 동안 본 모든 것을 기억하는 "광각 안경"을 씁니다.
  • 마법: 가장 멋진 점은 이 안경을 바꾸기 위해 로봇을 다시 학습시킬 필요가 없다는 것입니다. 당신이 할 일을 말하기만 하면, 로봇은 즉시 세상에 주의를 기울이는 방식을 조정합니다.

2. 눈을 위한 "스마트 예산"

로봇은 한 번에 처리할 수 있는 시각 정보의 양에 한계가 있습니다 (마치 컴퓨터의 RAM이 부족해지는 것과 같습니다).

  • 문제점: 만약 로봇이 100개의 영상 프레임을 본다면 정보 과부하가 걸릴 수 있고, 반대로 1개의 프레임만 본다면 중요한 세부 사항을 놓칠 수 있습니다.
  • 해결책: Qwen-RobotNav는 **스마트 예산(Smart Budget)**을 사용합니다. 방의 사진을 사는 데 100달러를 쓴다고 가정해 봅시다.
    • 운전 중이라면, 현재의 도로 사진(전방 뷰)에 대부분의 돈을 쓰고 후방 뷰에는 아주 적은 돈을 씁니다.
    • 잃어버린 물건을 찾는 중이라면, 지난 몇 분 동안의 방 전체 사진을 사는 데 돈을 골고루 배분합니다.
    • 로봇은 이 계산을 자동으로 수행하는 법을 배웁니다. 작업에 따라 모든 카메라와 모든 시간대에 대해 얼마나 많은 "픽셀"(시각적 세부 정보)을 유지할지 스스로 결정합니다.

3. "메가 믹스" 경험으로부터의 학습

이 로봇을 가르치기 위해 연구진은 단순히 한 종류의 영상만 보여준 것이 아닙니다. 그들은 1,560만 개의 서로 다른 경험이 담긴 거대한 "스무디"를 입력했습니다:

  • 지시 이행: "파란 의자에서 왼쪽으로 돌아."
  • 지점 내비게이션: "좌표 (5, 2)로 이동해."
  • 물체 탐색: "TV 리모컨을 찾아."
  • 추격: "검은 모자를 쓴 남자를 따라가."
  • 운전: "교차로를 안전하게 통과해."

또한 로봇이 움직임을 배우는 동안 언어를 이해하는 법을 잊지 않도록 일반적인 "세상 지식"(표지판을 읽거나 물체를 인식하는 것 등)을 함께 섞었습니다. 이는 로봇이 생각 없이 움직이기만 하는 "생각 없는 반사 기계"가 되는 것을 방지합니다.

4. "매니저와 작업자" 시스템

매우 길고 복잡한 작업(예: "커피숍에서 초록색 우산을 찾아 그것이 있는지 알려줘")을 수행할 때, 로봇은 팀으로 움직입니다:

  • 매니저 (상위 플래너): 큰 목표를 작은 단계로 나누는 고차원 AI입니다. 매니저는 "먼저 복도로 가라. 그다음 커피숍을 찾아라"와 같이 결정을 내립니다.
  • 작업자 (Qwen-RobotNav): 이것이 내비게이션 모델입니다. 매니저는 작업자에게 "커피숍으로 가되, 큰 기억 예산을 가진 '탐색 모드'를 사용하라"고 지시합니다.
  • 루프: 작업자는 가서 커피숍을 찾고, "도착했지만 우산은 없습니다"라고 보고합니다. 매니저는 기억을 업데이트하고 "알겠다, 다음으로 테이블을 확인해라"라고 말합니다. 이 과정은 작업이 완료될 때까지 반복됩니다.

5. 실제 세계에서의 결과

논문은 이 로봇이 단순한 시뮬레이션 기술이 아님을 보여줍니다.

  • 경연 대회 우승: 이 로봇은 지시 이행, 물체 찾기, 움직이는 대상 추적 테스트에서 다른 최고 수준의 로봇들을 이겼습니다.
  • 운전 능력: 복잡한 교통 시뮬레이션 속에서 자동차를 안전하게 운전하는 법을 배웠습니다.
  • 실제 로봇 적용: 연구팀은 한 번도 가본 적 없는 실제 건물에서 실제 로봇 개를 사용하여 테스트했습니다. 그들은 "의료실로 걸어가서, 몸을 돌려 뒤로 걸어와라"와 같은 음성 명령을 주었습니다. 로봇은 낯선 건물을 성공적으로 통과했고, 랜드마크를 이용해 길을 찾았으며, 심지어 요청받은 대로 정확히 뒤로 걷기도 했습니다.

요약하자면: Qwen-RobotNav는 자신의 주의력을 스스로 "조율"하는 법을 배우는 보편적인 내비게이션 두뇌입니다. 이 모델은 언제 현재에 집중하고 언제 과거를 기억해야 하는지를 알기에, 단 하나의 로봇이 드라이버이자 추격자, 그리고 탐색자가 될 수 있게 해줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →