← 최신 논문
🤖 machine learning

Qwen-RobotManip Technical Report: Alignment Unlocks Scale for Robotic Manipulation Foundation Models

Qwen-RobotManip은 표현, 동작, 행동 차원 전반에 걸친 통합 정렬 프레임워크를 활용하여 약 38,100시간의 오픈 소스 코퍼스에 대한 대규모 학습을 가능하게 함으로써, 다양한 로봇 플랫폼과 분포 외(out-of-distribution) 벤치마크에서 최첨단 성능과 창발적 일반화 능력을 달성하는 범용 시각-언어-행동 파운데이션 모델입니다.

원저자: Haoqi Yuan, Zhixuan Liang, Anzhe Chen, Ye Wang, Haoyang Li, Pei Lin, Yiyang Huang, Zixing Lei, Tong Zhang, Jiazhao Zhang, Jie Zhang, Jingyang Fan, Gengze Zhou, Qihang Peng, Chenxu Lv, Xiaoyue Chen, An
게시일 2026-06-17
📖 5 분 읽기🧠 심층 분석

원저자: Haoqi Yuan, Zhixuan Liang, Anzhe Chen, Ye Wang, Haoyang Li, Pei Lin, Yiyang Huang, Zixing Lei, Tong Zhang, Jiazhao Zhang, Jie Zhang, Jingyang Fan, Gengze Zhou, Qihang Peng, Chenxu Lv, Xiaoyue Chen, An Yang, Fei Huang, Junyang Lin, Dayiheng Liu, Jingren Zhou, Chenfei Wu, Xiong-Hui Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

다음은 Qwen-RobotManip 기술 보고서를 일상적인 언어와 비유를 사용하여 쉽게 풀어서 설명한 내용입니다.

핵심 아이디어: 로봇에게 인간처럼 "생각하는 법" 가르치기

당신이 로봇에게 집안일을 하는 법을 가르치고 싶다고 상상해 보세요. 과거에 과학자들은 특정 작업을 수행하는 다른 로봇들의 영상을 수천 개 보여주는 방식으로 로봇을 가르치려 했습니다. 하지만 이것은 강아지에게 체스를 두는 법을 가르치기 위해 다른 강아지들이 체스를 두는 영상을 보여주는 것과 같습니다. 비용이 많이 들고, 데이터도 희귀하며, 만약 새로운 로봇의 모습이 조금이라도 다르면(팔의 모양이 다르면) 혼란에 빠집니다.

Qwen-RobotManip 팀은 다른 질문을 던졌습니다: AI 챗봇을 똑똑하게 만든 것과 같은 "스케일링 레시피(scaling recipe)"를 로봇에게도 적용할 수 있을까?

챗봇이 똑똑해진 이유는 인터넷에 있는 모든 것—책, 포럼, 기사, 그리고 영상—을 읽었기 때문입니다. 그들은 모든 텍스트가 "정렬(aligned)"되어 있었기에(모두 같은 언어를 사용했기에) 아이디어를 연결하는 법을 배웠습니다. 팀은 로로봇에게도 똑같이 적용할 수 있는지 확인하고 싶었습니다. 즉, 사용 가능한 모든 로봇 데이터(서로 다른 로봇의 데이터라도)와 사용 가능한 모의 인간 손 동작 영상을 모두 섞어서, 로봇이 단 하나의 특정 작업이 아니라 세상을 일반적인 관점에서 이해하도록 가르치는 것입니다.

문제점: 로봇 사이의 "언어 장벽"

팀은 큰 문제가 있다는 것을 깨달았습니다. 텍text는 정렬하기 쉽습니다. "고양이(cat)"라는 단어는 어떤 책에서도 똑같은 의미를 갖습니다. 하지만 로봇 데이터는 무질서합니다.

  • 서로 다른 신체: 어떤 로봇은 긴 팔을 가졌고, 다른 로봇은 짧은 팔을 가졌습니다. 어떤 로봇은 두 손이 있고, 다른 로봇은 한 손뿐입니다.
  • 서로 다른 시점: 어떤 카메라는 위에서 내려다보고, 어떤 카메라는 옆에서 봅니다.
  • 서로 다른 언어: 어떤 로봇은 움직임을 "관절 각도"(팔꿈치가 얼마나 굽혀지는지)로 기록하고, 다른 로봇은 "3D 공간"(방 안에서 손이 어디에 있는지)으로 기록합니다.

이 모든 데이터를 그냥 믹서기에 넣고 돌려버리면 로봇은 머리가 아파질 것입니다. 이는 마치 통역사 없이 프랑스어, 일본어, 스페인어 화자들이 동시에 소리 지르는 것을 들으며 언어를 배우려는 것과 같습니다. 신호들이 서로 충돌하여 로봇은 아무것도 배울 수 없게 됩니다.

해결책: "만능 번역기"

이를 해결하기 위해 팀은 만능 번역기 역할을 하는 로봇의 뇌, Qwen-RobotManip을 구축했습니다. 그들은 단순히 데이터를 쏟아부은 것이 아니라, 로봇을 가르치기 전에 모든 것을 공통된 언어로 번역하는 엄격한 규칙을 만들었습니다.

그들은 세 가지 요소를 정렬했습니다:

  1. 신체 (표현 방식): 그들은 "표준화된 신체 지도"를 만들었습니다. 로봇이 인간형 팔이든 단순한 그리퍼(집게)든 상관없이, 뇌는 그 움직임을 하나의 공유된 형식으로 번형합니다.
  2. 시점 (움직임): 로봇에게 "팔꿈치를 30도 굽혀라"라고 말하는 대신, "그 컵을 향해 손을 움직여라"라고 가르칩니다. 이들은 모든 움직임을 카메라의 시점에 고정합니다. 카메라가 컵을 왼쪽으로 이동시키면, 로봇은 자신의 관절이 어떻게 움직이는지와 상관없이 왼쪽으로 움직이는 법을 배웁니다. 이는 핸들을 얼마나 돌려야 하는지를 외우는 것이 아니라, 도로를 보면서 운전을 배우는 것과 같습니다.
  3. 맥락 (행동): 그들은 로봇에게 "기억 창(memory window)"을 주었습니다. 움직임을 만들기 전, 로봇은 바로 직전의 행동을 살펴봅니다. 이는 마치 사람이 물건이 미끄러지는 것을 느꼈을 때 움켜쥐는 힘을 조절하는 것처럼, 로잡이 상황에 맞춰 즉각적으로 적응하도록 돕습니다.

데이터: "인간에서 로봇으로"의 마법 같은 기술

팀은 이 뇌를 훈련시키기 위해 방대한 양의 데이터가 필요했습니다. 하지만 값비싼 로봇 녹화 영상 수백만 시간은 가지고 있지 않았습니다. 그래서 그들은 영리한 기술을 사용했습니다: 인간-로봇 합성(Human-to-Robot Synthesis).

  • 출처: 그들은 인간이 과업(요리나 청소 등)을 수행하는 수천 시간의 영상을 수집했습니다. 이 영상들은 1인칭 시점(고프로를 착용한 듯한 시점)으로 촬영되었습니다.
  • 마법: 그들은 AI를 사용하여 영상 속의 인간 손을 로봇 팔로 "교체"했습니다.
    • 비유: 인간 셰프가 채소를 써는 영상을 찍었다고 상상해 보세요. AI는 인간의 손이 움직이는 것을 관찰하여 칼이 어디에 있어야 하는지 파악한 다음, 인간의 손을 디지털로 제거하고 그 자리에 로봇 팔을 렌더링하여 로봇 팔이 정확히 똑같은 동작으로 채소를 썰도록 만듭니다.
  • 결과: 그들은 1,900시간의 인간 영상을 15가지 유형의 로봇에 걸친 24,800시간의 로봇 데이터로 변환했습니다.

결과적으로, 그들은 오직 오픈 소스 데이터만을 사용하여 총 38,100시간의 훈련 라이브러리를 구축했습니다 (비밀 기업 데이터는 사용하지 않았습니다).

결과: 실제로 효과가 있는가?

팀은 두 가지 방식으로 이 로봇의 뇌를 테스트했습니다:

  1. "교과서" 테스트: 로봇이 훈련받았던 것과 정확히 똑같은 방과 물체를 보는 표준 테스트입니다. 여기서 로봇은 잘 작동했지만, 다른 모델들도 잘 작동했습니다.
  2. "실제 환경" 테스트 (OOD): 여기서 마법이 일어났습니다. 그들은 새로운 방, 새로운 물체, 다른 조명, 심지어 한 번도 본 적 없는 로봇을 사용하여 테스트했습니다.

발견된 사실:

  • 일반화 능력: 다른 로봇들이 조명이 바뀌거나 테이블이 움직였을 때 실패한 반면, Qwen-RobotManip은 계속해서 작동했습니다. 이 모델은 단순히 시각적 패턴을 따라 하는 것이 아니라, 작업의 개념을 이해하고 있었습니다.
  • 신체 간 전이 (Cross-Body Transfer): 그들은 두 팔이 있는 로봇(AgileX)으로 훈련시킨 후, 한 번도 본 적 없는 완전히 다른 로봇(Franka나 UR5 암 등)으로 테스트했습니다. 이 모델은 다른 모델들이 실패한 지점에서 성공했습니다.
  • 자기 수정: 실제 테스트에서 로봇이 물건을 떨어뜨렸을 때, 그냥 포기하는 것이 아니라 인간처럼 움켜쥐는 힘을 조절하며 다시 시도했습니다.
  • 지시 이행: 만약 "빨간 컵을 집어 들어"라고 말하면, 컵이 이상한 위치에 있거나 조명이 나쁘더라도 빨간 컵을 집어 들었습니다. 다른 모델들은 종종 지시를 무시하고 그냥 가장 가까이 있는 것을 잡곤 했습니다.

요점

이 논문은 똑똑한 로봇을 만드는 비결은 단순히 더 많은 데이터를 수집하는 것이 아니라, 데이터를 먼저 올바르게 **정렬(aligning)**하는 것이라고 주장합니다.

이것은 도서관을 짓는 것과 같습니다. 서로 다른 언어, 크기, 형식을 가진 책들을 그냥 쌓아두면 아무도 읽을 수 없습니다. 하지만 그 책들을 모두 하나의 표준 언어로 번翻译하고 동일한 선반에 정리한다면, 무엇이든 읽을 수 있습니다.

Qwen-RobotManip은 모든 로봇 및 인간 데이터를 "공통 언어(카메라에 정렬된 동작)"로 번역함으로써, 로봇을 진정한 **범용 전문가(generalist)**로 훈련할 수 있음을 증证明했습니다. 즉, 처음부터 다시 훈련할 필요 없이 새로운 작업을 배우고 서로 다른 신체에서도 작동할 수 있게 된 것입니다. 그들은 오직 무료인 오픈 데이터를 사용하여 이를 달성했으며, 이는 우리가 적절한 "번역 도구"만 가지고 있다면 똑똑한 로봇을 만드는 장벽이 생각보다 낮을 수 있음을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →