← 최신 논문
💻 computer science

HoMMI: Learning Whole-Body Mobile Manipulation from Human Demonstrations

이 논문은 로봇 없이 인간이 수행하는 데모 데이터를 기반으로 전신 이동 조작을 학습할 수 있도록 증강된 UMI 인터페이스와 교차 신체성 손 - 눈 정책 설계를 통해 인간과 로봇 간의 표현 차이를 극복하는 'HoMMI' 프레임워크를 제안합니다.

원저자: Xiaomeng Xu, Jisang Park, Han Zhang, Eric Cousineau, Aditya Bhat, Jose Barreiros, Dian Wang, Shuran Song

게시일 2026-03-04
📖 4 분 읽기☕ 가벼운 읽기

원저자: Xiaomeng Xu, Jisang Park, Han Zhang, Eric Cousineau, Aditya Bhat, Jose Barreiros, Dian Wang, Shuran Song

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 **"로봇이 사람의 행동을 보고 배워서, 스스로 이동하며 복잡한 일을 할 수 있게 만든 방법"**에 대한 이야기입니다.

기존의 로봇 학습 방식은 로봇을 직접 조종하는 사람 (원격 조종) 이 필요했는데, 이는 너무 비싸고 느렸습니다. 이 연구팀은 **"로봇 없이도 사람이 스마트폰을 들고 움직이는 모습만 찍으면, 로봇이 그걸 보고 배울 수 있다"**는 획기적인 시스템을 개발했습니다. 이를 **HoMMI(호미)**라고 부릅니다.

이 복잡한 기술을 일상적인 언어와 비유로 설명해 드릴게요.


1. 문제: "손만 보는 로봇" vs "머리도 움직이는 사람"

기존에 로봇이 물건을 잡는 법을 배울 때는 주로 손목 카메라만 사용했습니다.

  • 비유: 마치 안경을 쓴 채로 코 끝만 보고 걷는 사람과 같습니다. 손이 닿는 곳은 잘 보지만, 어디로 가야 할지, 발밑에 장애물이 있는지, 주변에 다른 물건이 있는지 전혀 모릅니다. 그래서 로봇은 길을 잃거나, 물건을 잡으려다 다른 것을 부수는 실수를 자주 했습니다.

연구팀은 사람처럼 머리 (시선) 를 움직이며 주변을 살피는 능력을 로봇에게도 주고 싶었습니다. 하지만 여기서 큰 문제가 생겼습니다.

  • 문제: 사람은 키가 크고 목이 유연하지만, 로봇은 키가 작고 목이 딱딱합니다. 사람이 "저기 봐!"라고 고개를 돌리는 걸 로봇이 그대로 따라 하려다 보면, 로봇의 목이 꺾이거나 넘어질 위험이 있습니다.

2. 해결책 1: "스마트폰 3 대"로 촬영하는 데이터 수집

연구팀은 로봇을 조종하지 않고, 사람이 스마트폰 3 대를 들고 다니며 일을 하는 모습을 찍었습니다.

  • 구성: 손에 든 스마트폰 2 대 (손목 카메라 역할) + 모자에 낀 스마트폰 1 대 (머리 카메라 역할).
  • 효과: 사람이 물건을 잡으러 이동하고, 고개를 돌려 주변을 살피는 전 과정을 자연스럽게 기록했습니다. 마치 사람이 직접 로봇의 눈과 손이 되어 일을 시뮬레이션하는 것과 같습니다.

3. 해결책 2: "로봇과 사람 사이의 언어 장벽"을 허무는 3 가지 기술

사람의 동작을 로봇이 그대로 따라 하려면, 사람과 로봇의 차이 (키, 몸매, 관절) 를 고려해야 합니다. HoMMI 는 이를 해결하기 위해 3 가지 똑똑한 기술을 썼습니다.

① "3D 지도"로 보는 눈 (시각적 차이 해결)

사람의 눈 (카메라) 과 로봇의 눈은 위치와 모양이 다릅니다. 그냥 영상을 주면 로봇은 "어? 이 물건이 왜 이렇게 달라 보일까?"라고 혼란을 느낍니다.

  • 비유: 사람이 2D 사진을 보는 대신, 3D 입체 지도를 보게 한 것입니다.
  • 원리: 카메라로 찍은 영상을 3D 점 (Point Cloud) 으로 변환합니다. 이렇게 하면 사람의 팔 모양이나 키 차이 때문에 생기는 시각적 혼란을 없애고, **"물건이 공간에 어디에 있는지"**라는 핵심 정보만 로봇에게 전달합니다.

② "보라"는 명령만 내리는 머리 (운동학적 차이 해결)

사람은 고개를 360 도 자유롭게 돌릴 수 있지만, 로봇의 목은 제한적입니다. 사람의 고개 각도를 그대로 복사하면 로봇은 넘어집니다.

  • 비유: 사람에게 **"저기 있는 사과를 봐!"**라고 말하는 대신, **"저기 있는 사과를 바라봐!"**라고 목표 지점만 알려주는 것입니다.
  • 원리: 로봇에게 "고개를 30 도 돌려"라고 구체적으로 명령하는 게 아니라, **"시선이 향해야 할 3D 좌표 (보라 점)"**만 줍니다. 로봇은 그 점으로 시선을 맞추기 위해 자신의 관절이 허용하는 범위 내에서 가장 자연스럽게 고개를 돌립니다.

③ "손을 기준으로" 생각하기 (공간 감각 통일)

사람이 고개를 돌리면 시야가 바뀌지만, 로봇은 손이 움직이는 기준이 중요합니다.

  • 비유: 모든 것을 로봇의 손바닥을 기준으로 재는 것입니다.
  • 원리: 사람의 시선이나 몸의 위치가 아니라, 로봇이 물건을 잡으려는 **'손의 위치'**를 기준으로 모든 정보를 정리합니다. 이렇게 하면 로봇이 어디에 있든, 손이 물건을 잡는 상황은 항상 일관되게 인식할 수 있습니다.

3. 결과: "로봇이 스스로 길을 찾고, 고개를 돌려 물건을 찾는다"

이 시스템을 실제 로봇 (이동형 양팔 로봇) 에 적용해 실험했습니다.

  • 실험 1 (세탁물 정리): 로봇은 테이블에서 옷을 잡고, 바구니가 어디 있는지 스스로 고개를 돌려 찾아낸 뒤, 이동해서 옷을 넣었습니다.
  • 실험 2 (배달): 로봇은 상자를 들고 넓은 공간을 이동하며, 트롤리가 어디 있는지 주변을 살피고 찾아갔습니다.
  • 실험 3 (식탁 정리): 로봇은 식탁보의 양끝을 잡고, 몸을 숙이고 이동하며 식탁보를 펴는 복잡한 동작을 성공했습니다.

기존 방식 (손목 카메라만) 과 비교했을 때:

  • 손목 카메라만 있는 로봇: "어디로 가야 하지?"라며 길을 잃거나, 바구니가 안 보이면 그냥 멈춰 섰습니다.
  • HoMMI 로봇: "아, 저기 바구니가 있네!"라며 고개를 돌려 찾고, 안전하게 이동했습니다.

4. 핵심 요약: 왜 이 연구가 중요한가?

이 연구는 **"로봇을 조종하는 전문가가 없어도, 일반인이 스마트폰만 들고 다니면 로봇이 그걸 보고 복잡한 일을 배울 수 있다"**는 것을 증명했습니다.

  • 과거: 로봇을 가르치려면 비싼 장비와 전문가가 필요했다. (비유: 로봇을 조종하려면 비행 조종사가 필요함)
  • HoMMI: 누구나 스마트폰으로 영상을 찍으면 로봇이 배운다. (비유: 유튜브 동영상을 보고 로봇이 춤을 배움)

이 기술이 발전하면, 우리 집이나 공장에서 로봇이 사람처럼 스스로 이동하며, 고개를 돌려 상황을 파악하고, 복잡한 일을 척척 해내는 시대가 열릴 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →