ContactMimic: Humanoid Object Interaction via Contact Control
ContactMimic은 키포인트 궤적과 함께 이진 접촉 명령을 명시적으로 추적함으로써 휴머노이드 객체 상호작용을 향상시키는 학습 프레임워크로, 다양한 조작 작업 전반에 걸쳐 정밀한 물리적 접촉과 온디맨드 접촉 제어 가능성을 가능하게 한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
로봇에게 춤을 가르치고 있다고 상상해 보세요. 오랫동안 가장 좋은 방법은 인간 무용수의 영상을 보여주며 "이 신체 자세를 똑같이 따라 해"라고 말하는 것이었습니다. 로봇은 인간의 골반, 팔꿈치, 무릎 위치에 맞춰 자신의 관절을 움직였습니다.
하지만 여기 문제가 있습니다. 단순히 춤의 형태를 복사하는 것만으로는 충분하지 않습니다.
만약 인간 무용수가 화이트보드 근처에서 손을 흔든다면, 그들은 그냥 손을 흔드는 것입니다. 하지만 만약 그들이 손을 화이트보드에 밀착시킨다면, 그들은 보드를 닦는 것입니다. 만약 로봇이 손의 위치만 본다면, 로봇은 손을 화이트보드 옆에서 흔들면서도 자신이 아주 잘하고 있다고 생각할 수 있습니다. 실제로는 아무것도 닦지 못했음에도 말이죠. 이는 마치 문 바로 옆에 서 있기만 하고 정작 문손잡이는 건드리지 않은 채 문을 열려고 시도하는 것과 같습니다.
이것이 바로 CONTACTMIMIC이라는 새로운 프로젝트의 핵심 아이디어입니다. 연구진은 로봇이 앉기, 닦기, 가구 밀기 같은 작업을 진정으로 유용하게 수행하게 하려면, 단순히 로봇에게 '어디에' 있어야 하는지만 알려주는 것이 아니라, '무언가를 만져야 하는지'를 알려줘야 한다는 것을 발견했습니다.
접촉을 위한 "마법의 스위치"
연구팀은 로봇에게 단순히 경로를 따라가라고 지시하는 대신, 스위치를 부여하는 시스템을 구축했습니다. 이 스위치는 로봇 신체의 모든 부위에 대해 "예/아니오"라는 단순한 라벨을 제공합니다.
- 스위치 ON (접촉 ✔): "좋아, 로봇. 이제 네 손을 저 화이트보드에 밀착시켜라."
- 스위치 OFF (접촉 ✘): "좋아, 로봇. 손을 똑같은 위치로 가져가되, 보드에 닿지는 마. 그냥 공중에 띄워 둬."
실험에서 연구진은 이 스위치를 통해, 동일한 로봇이 똑같은 춤 동작을 수행하면서도 행동을 완전히 바꿀 수 있다는 것을 보여주었습니다. 로봇은 의자에 앉아 뒤로 기댈 수도 있고, 똑같은 의자에 앉아 있으면서도 등받이에 닿지 않고 똑바로 서 있을 수도 있습니다. 상자를 집어 들 수도 있고, 상자를 드는 모양만 취한 채 실제로 들어 올리지는 않을 수도 있습니다.
왜 이것이 그렇게 어려웠을까요?
여러분은 이렇게 생각할 수도 있습니다. "왜 로봇에게 자연스럽게 물건을 만지도록 가르치지 않았나요?" 연구진은 데이터 속에 숨겨진 함정을 발견했습니다.
인간이 물체와 상호작용할 때, 인간의 신체 위치와 접촉은 대개 하나로 묶여 있습니다. 만약 사람이 의자에 앉는다면, 엉덩이는 항상 의자 시트에 닿아 있습니다. 만약 사람이 보드를 닦는다면, 손은 항상 표면에 닿아 있습니다. 이 때문에 단순히 수천 개의 사람이 앉아 있는 영상을 로봇에게 보여주면, 로봇은 다음과 같이 학습합니다. "아, 엉덩이가 이 위치에 있다면, 엉덩이는 반드시 의자에 닿아 있겠구나." 로봇은 위치 정보가 모든 것을 설명한다고 믿어버리기 때문에 "접촉" 명령을 듣는 것을 멈춰버립니다.
이를 해결하기 위해 연구팀은 창의적인 방법을 사용했습니다. 그들은 학습 데이터를 가져와서 규칙을 깨뜨리기 시작했습니다.
- "유령" 물체: 누군가 보드를 닦는 영상을 가져온 뒤, 로봇에게 "보드는 거기 없다"라고 말했습니다. 로봇은 아무것도 건드리지 않으면서도 보드가 있는 위치로 손을 움직이는 법을 배워야 했습니다.
- "부풀려진" 물체: 시뮬레이션 속의 물체를 (마치 풍선을 불 듯이) 더 크게 만들어, 로봇이 "접촉" 명령이 내려졌음에도 불구하고 물체를 피해서 손을 움직이도록 만들었습니다.
- "가짜" 접촉: 로봇이 만져야 하는 영상에서 "만지지 마"라고 말하거나, 반대로 만지지 않는 상황에서 "만져라"라고 말하는 식의 데이터를 사용했습니다.
이렇게 데이터를 섞음으로써, 로봇이 위치를 바탕으로 추측하는 것을 멈추고 실제로 "접촉" 스위치에 귀를 기울이도록 강제했습니다.
효과가 있었나요?
연구팀은 이 기술을 Unitree G1(29개 관절을 가진 휴머노이드) 로봇과 컴퓨터 시뮬레이션에서 테스트했습니다.
- 시뮬레이션에서: 의자를 차거나, 의자 위로 발을 올리거나, 상자를 집어 드는 등 10가지 다른 작업을 수행했습니다. 스위치를 "접촉(Contact)"으로 바꾸면 로봇은 접촉을 만들어냈고, "비접촉(No Contact)"으로 바꾸면 접촉을 멈췄습니다. 로봇은 심지어 "상자를 들어 올려라"라는 특별한 지시 없이도, 단지 만지라는 명령만으로 상자를 들어 올릴 수 있었습니다.
- 실제 환경에서: 보드 닦기, 의자 등받이에 기대기 등 5가지 실제 동작을 테스트했습니다.
- 닦으라고 명령했을 때: 로봇의 손은 보드에 흔적이 남을 정도로 강하게 눌렀습니다.
- 공중에 띄우라고 명령했을 때: 손은 같은 위치로 이동했지만 흔적을 남기지 않았습니다.
- 기대라고 명령했을 때: 로봇은 의자 등받이에 체중을 실어 기댔습니다. 기대지 말라고 명령했을 때는 스스로 균형을 잡으며 똑바로 서 있었습니다.
결과는 인상적이었습니다. 실제 환경에서 로봇은 대부분의 작업(예: 등받이에 기대기 10번 중 9번 성공, 보드 닦기 5번 중 5번 성공)에서 접촉 명령을 약 **90%에서 100%**의 확률로 정확히 수행했습니다.
아직 할 수 없는 것들 (현재 기준)
이 논문은 이 기술이 무엇이 아닌지도 명확히 밝히고 있습니다.
- 하나의 뇌로 모든 작업을 수행할 수 있는 "범용" 로봇이 아닙니다. 연구진은 각 특정 동작마다 별도의 "뇌"(정책)를 훈련시켰습니다. 아직 하나의 단일 로봇이 이 모든 일을 동시에 수행하도록 만드는 방법은 찾아내지 못했습니다.
- 고품질의 인간-물체 상호작용 영상에 의존합니다. 인터넷의 무작위 영상을 사용한 것이 아니라, HUMOTO라는 특정 데이터셋을 사용했습니다.
- 로봇의 피부에 특수한 촉각 센서를 사용하지 않았습니다. 대신 로봇은 자신의 근육과 관절의 느낌(고유 수용 감각)을 통해 무언가를 만지고 있는지 파지했습니다. 연구진은 간단한 컴퓨터 프로그램이 로봇의 내부 감각을 바탕으로 "로봇이 접촉 중인가?"를 예측했을 때, 대부분의 작업에서 0.90~0.99의 F1 점수를 기록하며 이 방식이 작동함을 증명했습니다.
결론
이 논문은 로봇이 유용한 물리적 업무를 수행하게 하려면, 단순히 '어디로' 가라고 말하는 것만으로는 부족하다는 점을 시사합니다. 반드시 '만질 것인지'를 명시적으로 알려줘야 합니다. 훈련 과정에서 "위치"와 "접촉" 사이의 연결 고리를 끊음으로써, 그들은 로봇이 하나의 스위치에 귀를 기울이도록 가르쳤습니다. 이는 로봇이 단순히 동작을 흉내 내는 것을 넘어, 올바른 물리적 접촉을 통해 실제로 과업을 수행하게 만드는 중요한 단계입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.