Multi-Domain Motion Embedding: Expressive Real-Time Mimicry for Legged Robots
본 논문은 웨이브릿 기반 인코더와 확률적 임베딩을 통해 구조화된 주기적 특징과 비구조화된 비주기적 특징을 통합함으로써, 개별 동작에 대한 튜닝이나 온라인 리타겟팅 없이도 다양한 휴머노이드 및 사족 보행 로봇에 대해 표현력이 풍부한 실시간 제로샷 동작 모방을 가능하게 하는 새로운 동작 표현 방식인 다중 도메인 모션 임베딩(Multi-Domain Motion Embedding, MDME)을 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
로봇은 오랫동안 생명체의 자연스러운 유연함을 따라 하는 데 어려움을 겪어 왔습니다. 엔지니어들이 기계가 직선으로 걷거나 계단을 오르도록 프로그래밍할 수는 있지만, 인간의 복잡하고 표현력 있는 몸짓이나 동물의 독특한 걸음걸이를 모방하도록 가르치는 것은 여전히 난제로 남아 있습니다. 핵심적인 어려움은 '번역'에 있습니다. 인간의 몸과 로봇의 몸은 관절의 수와 물리적 한계가 다르기 때문에 서로 다르게 설계되어 있습니다. 전통적으로 로봇이 인간을 복제하게 만들기 위해 연구자들은 인간의 움직임을 로봇이 이해할 수 있는 코드로 수동으로 다시 작성해야 했는데, 이는 마치 시를 문법이 완전히 다른 언어로 단어 하나하나 직역하는 과정과 비슷합니다. 이러한 수동 번역은 느리고, 움직임의 흐름을 깨뜨리며, 로봇이 이전에 본 적 없는 새로운 유형의 동작을 마주했을 때 실패하곤 합니다.
ETH 취리히의 연구진은 이 수동 번사를 완전히 우회하는 새로운 접근 방식을 개발했습니다. 그들은 다리가 달린 로봇이 인간이나 동물의 움직임을 관찰하고, 미리 작성된 스크립트 없이도 자신의 몸에 어떻게 재현할지를 즉각적으로 이해할 수 있는 시스템을 만들었습니다. 연구진은 로봇에게 특정 관절 각도를 단순히 복사하는 대신 움직임의 근본적인 리듬과 구조를 인식하도록 가르침으로써, 기계가 가공되지 않은 비디오와 모션 데이터를 통해 실시간으로 학습할 수 있게 했습니다. 이 연구는 로봇이 단순히 관찰을 통해 새로운 기술을 배우고, 자신의 고유한 물리적 형태에 즉각적으로 적응하는 미래를 제시합니다.
마티아스 헤이먼(Matthias Heyrman)과 동료들이 이끄는 연구진은 수년간 이 분야를 괴롭혀온 문제, 즉 움직임의 규칙적이고 반복적인 패턴과 갑작스럽고 예측 불가능한 제스처를 모두 포착할 수 있는 방식으로 동작을 어떻게 표현할 것인가에 집중했습니다. 기존 방식은 종종 이 두 가지 측면을 별개로 취급하거나, 모든 움직임을 하나의 경직된 수학적 틀에 강제로 끼워 맞추려 했습니다. 연구진은 자연스러운 움직임이 두 가지 요소의 혼합이라는 점을 깨달았습니다. 즉, 걷는 동안 다리가 흔들리는 것과 같은 구조적이고 주기적인 패턴과, 갑작스러운 회전이나 팔의 흔듦과 같은 비구조적이고 비주기적인 변형입니다. 이를 해결하기 위해 그들은 움직임에 대한 '이중 렌즈 카메라' 역할을 하는 '멀티 도메인 모션 임베딩(Multi-Domain Motion Embedding)' 시스템을 구축했습니다. 한 렌즈는 움직임의 반복적이고 파동 같은 패턴에 집중하고, 다른 렌즈는 각 움직임을 독특하게 만드는 무질서하고 고유한 세부 사항을 포착합니다.
연구진은 인간의 포즈를 로봇 명령으로 수동 번역하는 대신, 가공되지 않은 모션 데이터를 시스템에 직접 입력했습니다. 이 데이터는 다양한 방식으로 움직이는 인간 배우의 기록과 개가 달리고 걷는 영상이라는 두 가지 소스에서 왔습니다. 시스템은 이 정보를 두 개의 평행한 경로를 통해 처리합니다. 첫 번째 경로는 웨이브릿 변환(wavelet transform)이라는 수학적 도구를 사용하여 움직임을 주파수 성분으로 분해합니다. 이를 통해 로봇은 움직임의 '비트'를 파악하여 보행의 일정한 주기나 댄스의 리듬을 식별할 수 있습니다. 두 번째 경로는 확률적 인코더(probabilistic encoder)를 사용하여 사람이 회전할 때 몸을 기울이는 방식이나 개가 울퉁불퉁한 지면에서 균형을 잡는 방식과 같은 무질서하고 비반복적인 세부 사항을 포착합니다. 이 두 정보 스트림은 로봇이 이해할 수 있는 하나의 풍부한 움직임 묘사로 결합됩니다.
이 시스템의 진정한 테스트는 인간의 개입 없이 실제 세상에서 작동할 수 있는지 여부였습니다. 연구진은 강화 학습(보상을 극대화하기 위해 시행착오를 통해 배우는 방법)을 사용하여 시뮬레이션 환경에서 로봇을 훈련시켰습니다. 그들은 휴머노이드 로봇인 Fourier N1에게는 인간의 움직임을 모방하도록, 사족 보행 로봇인 ANYmal D에게는 개의 움직임을 모방하도록 가르쳤습니다. 결정적으로, 연구진은 로봇에게 사전 처리되거나 번역된 지침을 제공하지 않았습니다. 로봇은 가공되지 않은 인간이나 동물의 움직임을 자신의 몸에 어떻게 매핑할지를 전적으로 스스로 알아내야 했습니다. 결과는 놀라웠습니다. 시뮬레이션에서 로봇은 단순한 걷기부터 복잡하고 표현력 있는 제스처에 이르기까지 매우 다양한 동작을 추적하는 데 성공했으며, 그 정확도는 이전 방식들을 능가했습니다.
시스템이 컴퓨터 외부에서도 작동함을 증명하기 위해, 연구진은 훈련된 정책을 실제 하드웨어에 배치했습니다. 휴머노이드 로봇은 인간 배우의 영상을 보고 코드의 수동 조정 없이 걷기, 회전, 제스처를 포함한 움직임을 즉시 모방하기 시작했습니다. 마찬가지로, 사족 보행 로봇은 개의 영상을 보고 동물의 걸음걸이를 성공적으로 재현했습니다. 더욱 인상적인 것은, 시스템이 '제로샷 학습(zero-shot learning)' 능력을 보여주었다는 점입니다. 즉, 학습 데이터에 없던 새로운 유형의 움직임도 처리할 수 있었습니다. 훈련 데이터에 없던 새로운 종류의 개 걸음걸이가 제시되었을 때, 로봇은 실패하지 않고 대신 그 동작을 자신의 몸에 맞는 안정적이고 실행 가능한 버전으로 적응시켰습니다. 이러한 일반화 능력은 시스템이 단순히 특정 포즈의 목록을 암기한 것이 아니라, 움직임의 근본적인 원리를 학습했음을 시사합니다.
연구진은 또한 수동 리타겟팅(manual retargeting)에 의존하는 기존 기술들과 새로운 방법을 비교했습니다. 그들은 기존 방식이 정확히 훈련받은 동작을 복사할 때는 약간 더 정확할 수 있지만, 새롭거나 예상치 못한 움직임에 직면했을 때는 처참하게 실패한다는 것을 발견했습니다. 반면, 새로운 시스템은 보지 못한 광범위한 동작에 대해서도 성능을 유지했습니다. 이 연구는 로봇이 움직임을 경직된 번역 필터를 거치게 하는 대신, 가공되지 않은 데이터로부터 움직임의 구조를 직접 학습하게 함으로써 기계가 움직임에 대해 훨씬 더 깊은 이해를 얻게 된다는 것을 시사합니다. 이 접근 방식은 엔지니어가 매번 새로운 동작을 위한 규칙을 수작업으로 만들 필요성을 없애며, 로봇이 자연계에 존재하는 움직임의 다양성으로부터 배울 수 있는 길을 열어줍니다.
가장 중요한 발견 중 하나는 시스템이 로봇과 배우 사이의 차이점을 어떻게 처리했는가 하는 점이었습니다. 연구진은 로봇이 인간과 똑같이 맞추기 위해 자신의 몸을 불가능한 형태로 강요하지 않는다는 것을 발견했습니다. 대신, 로봇은 움직임의 의도를 자신의 물리적 구조에 맞게 실행 가능한 방식으로 해석했습니다. 예를 들어, 인간 배우가 로봇에게 불안정한 동작을 수행했을 때, 시스템은 로봇의 균형을 유지하도록 동작을 조정하여 움직임의 기하학적 형태를 그대로 복사하는 대신 그 '의도'를 재해석했습니다. 이러한 유연성 덕분에 로봇은 크기가 다른 배우를 모방하거나 복잡하고 역동적인 동작을 수행할 때도 안정성과 기능성을 유지할 수 있었습니다.
이 연구는 또한 이중 인코딩 구조의 중요성을 강조했습니다. 연구진이 두 개의 렌즈 중 하나를 제거하여 시스템을 테스트했을 때, 성능은 현저히 떨어졌습니다. 로봇은 움직임의 전체 범위를 포착하는 데 어려움을 겪었으며, 보행의 리드미컬한 안정성을 놓치거나 제스처의 독특한 뉘앙스를 포착하지 못했습니다. 이는 구조적인 파동 형태의 패턴과 비구조적이고 혼란스러운 세부 사항이 완전한 움직임 이해를 위해 모두 필수적임을 확인시켜 주었습니다. 시스템은 이 두 가지 측면을 상호 보완적인 것으로 취급하며, 하나는 토대를 제공하고 다른 하나는 필요한 세부 사항을 추가함으로써 작동합니다.
결국, 이 작업은 로봇이 움직임을 배우는 방식의 변화를 의미합니다. 엔지니어가 인간의 움직임을 로봇 코드로 번역하는 것에 의존하는 대신, 연구진은 로봇이 움직임을 직접 이해할 수 있음을 보여주었습니다. 리드미컬한 패턴을 포착하는 방법과 고유한 변형을 포착하는 방법을 결합함으로써, 그들은 견고하면서도 유연한 시스템을 만들어냈습니다. 연구에 사용된 로봇들은 단순히 스크립트를 따르는 것이 아니라, 움직임의 언어를 해석하고 자신만의 목소리로 말하는 법을 배웠습니다. 이러한 능력은 로봇이 새로운 환경과 과제에 적응하며 새로운 기술을 즉석에서 배울 수 있는 미래를 시사하며, 이는 이전에는 도달하기 어려웠던 자연스러움을 갖춘 모습입니다. 연구진은 이 접근 방식이 관찰을 통한 학습이 드문 예외가 아닌 표준 기능이 되는 차세대 로봇 제어의 견고한 토대를 제공한다고 결론지었습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.