← 최신 논문
⚡ electrical engineering

HuMam: Humanoid Motion Control via End-to-End Deep Reinforcement Learning with Mamba

HuMam은 단일 레이어 Mamba 인코더를 활용하여 로봇 상태를 발걸음 목표 및 위상 클록과 융합함으로써 JVRC-1 로봇에서 피드포워드 베이스라인 대비 우수한 훈련 안정성, 효율성 및 에너지 절감을 달성하는 휴머노이드 보행을 위한 상태 중심 엔드 투 엔드 강화 학습 프레임워크이다.

원저자: Yinuo Wang, Yuanyang Qi, Jinzhao Zhou, Pengxiang Meng, Xiaowen Tao

게시일 2026-06-02
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yinuo Wang, Yuanyang Qi, Jinzhao Zhou, Pengxiang Meng, Xiaowen Tao

원본 논문은 CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/)에 따라 공공 도메인에 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

핵심 아이디어: "과하게 생각하지 않고" 걷는 법을 배우는 로봇

당신이 로봇에게 걷는 법을 가르치고 있다고 상상해 보세요. 이 로봇은 두 다리와 몸통, 그리고 다리에 12개의 관절을 가지고 있습니다. 제대로 걷기 위해서는 무게 중심을 잡고, 지면의 반응에 대응하며, 정해진 경로를 따라가면서 이 모든 관절을 완벽하게 조절해야 합니다.

보통 로봇에게 이 기술을 가르칠 때는, 현재 상황을 보고 다음에 무엇을 할지 결정하는 "두뇌"(신경망)를 사용합니다. 문제는 이러한 두뇌들이 너무 단순해서(중요한 세부 사항을 놓치거나) 혹은 너무 무겁고 느려서(실행하는 데 너무 많은 컴퓨터 자원을 소모하는) 문제가 발생한다는 점입니다.

이 논문의 저자들은 HuMam이라는 새로운 두뇌를 만들었습니다. 그 비결은 무엇일까요? 바로 Mamba라는 새로운 유형의 AI 아키텍처를 사용한 것입니다.

비유: "똑똑한 지휘자" vs "혼란스러운 오케스트라"

로봇의 몸을 12개의 서로 다른 악기(다리 관절)가 있는 오케스트라라고 생각해 보세요.

  • 기존 방식 (베이스라인): 지휘자(AI)가 악보를 보기는 하지만, 방금 연주한 음표를 잊어버립니다. 오직 현재의 순간만을 바탕으로 다음 음표를 추측하려 합니다. 그러다 보니 가끔 리듬을 놓치고, 오케스트라는 휘청거리며, 로봇은 넘어집니다.
  • HuMam 방식: 이 지휘자는 Mamba 시스템을 사용합니다. 이 지휘자는 단순히 음악을 이끄는 것을 넘어, 음악의 '흐름'을 완벽하고 즉각적으로 기억하는 지휘자입니다. 매번 노래의 처음부터 다시 읽을 필요가 없습니다. 지난 음표가 다음 음표와 어떻게 연결되는지 정확히 알고 있습니다. 덕분에 로봇은 서투른 보행자가 아니라, 마치 무용수처럼 부드럽게 움직일 수 있습니다.

무엇이 HuMam을 특별하게 만드는가?

1. "가벼운" 두뇌 (Mamba)

이 논문은 Mamba 아키텍처가 휴머노이드 로봇의 보행 제어에 사용된 첫 번째 사례라고 주장합니다.

  • 비유: 마라톤을 뛰면서 무거운 배낭(복잡한 AI 모델)을 메고 달린다고 상상해 보세요. 속도가 느려질 것입니다. HuMam은 "Mamba" 레이어를 사용하는데, 이는 마치 깃털처럼 가볍고 최첨단 기술이 적용된 배낭과 같습니다. 필요한 모든 정보를 담고 있지만 무게는 거의 느껴지지 않습니다. 덕분에 로봇은 더 빠르게 생각하고 더 적은 배터리 전력을 사용할 수 있습니다.

2. "6가지 항목의 성적표" (보상 설계)

컴퓨터는 로봇이 옳은 행동을 했을 때 점수(보상)를 줍니다. 저자들은 다음과 같은 6가지 항목으로 구성된 특정 "성적표"를 만들었습니다.

  1. 쿵쾅거리지 않기: 발을 지면에 부드럽게 디딜 것.
  2. 부드럽게 흔들기: 다리를 격하게 차거나 휘두르지 말 것.
  3. 목표 지점 맞추기: 계획한 위치에 정확히 발을 내디딜 것.
  4. 자세 바로잡기: 머리를 들고 등을 곧게 펼 것.
  5. 적정 높이 유지하기: 너무 낮게 웅크리거나 너무 높게 서지 말 것.
  6. 흔들림 방지: 상체를 안정적으로 유지할 것.

로봇은 이 성적표에서 가장 높은 점수를 받기 위해 노력합니다. Mamba 두뇌는 이 점들을 연결하는 능력이 매우 뛰어나기 때문에, 로봇은 어느 하나를 희생하지 않고도 이 여섯 가지 목표를 동시에 균형 있게 학습할 수 있습니다.

결과: 더 빠르고, 더 부드럽고, 더 친환경적인

연구진은 가상 로봇인 JVRC-1을 사용하여 컴퓨터 시뮬레이션에서 HuMam을 테스트했습니다. 이들은 Mamba를 사용하지 않은 일반적인 로봇 두뇌(베이스라인)와 비교 실험을 진행했습니다. 결과는 다음과 같았습니다.

  • 더 빠른 학습: HuMam은 훨씬 빠르게 걷는 법을 배웠습니다. 동일한 숙련도에 도달하기 위해 기존 로봇보다 13%에서 42% 더 적은 연습 횟수가 필요했습니다.
    • 비유: 기존 로봇이 걷는 법을 익히기 위해 100시간의 연습이 필요했다면, HuMam은 단 60시간만 있으면 되었습니다.
  • 더 높은 안정성: 기존 로봇의 학습은 "들쑥날쑥"했습니다. 잘하다가도 갑자기 못해지는 경우가 있었습니다. 반면 Hu함은 일관적이었습니다.
    • 비유: 기존 로봇은 어떤 날은 시험을 잘 보고 어떤 날은 낙제하는 학생과 같았습니다. HuMam은 매번 A를 받는 학생과 같았습니다.
  • 에너지 효율성: 이것은 매우 중요한 부분입니다. HuMam은 같은 거리를 걷는 데 더 적은 전기를 사용했습니다.
    • 비유: 기존 로봇은 엔진 소리를 크게 내며 기름을 많이 쓰는 SUV와 같습니다. HuMam은 조용히 미끄러지듯 가는 하이브리드 자동차와 같습니다. "제자리 서 있기" 테스트에서 HuMam은 단순히 서 있는 데에도 39% 적은 전력을 사용했습니다.
  • 부드러운 관절 움직임: 로봇의 관절(엉덩이, 무릎, 발목)이 덜 급격한 힘으로 움직였습니다.
    • 비유: 기존 로봇의 관절이 녹슨 경첩 소리를 냈다면, HuMam의 관절은 잘 기름칠 된 문처럼 부드러웠습니다.

결론

이 논문은 새로운 "Mamba" 두뇌를 사용함으로써, 다음과 같은 로봇 컨트롤러를 만들었다고 주장합니다.

  1. 더 가볍고 (컴퓨터 자원을 적게 사용함)
  2. 더 똑똑하며 (더 빠르고 일관되게 학습함)
  3. 더 친환경적임 (에너지를 덜 사용함)

그들은 반드시 거대하고 무거운 컴퓨터 두뇌가 있어야만 로봇이 잘 걸을 수 있는 것은 아니라는 점을 성공적으로 증명했습니다. 때로는 가볍고 효율적인 "Mamba" 두뇌만으로도 로봇이 방 안을 멋지게 춤추며 가로지르게 만들기에 충분합니다.

참고: 이 논문은 전적으로 컴퓨터 시뮬레이션(가상 로봇)에 초점을 맞추고 있습니다. 아직 실제 물리적인 로봇에 테스트했다는 주장은 없으나, 이를 향후 연구 과제로 언급하고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →