지금까지 로봇이 복잡한 지형을 넘나들게 하려면, 보통 '만능 요리사' 같은 두뇌를 사용했습니다.
특징: 이 요리사는 모든 요리를 혼자 다 합니다. 간단한 스프를 만들든, 복잡한 파스타를 만들든, 모든 재료를 섞어 한 번에 처리합니다.
문제점: 요리가 복잡해지면 (예: 높은 벽을 넘거나 어두운 곳에서 걷기), 이 요리사는 모든 재료를 다 섞느라 시간이 너무 오래 걸리고, 실수도 잦아집니다. 로봇이 넘어지거나 넘어질 뻔하는 경우가 많았습니다.
2. 이 연구의 방식: "전문가 팀" (희소 게이트 혼합 전문가, MoE)
이 연구팀은 로봇의 두뇌를 **'전문가 팀'**으로 바꿨습니다.
구조: 팀에는 16 명의 전문가가 있지만, 매 순간 가장 적합한 4 명만 일합니다.
계단을 오를 때는 '계단 전문가'가 나옵니다.
어두운 길을 걸을 때는 '시야 전문가'가 나옵니다.
점프할 때는 '점프 전문가'가 나옵니다.
핵심 (Conditional Compute): 모든 전문가가 동시에 일하는 게 아니라, 상황에 따라 필요한 사람만 뽑아서 일하게 합니다. 이를 **'희소 (Sparse) 게이트'**라고 합니다.
장점:
빠름: 모든 전문가가 일할 필요가 없으니 계산 속도가 훨씬 빠릅니다.
똑똑함: 각 전문가가 자신의 일에만 집중하므로 훨씬 정교한 동작을 할 수 있습니다.
3. 시뮬레이션 vs 현실 (가상과 실제)
로봇을 실제 세상에 보내기 전에, 컴퓨터 속 가상 세계 (시뮬레이션) 에서 훈련시켰습니다.
문제: 가상 세계의 카메라는 너무 깨끗해서, 실제 로봇에 달린 카메라의 흐릿함이나 잡음을 모방하지 못했습니다.
해결책: 연구팀은 의도적으로 가상 카메라에 '노이즈 (잡음)'를 섞었습니다.
마치 요리사가 연습할 때, 눈가리개를 하거나 손에 기름을 묻히고 요리를 연습하는 것과 같습니다.
이렇게 훈련된 로봇은 실제 세상의 어두운 조명이나 흔들리는 영상에서도 잘 넘어갈 수 있게 되었습니다.
📊 실험 결과: 누가 이겼을까?
연구팀은 Unitree Go2 라는 실제 4 발 로봇을 가지고 32cm 높이의 상자 (로봇 키의 80% 에 달하는 높은 장애물) 를 넘기는 실험을 했습니다.
기존 만능 요리사 (MLP):
같은 양의 '두뇌'를 썼을 때: 5 번 시도 중 5 번 실패 (아예 못 넘음).
두뇌를 엄청나게 키웠을 때: 10 번 시도 중 9 번 성공했지만, 로봇이 넘어질 뻔하며 허둥지둥하는 모습이 많았습니다. 또한, 계산 속도가 14.3% 나 느려졌습니다.
전문가 팀 (MoE):
10 번 시도 중 10 번 성공! (완벽한 성공률)
로봇이 넘어질 뻔하는 일도 거의 없었고, 훨씬 매끄럽게 넘어갔습니다.
계산 속도도 기존 방식보다 빨랐습니다.
💡 왜 이런 결과가 나왔을까? (전문가들의 비밀)
연구팀은 로봇이 넘어가는 과정을 분석해보니 재미있는 사실을 발견했습니다.
주기적인 전문성: 로봇이 걷거나 뛰는 것은 리듬이 있습니다. (발이 땅에 닿았다가 떨어지는 순환).
결과: '전문가 팀' 중 일부는 리듬의 특정 순간에만 집중했습니다. 예를 들어, "발이 공중에 있을 때" 담당하는 전문가와 "발이 땅에 닿을 때" 담당하는 전문가가 따로 있는 것입니다.
시각의 중요성: 특히 '깊이 (Depth)' 정보를 보는 전문가가 매우 중요한 역할을 했으며, 이 전문가가 어두운 환경이나 복잡한 장애물을 넘을 때 핵심이 되었습니다.
🚀 결론: 왜 이것이 중요한가?
이 연구는 **"로봇이 더 똑똑하고 빠르게 움직이려면, 두뇌를 무조건 크게 만드는 것보다, 상황에 따라 필요한 전문가만 뽑아 쓰는 것이 더 효율적이다"**라는 것을 증명했습니다.
효율성: 같은 성능을 내더라도 계산 비용 (시간) 을 아낄 수 있습니다.
확장성: 앞으로 더 복잡한 지형이나 더 많은 기술을 가르쳐도, 전문가 팀을 늘려서 유연하게 대응할 수 있습니다.
마치 **"한 명의 천재 요리사에게 모든 요리를 시키는 것보다, 각 요리에 특화된 요리사들이 팀을 이루어 일하는 것이 더 빠르고 맛있는 요리를 만든다"**는 것과 같은 원리입니다. 이 기술은 향후 구조 활동이나 화성 탐사 등 위험하고 복잡한 환경에서 로봇이 활약하는 데 큰 도움이 될 것입니다.
1. 문제 정의 (Problem Definition)
배경: 4 족 보행 로봇 (Quadruped) 이 복잡한 지형 (계단, 큰 장애물 등) 을 이동하는 '파쿠르 (Parkour)'는 로봇 공학의 중요한 벤치마크입니다. 기존 접근법은 주로 강화학습 (RL) 을 사용하지만, 행동자 (Actor) 네트워크로 **밀집된 (Dense) 다층 퍼셉트론 (MLP)**을 주로 사용합니다.
한계:
기존 MLP 아키텍처는 모든 파라미터를 활성화하여 추론 (Inference) 을 수행하므로, 성능을 높이기 위해 모델 크기를 키우면 계산 비용이 비례하여 급증합니다.
시뮬레이션과 실제 환경 (Sim-to-Real) 간의 차이, 특히 깊이 (Depth) 카메라 입력의 노이즈와 불확실성을 처리하는 데 한계가 있습니다.
대규모 언어 모델 (LLM) 분야에서 성공적으로 적용된 희소 게이트 혼합 전문가 (Sparsely Gated Mixture of Experts, MoE) 아키텍처가 로봇 제어 분야, 특히 비전 기반 파쿠르에는 적용되지 않았습니다.
2. 방법론 (Methodology)
이 논문은 비전 기반 4 족 보행 로봇 파쿠르를 위해 희소 게이트 MoE 아키텍처를 도입하고, 이를 강화학습과 결합한 새로운 프레임워크를 제안합니다.
가. 두 단계 학습 전략 (Two-Phase Training)
Phase 1 (시뮬레이션, 교사 모델):
입력: proprioception (관절 각도, 속도 등) + Privileged Information (중심 질량, 마찰 계수, 모터 강도, 스캔 도트 높이 지도 등).
목표: privileged 정보를 활용하여 학습 속도를 높이고 안정적인 정책을 학습합니다.
아키텍처: MoE Actor 와 Critic 을 PPO(Proximal Policy Optimization) 로 학습합니다.
Phase 2 (시뮬레이션, 학생 모델 및 실제 배포 준비):
입력: Phase 1 의 privileged 정보를 **추정 (Estimation)**으로 대체합니다.
깊이 이미지 (Depth Image) 를 GRU(Gated Recurrent Unit) 를 통해 인코딩하여 높이 지도와 요 (Yaw) 각도를 추정합니다.
관성 측정 데이터 (Proprioception) 를 통해 물리 속성 (마찰, 질량 등) 과 선형 속도를 추정합니다.
목표: 실제 로봇에 배포 가능한 모델로 정제합니다.
나. 희소 게이트 혼합 전문가 (Sparsely Gated MoE) 아키텍처
구조: 3 개의 순차 레이어 중 중간 레이어를 MoE 로 구성합니다.
Gate: 입력 x에 대해 n개의 전문가 (Expert) 중 상위 k개만 선택합니다 (Top-k gating).
Conditional Compute: 추론 시 전체 파라미터가 아닌 선택된 전문가의 파라미터만 활성화되어 계산 효율성을 높입니다.
다양성 유도: 특정 전문가만 집중되는 것을 방지하기 위해 **부하 균형 손실 (Load Balancing Loss)**을 추가하여 전문가들의 활용도를 균등하게 분배합니다.
입력 처리: 깊이 이미지의 노이즈를 시뮬레이션하기 위해 컨투어 (Contour), 아티팩트 (Artifact), 가우시안 블러 등을 적용한 전처리 파이프라인을 구축하여 Sim-to-Real 격차를 줄였습니다.
다. 하드웨어 및 환경
로봇: Unitree Go2 (Intel Realsense D435f 깊이 카메라 탑재).
장애물: 로봇 키의 80% 에 해당하는 32cm 박스, 좁은 통로, 다양한 높이와 형태의 장애물.
3. 주요 기여 (Key Contributions)
비전 기반 파쿠르를 위한 MoE 프레임워크: 대규모 언어 모델의 MoE 기술을 로봇 제어에 처음 적용하여, 제한된 추론 파라미터 수 내에서 성능을 확장하는 방법을 제시했습니다.
깊이 카메라 통합: 깊이 이미지를 GRU 를 통해 인코딩하고, 이를 MoE Actor 에 통합하여 복잡한 지형 인식 능력을 강화했습니다.
실제 환경에서의 검증: 실험실 조건을 벗어난 야외 (스케이트 파크 등) 환경에서도 Unitree Go2 를 통해 성공적인 파쿠르 수행을 입증했습니다.
전문가 전문화 (Specialization) 분석: 보행의 주기적 (Cyclical) 특성으로 인해 특정 전문가들이 보행 주기의 특정 단계에 특화됨을 발견하고, 깊이 정보에 민감한 전문가가 존재함을 분석했습니다.
4. 실험 결과 (Results)
성능 비교 (32cm 박스 장애물 통과):
MoE 정책: 10 회 시도 중 10 회 성공 (100%).
기존 MLP (동일 추론 파라미터 수): 10 회 시도 중 5 회 성공 (50%).
기존 MLP (MoE 전체 파라미터 수와 동일): 10 회 시도 중 9 회 성공. MoE 와 유사한 성능을 내지만, 계산 시간이 14.3% 더 오래 걸렸습니다.
결론: MoE 는 동일한 계산 비용 (추론 시 활성화 파라미터) 으로 기존 MLP 대비 2 배의 성공률을 달성했습니다.
계산 효율성:
MoE 는 전체 파라미터 수는 많지만, 추론 시 활성화되는 파라미터는 적어 MLP 대비 효율적인 확장이 가능합니다.
Batch size 6000 기준, MoE 는 동등한 성능의 대형 MLP 보다 14.3% 빠른 추론 속도를 보였습니다.
Ablation Study:
노이즈 (Noise): 관측치에 가우시안 노이즈를 추가하는 것이 Sim-to-Real 격차 해소에 필수적이었습니다. 노이즈가 없는 정책은 실제 환경에서 실패했습니다.
정규화된 온라인 적응 (ROA): 환경 물리 속성 (마찰, 질량 등) 을 추정하는 ROA 가 없으면 장애물 통과가 불가능했습니다.
5. 의의 및 결론 (Significance & Conclusion)
성능과 효율성의 트레이드오프 해결: MoE 아키텍처는 로봇 제어 정책의 확장성 (Scalability) 을 높여주면서도, 추론 시의 계산 비용을 최적화하는 이상적인 균형을 제공합니다.
비전 기반 복잡한 지형 이동의 새로운 패러다임: 기존 MLP 기반 접근법의 한계를 넘어, 희소성 (Sparsity) 을 활용한 조건부 계산이 로봇의 복잡한 동적 작업 (파쿠르) 에 효과적임을 입증했습니다.
미래 작업: 전문가들의 특화 메커니즘을 더 명확하게 설계하고, 다양한 아키텍처를 통해 장애물 유형이나 보행 주기 단계에 따른 전문가 할당을 최적화하는 연구가 필요합니다.
이 논문은 로봇이 시각 정보를 기반으로 매우 역동적이고 위험한 지형을 이동할 때, MoE 를 활용하여 더 똑똑하면서도 더 빠른 제어 정책을 학습할 수 있음을 보여주는 중요한 연구입니다.