Toward Hardware-Agnostic Quadrupedal World Models via Morphology Conditioning
이 논문은 로봇의 물리적 구조 (형태) 를 명시적으로 조건으로 부여하여 환경 역학과 로봇의 형태를 분리함으로써, Boston Dynamics Spot 나 Unitree Go1 등 서로 다른 4 족 보행 로봇 간 제로샷 (zero-shot) 일반화를 가능하게 하는 새로운 형태의 세계 모델 (QWM) 을 제안합니다.
원저자:Mohamad H. Danesh, Chenhao Li, Amin Abyaneh, Anas Houssaini, Kirsty Ellis, Glen Berseth, Marco Hutter, Hsiu-Chin Lin
🤖 핵심 아이디어: "로봇용 뇌 (세계 모델) 를 하나만 만들어서 모든 로봇에게 적용하자!"
지금까지 로봇을 조종하는 AI 는 로봇의 몸체 (하드웨어) 에 딱 맞춰서 훈련되었습니다.
예시: 큰 개처럼 생긴 로봇 (Spot) 으로 훈련된 AI 는 작은 개처럼 생긴 로봇 (Go1) 에게 적용하면 완전히 망가집니다. 다리 길이나 무게가 조금만 달라져도 AI 는 "내가 누구지? 어떻게 움직여야 하지?"라고 혼란을 겪으며 넘어집니다.
문제점: 로봇을 하나 바꿀 때마다 AI 를 처음부터 다시 훈련시켜야 해서 시간과 비용이 너무 많이 듭니다.
이 논문은 **"로봇의 몸체 정보 (다리 길이, 무게 등) 를 AI 에게 미리 알려주면, 하나의 AI 가 어떤 로봇이든 즉시 조종할 수 있다"**는 것을 증명했습니다.
🎨 쉬운 비유: "운전면허와 자동차"
이 기술이 어떻게 작동하는지 운전에 비유해 볼까요?
1. 기존 방식 (기존의 문제점)
상황: A 라는 사람이 트럭 운전만 배웠다고 칩시다.
문제: 갑자기 A 가 스쿠터를 타게 되면? 트럭을 운전할 때의 습관 (무게가 무거우니 천천히 브레이크를 밟는다 등) 이 그대로 적용되어 스쿠터는 넘어집니다.
해결책: 트럭 운전사 A 는 스쿠터 운전을 배우기 위해 다시 0 번부터 훈련을 받아야 합니다. (로봇마다 AI 를 새로 훈련시키는 것)
2. 이 논문의 방식 (QWM - Quadrupedal World Model)
새로운 접근: A 는 "운전의 원리 (중력, 마찰력, 관성)"를 배웁니다. 그리고 운전할 때 어떤 차를 타는지 (트럭인지, 스쿠터인지) 를 미리 알려줍니다.
작동 원리:
AI 는 "아, 지금 트럭을 타고 있구나. 무게가 무거우니 가속을 천천히 해야지."라고 생각합니다.
다음엔 "아, 지금 스쿠터를 타고 있구나. 가볍고 빠르니 급정거를 조심해야지."라고 생각합니다.
핵심: AI 는 차의 종류를 직접 눈으로 보고 추측하는 게 아니라, 운전자가 "지금 트럭이야"라고 말해주면 (명시적 조건부) 바로 그 상황에 맞춰 운전합니다.
결과: A 는 트럭, 스쿠터, 자전거, 비행기 등 아직 타본 적 없는 새로운 차량을 처음 타더라도, "이건 어떤 차인가?"만 알려주면 즉시 (Zero-shot) 안전하게 운전할 수 있습니다.
🛠️ 이 논문이 어떻게 해결했나요? (세 가지 핵심 기술)
이 논문은 로봇의 몸체 정보를 AI 에게 어떻게 주입했는지 세 가지 방법을 소개합니다.
로봇의 설계도 읽기 (Physical Morphology Encoder)
로봇의 설계도 (USD 파일) 에서 "다리 길이", "무게", "관절 모양" 같은 숫자 정보를 뽑아냅니다.
마치 운전자가 "내 차는 트럭이고, 바퀴는 10 개야"라고 AI 에게 말해주는 것과 같습니다.
뇌의 두 부분 나누기 (Dual-Tower Architecture)
AI 의 뇌를 두 부분으로 나눕니다.
동적 부분: "지금 발이 땅에 닿았나?", "속도는 얼마인가?" 같은 변하는 정보를 처리.
정적 부분: "내 다리는 1 미터야", "무게는 50kg 이야" 같은 고정된 정보를 처리.
이렇게 나누면 AI 가 고정된 정보를 매번 다시 기억할 필요가 없어져서, 변하는 상황에 더 빠르게 반응할 수 있습니다.
점수 체계 맞추기 (Adaptive Reward Normalization)
로봇마다 점수 (보상) 기준이 다릅니다. 큰 로봇은 100 점, 작은 로봇은 10 점으로 점수를 줘야 할 수도 있습니다.
AI 가 큰 로봇의 점수만 보고 학습하면 작은 로봇을 망가뜨릴 수 있습니다.
이 기술은 로봇마다 점수 기준을 자동으로 맞춰주어, AI 가 어떤 로봇이든 공평하게 학습하도록 도와줍니다.
🚀 실제 성과는 어땠나요?
시뮬레이션: 훈련에 쓰지 않았던 새로운 로봇 7 종 중 6 종은 처음 보는 로봇임에도 불구하고, 한 번도 훈련하지 않고 (Zero-shot) 바로 걷는 데 성공했습니다.
실제 로봇 (Real World): 시뮬레이션에서 훈련된 AI 를 실제 로봇 (Unitree Go1, ANYmal-D) 에 바로 적용했습니다.
결과: 로봇이 넘어지거나 조정 불능이 되는 일 없이, 즉시 안정적인 보행을 했습니다.
의미: 로봇을 바꿀 때마다 수백 번의 실패와 재훈련을 거칠 필요 없이, 설계도만 바꾸면 바로 작동합니다.
💡 결론: 왜 이것이 중요한가요?
이 논문은 **"하나의 AI 가 모든 로봇을 조종할 수 있는 시대의 시작"**을 알립니다.
과거: 로봇을 바꿀 때마다 AI 를 다시 만들어야 함 (시간, 비용 낭비).
미래: 로봇의 몸체 정보만 입력하면, 하나의 AI 가 어떤 로봇이든 즉시 적응하여 작동.
마치 운전면허를 한 번 따면, 차종이 바뀌어도 운전할 수 있는 것과 같습니다. 이 기술은 로봇이 우리 삶에 더 다양하고 빠르게 들어오기 위한 핵심 열쇠가 될 것입니다.
논문 제목: Toward Hardware-Agnostic Quadrupedal World Models via Morphology Conditioning (형태 조건화를 통한 하드웨어 중립적인 4 족 보행 세계 모델 구축)
이 논문은 강화 학습 (RL) 기반의 로봇 제어에서 발생하는 '하드웨어 로터티 (Hardware Lottery)' 문제를 해결하기 위해, 다양한 4 족 로봇의 물리적 구조 (형태, Morphology) 에 구애받지 않고 일반화될 수 있는 **Quadrupedal World Model (QWM)**을 제안합니다. 기존 세계 모델 (World Models) 은 특정 로봇의 동역학에 과적합되어 다른 로봇으로의 전이가 어렵거나, 새로운 로봇에 적용하기 위해 다시 학습해야 하는 한계가 있었습니다. 본 연구는 로봇의 공학적 사양을 명시적으로 조건화 (Conditioning) 함으로써 이를 극복하고, 제로샷 (Zero-shot) 환경에서 새로운 로봇에 대한 제어 정책을 즉시 배포할 수 있는 프레임워크를 제시합니다.
1. 문제 정의 (Problem)
하드웨어 종속성: 기존 세계 모델 (예: DreamerV3) 은 훈련된 특정 로봇의 운동학적 및 동역학적 속성에 깊게 과적합되어 있습니다. 예를 들어, Boston Dynamics Spot 에서 훈련된 모델은 Unitree Go1 에서 완전히 실패합니다.
암묵적 시스템 식별의 한계: 기존 다중 작업 학습 방법들은 로봇의 질량이나 다리 길이와 같은 물리적 속성을 행동 히스토리 (관찰 데이터) 를 통해 **암묵적으로 추론 (Implicit System Identification)**하려 합니다.
적응 지연 (Adaptation Lag): 로봇이 자신의 물리적 특성을 파악하기 위해 충분한 상호작용 데이터를 모으기 전까지는 비효율적이거나 위험한 행동을 할 수 있습니다.
잠재 공간의 얽힘 (Entanglement): 정적인 물리 속성과 동적인 상태 (속도, 자세 등) 를 하나의 잠재 상태에 모두 인코딩해야 하므로 표현 용량 (Capacity) 이 부족해지거나 간섭이 발생합니다.
데이터 비효율성: 로봇의 모터나 다리 길이가 조금만 변경되어도 새로운 모델을 처음부터 학습해야 하므로 막대한 데이터와 시간이 소요됩니다.
2. 방법론 (Methodology)
저자들은 **QWM (Quadrupedal World Model)**을 제안하며, 이는 DreamerV3 아키텍처를 기반으로 하되 다음과 같은 핵심 혁신을 도입했습니다.
A. 명시적 형태 인코딩 (Explicit Morphology Encoding)
Physical Morphology Encoder (PME): 로봇의 USD(Unified Scene Description) 또는 URDF 파일에서 추출한 정적인 물리적 파라미터 (다리 길이, 질량 분포, 토크 밀도, 관절 토폴로지 등) 를 **명시적인 벡터 (μ)**로 인코딩합니다.
특징: 이 벡터는 로봇의 고유한 물리적 특성을 나타내며, 학습 과정에서 관찰 히스토리가 아닌 사전에 알려진 공학적 사양으로 제공됩니다. 이는 모델이 정적 특성을 추론할 필요가 없게 하여, 잠재 공간이 동역학 학습에 집중할 수 있게 합니다.
B. 형태 조건화된 세계 모델 (Morphology-Conditioned WM)
이중 타워 인코더 (Dual-Tower Encoder): 고주파수 프로리오셉션 (관절 각도, 속도 등) 과 저주파수 정적 형태 벡터 (μ) 를 별도의 경로를 통해 처리한 후 융합합니다. 이는 정적 신호가 동적 데이터에 의해 묻히는 것을 방지합니다.
재귀적 조건화 (Recurrent Conditioning): 상태 전이 함수 ht=fϕ(ht−1,zt−1,at−1,μ)에 각 시간 단계마다 μ를 명시적으로 주입합니다.
효과: RNN 은 로봇의 물리적 특성을 기억할 필요가 없어지고, 오직 동적 상태 (속도, 접촉 타이밍 등) 만 추적하면 되므로 **동적 상태와 정적 형태의 분리 (Disentanglement)**가 성공적으로 이루어집니다.
C. 적응형 보상 정규화 (Adaptive Reward Normalization, ARN)
서로 다른 로봇은 물리적 스케일과 보상 함수의 정의가 달라 보상 값의 범위가 크게 다릅니다 (예: Spot 은 350, ANYmal 은 25).
ARN: 각 로봇 유형별로 지수 이동 평균 (EMA) 을 사용하여 5 백분위수와 95 백분위수를 추적하고, 이를 기반으로 보상을 동적으로 정규화합니다. 이는 특정 로봇의 보상이 학습을 지배하는 것을 방지하고 안정적인 다중 로봇 학습을 가능하게 합니다.
3. 주요 기여 (Key Contributions)
하드웨어 중립적 세계 모델: 단일 모델로 다양한 4 족 로봇 (ANYmal, Unitree, Boston Dynamics Spot 등) 의 보행을 학습하고 제어할 수 있는 최초의 프레임워크를 제시했습니다.
제로샷 전이 (Zero-Shot Transfer): 훈련 데이터에 포함되지 않은 새로운 로봇 (예: 훈련 중 제외된 ANYmal-D 또는 Unitree Go1) 에 대해, 실제 상호작용 없이 해당 로봇의 USD 에서 추출한 μ만 주입하면 즉시 안정적인 보행 제어가 가능합니다.
명시적 조건화의 효과 입증: 암묵적 추론 방식보다 명시적 물리 파라미터 조건화가 적응 지연을 제거하고 샘플 효율성을 극대화함을 실험적으로 증명했습니다.
실제 로봇 배포 성공: 시뮬레이션에서 학습된 정책을 실제 하드웨어 (ANYmal-D, Unitree Go1) 에 직접 배포하여, 미세 조정 (Fine-tuning) 없이도 안정적인 보행을 성공적으로 수행했습니다.
4. 실험 결과 (Results)
다양한 로봇 Mastery: 7 종의 이질적인 로봇 (ANYmal B/C/D, Unitree A1/Go1/Go2/B2, Spot) 을 동시에 훈련시켰을 때, QWM 은 기존 WM 기반 베이스라인 (DreamerV3, PWM 등) 보다 훨씬 빠른 수렴 속도와 높은 안정성을 보였습니다.
장기 예측 정확도: QWM 은 다양한 로봇에 대해 45 스텝 이상의 장기 시뮬레이션 (Open-loop rollout) 에서 물리 엔진과 높은 일치도를 보이며, 동역학이 발산되지 않았습니다.
제로샷 일반화:
보간 (Interpolation): 훈련 분포 내에 있는 로봇 (Go1, ANYmal-D) 에 대해서는 전문적으로 훈련된 PPO 모델과 유사한 성능을 보였습니다.
외삽 (Extrapolation): 훈련 분포와 거리가 먼 로봇 (Unitree B2, 매우 무거움) 에서는 성능이 저하되었으나, 이는 모델이 훈련 데이터의 지지 영역 (Support) 내에서만 작동한다는 한계를 보여줍니다.
실제 로봇 배포: 시뮬레이션에서 학습된 정책을 실제 로봇에 적용했을 때, ANYmal-D 와 Unitree Go1 모두에서 넘어짐 없이 (0/10 falls) 안정적인 보행을 수행했습니다.
5. 의의 및 결론 (Significance)
이 연구는 로봇 강화 학습의 패러다임을 **'하드웨어 특화 전문가'**에서 **'물리 기반의 일반화 전문가'**로 전환하는 중요한 걸음을 내디뎠습니다.
안전성: 새로운 로봇에 적용할 때 위험한 '워밍업 (Warm-up)' 기간이나 실제 환경에서의 위험한 탐색을 불필요하게 합니다.
확장성: 로봇의 하드웨어가 변경되거나 이종 군집 (Heterogeneous Fleet) 을 운영할 때, 매번 모델을 다시 학습할 필요가 없어집니다.
미래 전망: 이 프레임워크는 보행 로봇을 넘어 다양한 형태의 articulated rigid body (이족 보행, 매니퓰레이터 등) 로 확장 가능하며, 향후 시각 정보 통합 및 GNN/Transformer 기반의 더 강력한 아키텍처로 발전할 수 있는 기반을 마련했습니다.
요약하자면, QWM은 로봇의 정적인 물리적 사양을 명시적으로 모델에 입력함으로써, 동역학 학습과 형태 식별을 분리하고, 이를 통해 어떤 4 족 로봇이든 즉시 제어할 수 있는 범용 세계 모델을 실현했습니다.