MoWM: Mixture-of-World-Models for Embodied Planning via Latent-to-Pixel Feature Modulation
MoWM은 동작 중심의 잠재 공간(Latent space) 표현과 세밀한 픽셀 공간(Pixel space) 표현을 결합한 혼합 세계 모델(Mixture-of-World-Models) 프레임워크를 통해, 로봇의 정밀한 조작과 일반화 성능을 극대화한 임바디드 플래닝(Embodied Planning) 연구입니다.
원저자:Yangcheng Yu, Xin Jin, Yu Shang, Xin Zhang, Haisheng Su, Wei Wu, Yong Li
정밀한 시력: 물건의 모서리가 어디인지, 손가락이 어디에 닿아야 하는지 아주 자세히 보는 능력 (픽셀 기반 모델)
흐름을 읽는 직관: "내가 이 물건을 밀면 저쪽으로 굴러가겠구나!"라고 움직임의 원리를 아는 능력 (잠재 공간 기반 모델)
그런데 기존 로봇들은 이 두 가지 중 하나가 부족했습니다.
비디오 생성 모델(시력파): 눈은 엄청나게 좋아서 화면을 아주 선명하게 그려내지만, 배경의 불필요한 정보(벽지 무늬, 조명 등)까지 너무 자세히 보느라 정작 "어떻게 움직여야 하는지"에 대한 핵심 정보(움직임의 흐름)를 놓치곤 했습니다. 마치 너무 화려한 영화를 보느라 주인공의 다음 동작을 놓치는 관객과 같죠.
잠재 모델(직관파): 움직임의 원리는 잘 알지만, 너무 요약해서 생각하다 보니 "정확히 몇 밀리미터(mm)를 움직여야 하는지" 같은 세밀한 디테일이 부족했습니다. 마치 줄거리만 대충 아는 사람과 같아서, 정작 중요한 디테일한 액션은 못 하는 거죠.
💡 MoWM의 해결책: "천재 화가와 베테랑 감독의 만남"
이 논문에서 제안한 **MoWM(Mixture-of-World-Models)**은 이 두 가지 모델을 하나로 합친 **'하이브리드 팀'**입니다.
비유하자면, 로봇에게 **'엄청나게 눈이 좋은 화가'**와 **'액션 연출의 귀재인 감독'**을 동시에 붙여준 것입니다.
화가(Pixel-WM): "지금 눈앞에 보이는 물건의 모양과 색깔은 이래요!"라며 아주 선명한 그림을 그려줍니다. (디테일 담당)
감독(Latent-WM): "자, 이제 이 물건을 밀면 이렇게 움직일 거야. 배경은 신경 쓰지 말고 움직임에만 집중해!"라며 핵심적인 움직임의 흐름을 짚어줍니다. (움직임/직관 담당)
MoWM은 이 둘의 정보를 섞습니다. 감독이 "이 부분이 중요해!"라고 짚어준 정보를 바탕으로, 화가가 그린 그림에서 불필요한 배경 정보는 걷어내고 **'동작에 꼭 필요한 핵심 디테일'**만 골라내어 로봇의 뇌에 전달합니다.
🏆 결과: "더 멀리, 더 정확하게!"
이 '환상의 팀워크' 덕분에 로봇은 다음과 같은 놀라운 성과를 냈습니다.
장기 계획 능력: 단순히 눈앞의 동작만 하는 게 아니라, "옷을 접는다"처럼 여러 단계가 필요한 복잡한 일을 끝까지 성공적으로 해냅니다. (마치 영화의 결말까지 완벽하게 설계하는 감독처럼요!)
실전 능력: 가상 세계(시뮬레이션)뿐만 아니라, 실제 로봇 팔을 이용해 '티셔츠를 직사각형으로 접는' 아주 까다롭고 섬세한 작업도 성공했습니다.
적응력: 한 번도 가보지 않은 새로운 환경에서도 당황하지 않고 물건을 잘 다룹니다.
📝 요약하자면?
**"너무 자세해서 정신없던 시각 정보에, 핵심 움직임을 짚어주는 직관을 더해, 로봇이 복잡한 일을 끝까지 완벽하게 해내도록 만든 기술"**이라고 할 수 있습니다!
[기술 요약] MoWM: 잠재-픽셀 특징 변조를 통한 로봇 행동 계획용 혼합 월드 모델
1. 문제 정의 (Problem Statement)
로봇의 임바디드 행동 계획(Embodied Action Planning)은 시각적 관찰과 언어 지시를 바탕으로 정밀한 동작을 생성해야 하는 핵심 과제입니다. 기존의 월드 모델(World Model) 기반 방식은 크게 두 가지 한계가 있습니다.
픽셀 기반 비디오 생성 모델 (Pixel-based Video Models): 미세한 시각적 디테일을 잘 보존하지만, 행동 결정과 무관한 배경 정보나 정적인 픽셀 데이터 등 **시각적 중복성(Visual Redundancy)**이 너무 커서 동작 디코딩을 방해하고 일반화 성능을 떨어뜨립니다.
잠재 공간 기반 모델 (Latent-space Models): 압축된 특징 공간에서 동작의 흐름(Motion)을 잘 포착하지만, 정보가 너무 압축되어 정밀한 조작(Manipulation)에 필요한 **미세한 공간적 디테일(Fine-grained details)**을 놓치기 쉽습니다.
2. 제안 방법론 (Methodology)
본 논문은 두 모델의 장점을 결합한 MoWM(Mixture-of-World-Models) 프레임워크를 제안합니다. 이 모델은 픽셀 공간의 정밀함과 잠재 공간의 움직임 인지 능력을 동시에 활용합니다.
[2단계 학습 구조]
1단계: 개별 월드 모델 사전 학습 (Pre-training Stage)
Pixel-WM: Stable Video Diffusion(SVD)을 기반으로 하여, 텍스트 지시에 따라 미래의 비디오 프레임을 생성하도록 학습합니다. (시각적 디테일 담당)
Latent-WM: V-JEPA의 ViT-g 인코더와 Transformer를 사용하여 압축된 잠재 공간 내에서 미래의 상태 전이를 예측하도록 학습합니다. (동적 움직임 담당)
2단계: 특징 변조 및 행동 계획 (Integration & Planning Stage)
특징 융합 (Feature Fusion): Pixel-WM에서 추출한 다중 스케일의 저수준 특징(Φpixel)과 Latent-WM의 움직임 인지 특징(Φlatent)을 결합합니다.
잠재-to-픽셀 변조 (Latent-to-Pixel Modulation): 두 특징을 연결(Concatenation)한 후 선형 투영(Linear Projection)을 통해 융합된 특징(Φfused)을 만듭니다. 최종적으로 잔차 메커니즘(Residual mechanism)을 사용하여 픽셀 특징에 융합된 정보를 더함으로써, 공간적 정확도와 동적 정보를 모두 유지합니다.
행동 디코딩 (Action Decoding): 융합된 시각적 특징을 조건(Condition)으로 하여 Diffusion Policy를 통해 최종 로봇 행동을 생성합니다.
3. 주요 기여 (Key Contributions)
하이브리드 아키텍처 제안: 움직임에 강한 '잠재 모델'과 디테일에 강한 '픽셀 모델'을 결합한 새로운 월드 모델 구조를 제시했습니다.
효과적인 특징 융합 메커니즘: 단순한 결합(Concatenation)이 복잡한 교차 주의 집중(Cross-attention)보다 이 설정에서 더 안정적이고 효과적임을 입증했습니다.
시각적 중복성 해결: 잠재 특징을 통해 픽셀 모델의 불필요한 노이즈를 억제하고 행동에 중요한 정보에 집중하게 만들었습니다.
4. 실험 결과 (Results)
CALVIN 벤치마크: 시뮬레이션 환경에서 기존의 VLA(Vision-Language-Action) 모델 및 최신 월드 모델 기반 방식들을 압도하는 SOTA(State-of-the-art) 성능을 달성했습니다. 특히 장기 계획(Long-horizon tasks)이 필요한 단계에서 성능 향상이 두드러졌습니다.
실제 로봇 실험 (Real-world Validation): AgileX 플랫폼을 이용한 '티셔츠 접기(Cloth folding)'와 같은 복잡하고 정밀한 작업에서도 성공적으로 동작함을 보여주며 실용성을 입증했습니다.
Ablation Study: 잠재 특징을 추가했을 때 픽셀 특징만 사용했을 때보다 성공률이 크게 향상됨을 확인하여, 하이브리드 방식의 정당성을 증명했습니다.
5. 의의 (Significance)
이 연구는 로봇 학습에서 **"무엇을 보고 무엇을 무시할 것인가"**라는 중요한 문제를 해결했습니다. 비디오 생성 모델의 풍부한 시각 정보와 잠재 모델의 효율적인 동역학 정보를 결합함으로써, 로봇이 환경의 불필요한 노이즈에 휘둘리지 않고 정밀한 조작을 수행할 수 있는 새로운 방향성을 제시했습니다.