← 최신 논문
💻 computer science

MoWM: Mixture-of-World-Models for Embodied Planning via Latent-to-Pixel Feature Modulation

MoWM은 동작 중심의 잠재 공간(Latent space) 표현과 세밀한 픽셀 공간(Pixel space) 표현을 결합한 혼합 세계 모델(Mixture-of-World-Models) 프레임워크를 통해, 로봇의 정밀한 조작과 일반화 성능을 극대화한 임바디드 플래닝(Embodied Planning) 연구입니다.

원저자: Yangcheng Yu, Xin Jin, Yu Shang, Xin Zhang, Haisheng Su, Wei Wu, Yong Li

게시일 2026-02-11
📖 2 분 읽기☕ 가벼운 읽기

원저자: Yangcheng Yu, Xin Jin, Yu Shang, Xin Zhang, Haisheng Su, Wei Wu, Yong Li

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🤖 로봇의 고민: "눈은 밝은데, 머리가 멍해요!"

로봇이 물건을 집으려면 두 가지 능력이 필요합니다.

  1. 정밀한 시력: 물건의 모서리가 어디인지, 손가락이 어디에 닿아야 하는지 아주 자세히 보는 능력 (픽셀 기반 모델)
  2. 흐름을 읽는 직관: "내가 이 물건을 밀면 저쪽으로 굴러가겠구나!"라고 움직임의 원리를 아는 능력 (잠재 공간 기반 모델)

그런데 기존 로봇들은 이 두 가지 중 하나가 부족했습니다.

  • 비디오 생성 모델(시력파): 눈은 엄청나게 좋아서 화면을 아주 선명하게 그려내지만, 배경의 불필요한 정보(벽지 무늬, 조명 등)까지 너무 자세히 보느라 정작 "어떻게 움직여야 하는지"에 대한 핵심 정보(움직임의 흐름)를 놓치곤 했습니다. 마치 너무 화려한 영화를 보느라 주인공의 다음 동작을 놓치는 관객과 같죠.
  • 잠재 모델(직관파): 움직임의 원리는 잘 알지만, 너무 요약해서 생각하다 보니 "정확히 몇 밀리미터(mm)를 움직여야 하는지" 같은 세밀한 디테일이 부족했습니다. 마치 줄거리만 대충 아는 사람과 같아서, 정작 중요한 디테일한 액션은 못 하는 거죠.

💡 MoWM의 해결책: "천재 화가와 베테랑 감독의 만남"

이 논문에서 제안한 **MoWM(Mixture-of-World-Models)**은 이 두 가지 모델을 하나로 합친 **'하이브리드 팀'**입니다.

비유하자면, 로봇에게 **'엄청나게 눈이 좋은 화가'**와 **'액션 연출의 귀재인 감독'**을 동시에 붙여준 것입니다.

  1. 화가(Pixel-WM): "지금 눈앞에 보이는 물건의 모양과 색깔은 이래요!"라며 아주 선명한 그림을 그려줍니다. (디테일 담당)
  2. 감독(Latent-WM): "자, 이제 이 물건을 밀면 이렇게 움직일 거야. 배경은 신경 쓰지 말고 움직임에만 집중해!"라며 핵심적인 움직임의 흐름을 짚어줍니다. (움직임/직관 담당)

MoWM은 이 둘의 정보를 섞습니다. 감독이 "이 부분이 중요해!"라고 짚어준 정보를 바탕으로, 화가가 그린 그림에서 불필요한 배경 정보는 걷어내고 **'동작에 꼭 필요한 핵심 디테일'**만 골라내어 로봇의 뇌에 전달합니다.


🏆 결과: "더 멀리, 더 정확하게!"

이 '환상의 팀워크' 덕분에 로봇은 다음과 같은 놀라운 성과를 냈습니다.

  • 장기 계획 능력: 단순히 눈앞의 동작만 하는 게 아니라, "옷을 접는다"처럼 여러 단계가 필요한 복잡한 일을 끝까지 성공적으로 해냅니다. (마치 영화의 결말까지 완벽하게 설계하는 감독처럼요!)
  • 실전 능력: 가상 세계(시뮬레이션)뿐만 아니라, 실제 로봇 팔을 이용해 '티셔츠를 직사각형으로 접는' 아주 까다롭고 섬세한 작업도 성공했습니다.
  • 적응력: 한 번도 가보지 않은 새로운 환경에서도 당황하지 않고 물건을 잘 다룹니다.

📝 요약하자면?

**"너무 자세해서 정신없던 시각 정보에, 핵심 움직임을 짚어주는 직관을 더해, 로봇이 복잡한 일을 끝까지 완벽하게 해내도록 만든 기술"**이라고 할 수 있습니다!

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →