← 최신 논문
💻 computer science

VideoWorld 2: Learning Transferable Knowledge from Real-world Videos

VideoWorld 2는 비디오 확산 모델을 활용해 시각적 외형과 행동 역학을 분리함으로써, 가공되지 않은 실제 영상으로부터 전이 가능한 지식을 학습하여 로봇 조작 및 복잡한 작업 수행 능력을 크게 향상시킨 모델입니다.

원저자: Zhongwei Ren, Yunchao Wei, Xiao Yu, Guixun Luo, Yao Zhao, Bingyi Kang, Jiashi Feng, Xiaojie Jin

게시일 2026-02-11
📖 2 분 읽기☕ 가벼운 읽기

원저자: Zhongwei Ren, Yunchao Wei, Xiao Yu, Guixun Luo, Yao Zhao, Bingyi Kang, Jiashi Feng, Xiaojie Jin

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

1. 기존 AI의 문제점: "눈치 없는 모범생" 🧐

기존의 AI들은 마치 **'사진 한 장'**에만 집착하는 모범생과 같았습니다. 예를 들어, 종이비행기를 접는 영상을 보고 배운다고 해봅시다.

  • 기존 AI의 방식: "종이의 색깔은 파란색이고, 책상은 나무 재질이며, 손가락은 이렇게 생겼네!"라며 **배경이나 종이의 무늬 같은 '겉모습'**을 외우는 데 너무 많은 에너지를 씁니다.
  • 문제 발생: 만약 갑자기 하얀 종이를 주거나 다른 책상 위에서 종이를 접으라고 하면, AI는 "어? 내가 배운 파란 종이랑 다르네? 못 하겠어!"라며 멘붕(패닉)에 빠져버립니다. 즉, **'종이를 접는 핵심 동작'**과 **'주변 환경'**을 구분하지 못하는 것이죠.

2. VideoWorld 2의 해결책: "핵심만 쏙 뽑아내는 마법의 필터" ✨

이 논문에서 제안한 VideoWorld 2는 이 문제를 해결하기 위해 **'역할 분담'**이라는 아주 똑똑한 전략을 씁니다. 이를 **dLDM(dynamics-enhanced Latent Dynamics Model)**이라고 부르는데, 쉽게 말해 **'동작 전문가'**와 **'화가 전문가'**를 따로 둔 것입니다.

  • 동작 전문가 (Latent Dynamics Model): 이 친구는 영상에서 색깔, 조명, 배경 같은 건 다 무시합니다. 오직 "손이 어디로 움직이는지", "종이가 어떻게 꺾이는지" 같은 **'핵심 움직임(뼈대)'**만 아주 단순한 암호로 기록합니다. (마치 춤 동작을 기록할 때 옷 색깔은 신경 안 쓰고 '팔을 올린다, 다리를 뻗는다'라고만 적는 것과 같습니다.)
  • 화가 전문가 (Pretrained VDM): 이 친구는 이미 세상의 온갖 예쁜 그림을 다 그려본 베테랑 화가입니다. '동작 전문가'가 준 단순한 암호를 보고, **"아, 이런 움직임이라면 이런 색깔의 종이가 이렇게 접히는 모습이겠구나!"**라며 아주 실감 나는 고화질 영상을 그려냅니다.

3. 왜 이게 대단한가요? (결과) 🚀

이 '역할 분담' 덕분에 AI는 엄청난 능력을 갖게 되었습니다.

  1. 눈치가 엄청 빨라졌습니다 (일반화 능력): 이제 종이 색깔이 바뀌거나, 로봇 팔의 모양이 달라져도 당황하지 않습니다. '움직임의 원리'만 배웠기 때문에, 어떤 환경에서도 "아, 이건 이렇게 접는 거지!"라며 척척 해냅니다.
  2. 긴 작업도 거뜬합니다 (장기 계획 능력): 종이비행기를 접으려면 '접고, 누르고, 뒤집는' 여러 단계가 필요하죠? VideoWorld 2는 이 긴 과정을 끊기지 않고 자연스럽게 이어가는 법을 배웠습니다.
  3. 로봇에게 바로 써먹을 수 있습니다: 사람이 로봇을 조종하는 영상을 보여주기만 해도, 로봇이 그 원리를 배워서 다른 물건을 옮기거나 조립하는 데 활용할 수 있습니다.

💡 요약하자면!

VideoWorld 2는 AI에게 **"겉모습(껍데기)에 현혹되지 말고, 그 안에 담긴 움직임의 원리(알맹이)를 배워라!"**라고 가르치는 기술입니다. 덕분에 AI는 이제 단순한 영상 재생기를 넘어, 세상을 관찰하고 그 법칙을 이해하는 **'진짜 지능'**에 한 발짝 더 다가서게 되었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →