← 최신 논문
🤖 AI

Latent Video Prediction Learns Better World Models

본 논문은 V-JEPA 2.1 과 같은 잠재 영상 예측 모델이 다섯 가지 강건성 축에서 기존 재구성 기반 및 지도 학습 모델을 능가함을 보여주는 체계적인 연구를 제시함으로써, 이를 강건한 세계 모델 구축을 위한 우수한 후보로 확립합니다.

원저자: Ali J Alrasheed, Aryan Yazdan Parast, Basim Azam, James Bailey, Naveed Akhtar

게시일 2026-05-18
📖 4 분 읽기☕ 가벼운 읽기

원저자: Ali J Alrasheed, Aryan Yazdan Parast, Basim Azam, James Bailey, Naveed Akhtar

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇이 동영상을 관찰하는 것만으로 물리적 세계를 이해하도록 가르친다고 상상해 보세요. 당신은 그것이 단순히 사물을 인식하는 것을 넘어, 사물이 어떻게 움직이고 상호작용하며 시간에 따라 변하는지 이해하는 '세계 모델'이 되기를 원합니다.

오랫동안 연구자들은 이러한 로봇들을 '완벽하고 깨끗한 테스트에서 몇 개의 동영상을 맞췄는가'라는 단일 점수로 평가해 왔습니다. 이 논문은 그 단일 점수가 '맑은 날에 얼마나 빠르게 주행하는지'만으로 자동차의 안전성을 판단하는 것과 같다고 주장합니다. 그것은 비나 구덩이, 타이어 펑크 상황에서 자동차가 어떻게 대처하는지에 대해 아무것도 알려주지 않기 때문입니다.

이 논문의 저자들은 어떤 로봇이 실제로 세상을 가장 잘 이해하는지 보기 위해 네 가지 다른 '로봇 두뇌'(동영상 AI 모델) 를 훨씬 더 까다롭고 현실적인 시험대에 올려놓기로 결정했습니다.

네 명의 참가자

그들은 세 가지 다른 학습 스타일에 속하는 네 가지 인기 있는 AI 모델을 비교했습니다.

  1. 픽셀 화가들 (VideoMAEv2): 이 모델들은 '숫자 채우기' 게임처럼 동영상의 누락된 부분을 채워 넣음으로써 학습합니다. 숨겨진 프레임의 정확한 색상과 픽셀을 추측하는 방식입니다.
  2. 매칭 전문가들 (VideoPrism): 이 모델들은 시각적 패턴에 초점을 맞춰 유사한 동영상들을 그룹화함으로써 학습합니다.
  3. 미래 예측자들 (V-JEPA 2 및 2.1): 이 모델들은 그림을 다시 그리려고 하지 않습니다. 대신 숨겨진 정신 공간에서 다음에 올 것의 '의미'나 '요지'를 추측하려 합니다. 그들은 "이 행동을 보면 다음에 어떤 사건이 일어날까?"라고 묻습니다.

다섯 가지 현실 세계 테스트

연구자들은 단순히 하나의 테스트가 아니라, 현실 세계의 문제를 모방한 다섯 가지 구체적인 과제를 모델들에게 부과했습니다.

1. "나쁜 카메라" 테스트 (오염 강인성)

  • 시나리오: 동영상 피드가 고장 난 상황을 상상해 보세요. 흐릿하거나 눈이 내리거나 정적 잡음이 섞여 있습니다.
  • 결과: 미래 예측자들이 우승했습니다. 동영상이 끔찍해 보일지라도 그들은 여전히 무슨 일이 일어나고 있는지 파악할 수 있었습니다. 반면 픽셀 화가들은 무너졌습니다. 그들은 모든 단일 픽셀의 색상에 신경 쓰도록 훈련되었기 때문에 약간의 눈이나 잡음에도 완전히 혼란스러워졌습니다. 미래 예측자들은 '잡음'을 무시하고 이야기에 집중하는 법을 배웠습니다.

2. "마술사" 테스트 (세밀한 구별 능력)

  • 시나리오: 연구자들은 실제로 행동을 하는 것과 (물을 따르는 것처럼) 행동을 가장하는 것 (물을 따르는 척하는 것) 의 동영상을 보여주었습니다. 움직임은 거의 동일해 보이지만, '가상' 버전에서는 실제로 물이 흐르지 않습니다.
  • 결과: 미래 예측자들이 빛을 발한 곳입니다. 그들은 실제 행동과 가짜 행동을 구별할 수 있었습니다. 픽셀 화가들은 속았습니다. 그들은 손의 움직임에 대한 시각적 세부 사항에 너무 집중하여 물이 흐르지 않는다는 미묘한 사실을 놓쳤습니다. 미래 예측자들은 그림뿐만 아니라 상호작용의 물리법칙을 이해했습니다.

3. "안대" 테스트 (가림 강인성)

  • 시나리오: 누군가 카메라 위에 손을 올리거나, 카메라와 대상 사이를 차가 지나가 시야를 가리는 상황을 상상해 보세요.
  • 결과: 미래 예측자들은 침착함을 유지했습니다. 동영상의 일부가 비록 사라졌더라도 그들은 여전히 무슨 일이 일어나고 있는지 추측할 수 있었습니다. 흥미롭게도 매칭 전문가들은 이론적으로는 매우 안정적으로 보였습니다 (내부 수학이 크게 변하지 않음). 하지만 실제 행동 추측 능력은 무너졌습니다. 마치 정답지의 모양은 외웠지만 정답을 모르는 학생과 같았습니다. 종이는 괜찮아 보였지만, 시험에는 떨어졌습니다.

4. "시간 기계" 테스트 (시간적 방향성)

  • 시나리오: 연구자들은 동영상을 거꾸로 재생했습니다.
  • 결과: 이것이 가장 revealing 한 테스트였습니다. 상자를 '밀고' 있는 사람의 동영상이 거꾸로 재생되었을 때, 미래 예측자들은 그 행동이 '당기는' 것으로 바뀌었다고 정확히 깨달았습니다. 그들은 시간이 방향성을 가진다는 것을 이해했습니다. 다른 모델들은 대부분 혼란스러워하거나 무작위로 추측했습니다. 그들은 '밀기'와 '당기기'가 시간상 반대라는 것을 배운 적이 없었습니다. 그들은 단지 움직이는 모양만 보았을 뿐입니다.

5. "고정 vs 유연" 테스트

  • 시나리오: 일반적으로 모델을 특정 작업에 잘 작동하게 하려면 많은 레이블이 지정된 데이터로 처음부터 다시 훈련시켜야 합니다. 연구자들은 이렇게 물었습니다: "재훈련되지 않은 '고정된' 모델이 완전히 재훈련된 모델을 이길 수 있을까?"
  • 결과: 네, 가능합니다. 미래 예측자들은 재훈련되지 않고 고정된 상태에서도, 그들의 마음을 읽기 위한 간단한 '프로브'만 주어졌을 때, '나쁜 카메라'와 '안대' 테스트에서 완전히 재훈련된 모델들을 이겼습니다. 이는 그들이 처음에 배운 방식 (미래 예측) 이 단순히 정답을 외우는 것보다 더 견고한 기반을 구축했음을 시사합니다.

핵심 교훈

이 논문은 "그림을 완벽하게 다시 그리기 (픽셀 재구성) 보다 '정신 공간 (잠재 공간)'에서 미래를 예측하는 것이 세상을 배우는 더 나은 방법"이라고 결론 내립니다.

  • 픽셀 화가들은 사진을 완벽하게 복사할 수 있지만 조명이나 사진이 찢어지는 경우 혼란에 빠지는 예술가와 같습니다.
  • 미래 예측자들은 탐정처럼 행동합니다. 그들은 셔츠의 정확한 파란색 음영에 관심이 있는 것이 아니라, 이야기에 관심을 가집니다. 컵을 밀면 움직인다는 점, 그리고 그 동영상을 거꾸로 재생하면 당기는 것이라는 점을 이해합니다.

저자들은 로봇이나 AI 를 위한 진정한 '세계 모델'을 구축하려면 깨끗한 테스트에서 정답을 맞췄는지 확인하는 것을 멈춰야 한다고 주장합니다. 대신 잡음, 누락된 정보, 그리고 시간의 흐름을 처리할 수 있는지 확인해야 합니다. 미래를 예측함으로써 학습하는 모델들이 실제로 세상이 어떻게 작동하는지 이해하는 모델들인 것으로 보입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →