← 최신 논문
💻 computer science

JEPA-WAM: Learning Vision-Language-Action Policies with Joint-Embedding World Modeling

JEPA-WAM은 사전 학습된 V-JEPA 공간을 기반으로 구축된 잠재 세계 행동 모델을 도입하여, 공유된 예측기를 통해 공간적으로 구조화된 미래 예측과 연속적인 행동 생성을 통합함으로써 대규모 정책 사전 학습 없이도 로봇 조작 벤치마크에서 최첨단 성능을 달성합니다.

원저자: Yihan Lin, Jiawei He, Shifeng Bao, Chen Zhao, Yang Li, Xiaobo Wang, Yan Wang, Cheng Chi, Jing Zhang

게시일 2026-08-11
📖 5 분 읽기🧠 심층 분석

원저자: Yihan Lin, Jiawei He, Shifeng Bao, Chen Zhao, Yang Li, Xiaobo Wang, Yan Wang, Cheng Chi, Jing Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 요리하는 법을 가르친다고 상상해 보세요. 단순히 요리사가 양파를 써는 영상을 보여주며 "저렇게 해"라고 말할 수도 있습니다. 하지만 로봇이 그 특정 영상의 모습만을 그대로 암기한다면, 요리사가 다른 모자를 쓰거나 주방의 조명이 바뀌었을 때 당황할 수 있습니다. 이것이 바로 시각-언어-행동(Vision-Language-Action, VLA) 모델이 직면한 과제입니다. 이 모델들은 익숙한 환경에서는 지시를 아주 잘 따르지만, 훈련받은 것과 세상이 조금만 다르게 보여도 헤매곤 합니다.

이를 해결하기 위해 과학자들은 로봇에게 "예측가"가 되도록 가르치는 방법을 시도해 왔습니다. 단순히 반응하는 대신, 로봇이 다음에 어떤 일이 일어날지 상상하도록 하는 것입니다. 만약 로봇이 "내가 이 컵을 밀면, 컵이 탁자 아래로 미끄러져 떨어질 것이다"라고 예측할 수 있다면, 더 나은 계획을 세울 수 있습니다. 하지만 로봇이 미래의 고화질 영상을 통째로 생성하게 만드는 것은, 마치 학생에게 다음 행동을 결정하기 위해 소설 한 권을 통째로 쓰라고 요구하는 것과 같습니다. 이는 너무 많은 시간과 컴퓨팅 자원을 소모합니다. 그래서 연구자들은 지름길을 찾았습니다. 전체 그림을 다 그리는 대신, 미래의 '개념'만을 예측하는 "잠재적(latent)" 모델을 말이죠. 하지만 여기에는 함정이 있습니다. 이러한 지름길 중 상당수는 세부 정보를 너무 많이 잃어버리거나, 예측과 행동을 서로 분리된 별개의 작업으로 취급한다는 점입니다.

이것이 바로 JEPA-WAM이 등장하게 된 배경입니다. JEPA-WAM은 로봇이 모든 프레임을 다 그리는 데 매몰되지 않고도 시간의 흐름을 "느낄" 수 있도록 가르치려는 새로운 접근 방식입니다. 이 모델은 단순한 질문을 던집니다. "우리가 세상이 어떻게 변하는지 이해하도록 가르치고, 그 이해를 바탕으로 더 잘 움직이게 하는 것을 하나의 매끄러운 동작으로 만들 수 있을까?"


로봇의 "시간 감각" 지름길

JEPA-WAM을 만나보세요. 이것을 단순히 현재의 사진을 보고 다음 사진을 추측하는 로봇이 아니라, 두 사진 사이의 '관계'를 학습하는 로봇이라고 생각해보세요.

당신이 마술 공연을 보고 있다고 상상해 봅시다. 마술사가 상자 안에 빨간 공을 넣더니, 파란 공을 꺼냅니다. 일반적인 로봇은 단순히 "빨간 공 → 파란 공"이라고 암기할 것입니다. 하지만 JEPA-WAM은 변화의 '전이(transition)'를 포착하는 탐정과 같습니다. "빨간 공이 사라졌고, 상자가 흔들렸으며, 파란 공이 나타났다"는 것을 알아차리는 것이죠. 이 모델은 전후 상태뿐만 아니라 변화의 이야기를 학습합니다.

연구진은 이 시스템을 V-JEPA라는 사전 훈련된 "시각 뇌" 위에 구축했습니다. V-JEPA는 로봇이 이미 수백만 개의 영상을 시청하며 물체가 어떻게 움직이고 상호작용하는지를 학습한 상태라고 생각하면 됩니다. JEPA-WAM은 이 뇌를 가져와 특별한 "시간 여행" 모듈을 추가합니다.

여기 마술 같은 비결이 있습니다. JEPA-WAM은 로봇에게 미래의 흐릿한 영상을 생성하라고 요구하는 대신(이는 느리고 비용이 많이 듭니다), **결합 지도(joint map)**를 예측하도록 요청합니다. 지금의 주방 사진과 5초 후의 주방 사진을 찍어 서로 겹쳐 놓는다고 상상해 보세요. JEPA-WAM은 미래의 사진을 처음부터 다시 그리려 하지 않습니다. 대신, 겹쳐진 두 사진 사이의 '차이'를 살펴보고 픽셀이 정확히 어떻게 이동했는지를 예측하는 법을 배웁니다. 즉, "컵이 왼쪽으로 2인치 움직였다"라거나 "서랍이 열렸다"와 같이, 사건이 발생한 위치의 미세한 디테일을 보존하며 학습합니다.

공유된 뇌: 하나의 예측기, 두 가지 작업

JEPA-WAM의 가장 영리한 점은 뇌를 사용하는 방식입니다. 기존의 많은 시스템에서 미래를 예측하는 부분과 로봇 팔을 움직이는 부분은 마치 벽을 사이에 두고 대화하는 서로 다른 두 사람 같았습니다. 한 명은 미래를 추측하고, 다른 한 명은 그것을 들으려고 노력하는 식이었죠.

JEPA-WAM은 **공유 예측기(Shared Predictor)**를 사용합니다. 아주 똑똑한 학생이 시험을 치르고 있다고 상상해 보세요.

  1. 작업 A: 학생은 현재 장면을 보고 세상이 어떻게 변할지 예측합니다 (이것이 "시간 감각"입니다).
  2. 작업 B: 학생은 그 동일한 이해를 바탕으로 로봇 팔을 어떻게 움직일지 결정합니다 (이것이 "행동"입니다).

학생이 이 두 가지 작업을 동시에 수행하기 때문에, 미래를 예측하는 학습이 로봇의 움직임을 결정하는 방식에 직접적으로 영향을 미칩니다. 논문은 이러한 긴밀한 결합이 로봇을 훨씬 더 똑똑하게 만든다고 제안합니다. 이는 단순히 스텝을 외우는 것이 아니라 리듬을 이해하는 무용수와 같습니다. 예측과 행동이 동일한 이해에서 탄생하기 때문에 움직임이 자연스럽게 흐르는 것입니다.

실제로 효과가 있을까?

연구진은 이 아이디어를 세 가지 서로 다른 환경에서 테스트했습니다: 표준 비디오 게임 시뮬레이션, 무작위 물체가 있는 혼란스러운 시뮬레이션, 그리고 실제 실험실의 로봇 팔입니다.

시뮬레이션에서:
환경의 변화(조명이나 물체 위치의 변화 등)를 테스트하는 벤치마크인 LIBIO-Plus에서, JEPA-WAM은 **79.2%**를 기록했습니다. 이는 방대한 로봇 데이터를 사전에 학습하지 않은 로봇들 중 최고의 결과였습니다. 더욱 인상적인 것은, 이 "시간 감각" 기술을 이미 강력한 로봇 뇌인 π0.5에 적용했을 때, 점수가 84.5%에서 86.3%로 뛰어올랐다는 점입니다. 이는 똑똑한 로봇이라 할지라도 시간의 흐름을 예측하는 법을 배우면 더 똑똑해질 수 있음을 시사합니다.

실제 환경에서:
연구팀은 듀얼 암(두 개의 로봇 팔이 함께 작동하는 구조)이 있는 실제 실험실로 로봇을 가져갔습니다. 그들은 블록 쌓기, 과일 접시에 담기, 서랍 열기 등의 과제를 수행하게 했습니다.

  • 설정이 예상과 정확히 일치했을 때(In-Distribution), JEPA-WAM은 약 **59.8%**의 성공률을 보였습니다.
  • 배경을 바꾸거나 물체를 옮겨 놓았을 때(Out-of-Distribution), JE-PAM은 여전히 **54.2%**를 유지했습니다.
  • 이를 표준 로봇(π0)과 비교해 보면, π0는 환경이 변했을 때 51.8%에서 22.5%로 급격히 하락했습니다.

이 결과는 JEPA-WAM이 훨씬 더 견고하다는 것을 보여줍니다. 이 모델은 특정 장면을 단순히 암기하는 것이 아니라, 물체가 움직이는 '논리'를 학습하기 때문에 예기치 못한 상황에도 대처할 수 있습니다.

한계점 (무엇이 아닌가)

논문은 JEPA-WAM이 아닌 것에 대해서도 명확히 밝히고 있습니다.

  • 이것은 비디오 생성기가 아닙니다. 미래의 고화질 영상을 새로 만들어내려 하지 않습니다. 저자들은 로봇을 제어하는 데 있어 모든 픽셀을 생성하는 것은 비용이 너무 많이 들고 불필요하다고 주장합니다.
  • 이것은 단순히 최종 상태만을 예측하는 것이 아닙니다. 연구진은 "현재" 이미지 없이 "미래" 이미지만 보는 버전을 테스트했는데, 그 결과(77.3%)가 JEPA-WAM(79.2%)보다 낮았습니다. 이는 "지금"과 "나중" 사이의 '관계'를 이해하는 것이 단순히 끝 결과를 추측하는 것보다 더 중요하다는 것을 증명합니다.
  • 이것은 모든 문제를 해결하는 만능 열쇠가 아닙니다. 저자들은 동일한 시각적 장면이라도 특정 지시(예: "컵을 밀어라" vs "컵을 당겨라")에 따라 매우 다른 결과가 나올 경우, 모델이 어려움을 겪을 수 있다고 언급했습니다. 이는 모델이 언어적 목표보다는 시각적 변화에 집중하기 때문입니다.

결론

JEPA-WAM은 로봇을 더 적응력 있게 만드는 비결이 단순히 더 많은 데이터나 더 큰 뇌를 주는 것이 아니라, 행동에 직접적인 영향을 미치는 방식으로 '시간의 흐름'을 이해하도록 가르치는 데 있다는 것을 시사합니다. 세계가 어떻게 변하는지 예측하고 어떻게 움직일지 결정하는 데 하나의 공유된 뇌를 사용함으로써, 로봇은 복잡한 주방에서도 당황하지 않고 적응하는 숙련된 인간처럼 변하게 됩니다.

시뮬레이션과 실제 실험을 통해 측정된 결과는, 이러한 "결합 예측" 접근 방식이 예측 불가능한 현실 세계를 다룰 수 있는 로봇을 구축하는 강력한 방법임을 보여줍니다. 비록 모든 과제에 대한 완벽한 해결책은 아닐지라도, JE-PAM은 로봇을 단순히 명령을 따르는 존재를 넘어 진정으로 적응력 있는 존재로 만드는 유망한 새로운 길을 제시합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →