← 최신 논문
💻 computer science

UniJEPA: A Unified Joint-Embedding Predictive Architecture for Task-Agnostic Visual World Modeling

UniJEPA는 단일 잠재 공간 내에서 이미지 수준의 광도 예측과 비디오 수준의 시간적 예측을 공동으로 학습함으로써 효율적인 제로샷 계획(zero-shot planning)을 가능하게 하고, EMA나 stop-gradient와 같은 복잡한 훈련 메커니즘의 필요성을 제거하면서도 특화된 모델들을 능가하는, 통합되고 작업 불가지론적인(task-agnostic) 자기지도 학습 프레임워크를 도입한다.

원저자: An Lanji, Dawei Liu, Jin Li, Haoran Xu, Mei Chen, Yu Tian

게시일 2026-08-10
📖 5 분 읽기🧠 심층 분석

원저자: An Lanji, Dawei Liu, Jin Li, Haoran Xu, Mei Chen, Yu Tian

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 세상을 이해하는 법을 가르치려 한다고 상상해 보세요. 과거에 과학자들은 로봇에게 수백만 장의 사진을 보여주며 다음에 무엇이 올지 맞히게 하거나, 비디오를 보며 프레임 단위로 미래를 예측하게 하는 방식으로 이를 시도했습니다. 이것은 마치 언어를 배우기 위해 모든 책의 모든 글자를 하나하나 암기하려 하거나, 이야기의 내용을 이해하기도 전에 완벽한 복사본을 그리려고 애쓰는 것과 같습니다. 이는 엄청난 시간과 컴퓨터 연산 능력을 소모합니다.

최근에는 "결합 임베딩 예측 아키텍처(Joint-Embedding Predictive Architecture, 줄여서 JEPA)"라는 더 똑똑한 아이디어가 등장했습니다. JEPA는 전체 그림을 다시 그리려고 노력하는 대신, 사물의 '본질'을 이해하도록 로봇을 가르칩니다. 이것은 마치 배우의 셔츠 색깔을 모두 기억할 필요 없이 영화의 줄거리를 배우는 것과 같습니다. 로봇은 자신이 보는 것을 작고 효율적인 "정신적 메모리(잠재 공간, latent space)"로 압축하는 법을 배우고, 그다음 그 메모리가 미래에 어떤 모습일지를 예측합니다. 하지만 지금까지 과학자들은 서로 다른 일을 하는 서로 다른 로리봇을 만들어야 했습니다. 사진의 밝기를 조절할 때 이미지가 어떻게 변하는지 이해하는 로봇과, 비디오가 시간의 흐름에 따라 어떻게 움직이는지 이해하는 로봇이 각각 따로 필요했습니다. 이들은 서로 대화할 수 없는 별개의 도서관과 같았습니다.

여기 UniJEPA라는 새로운 접근 방식이 등장했습니다. 이는 정신적 메모리를 위한 '만능 번역기' 역할을 합니다. 이 논문의 연구자들은 다음과 같은 질문을 던졌습니다: "우리는 이미지의 조명 효과(밝기나 색상 변화 등)가 어떻게 변하는지와 장면이 시간의 흐름에 따라 어떻게 움직이는지를 동시에 학습하는 단 하나의 로봇 두뇌를 만들 수 있을까?" 그들은 이 두 가지를 함께 수행하는 것이 가능할 뿐만 아니라, 실제로 함께 할 때 로봇이 더 똑똑하고 빨라진다는 사실을 발견했습니다. 단일화된 규칙을 사용함으로써, UniJEPA는 지저성한 픽셀의 세부 사항을 재구성하지 않고도 장면의 "외형"과 "움직임"을 모두 예측하는 법을 배웁니다. 결국, 하나의 두뇌가 두 가지 작업을 모두 처리할 수 있으며, 즉각적으로 행동을 계획할 수 있는 유연한 시각 방식을 학습한다는 것이 밝혀졌습니다.

핵심 아이디어: 하나의 두뇌, 두 가지 초능력

AI를 훈련시키는 옛날 방식을 교실 안의 두 명의 학생이라고 생각해 보세요. "사진 예측가(Photo-Predictor)"라고 불리는 첫 번째 학생는 정지된 사진만을 공부하도록 허용되었습니다. 만약 당신이 그녀에게 고양이 사진을 보여주고 조명을 바꿨을 때의 모습을 상상해 보라고 한다면, 그녀는 그것을 처음부터 다시 배워야 합니다. 또 다른 학생인 "비디오 예측가(Video-Predictor)"는 다른 방에 앉아 움직이는 영상만을 공부합니다. 그는 공이 구르거나 사람이 걷는 법은 배우지만, 사진의 색을 바꾸면 어떻게 되는지는 전혀 모릅니다.

문제는 이 두 학생이 같은 세상을 배우고 있지만 서로 다른 언어를 사용하고 있다는 점입니다. 그들은 서로의 노트를 공유할 수 없습니다. 만약 사진을 이해하면서 동시에 미래의 움직임을 예측할 수 있는 로봇을 원한다면, 당신은 두 개의 별도 모델을 훈련시켜야 하며 이들이 잘 작동하기를 바라야만 합니다.

UniJEPA는 두 학생을 같은 방에 넣고 단 하나의 교과서를 주는 방식으로 게임의 판도를 바꿉니다. 이 논문은 하나의 모델이 두 가지 일을 동시에 수행하도록 훈련할 수 있음을 보여줍니다:

  1. 광학적 예측(Photometric Prediction): 사진을 찍은 후 밝기를 높이거나 색조를 바꾼다고 상상해 보세요. UniJEPA는 화면의 픽셀을 실제로 바꾸지 않고도, 그 사진의 "정신적 메모리"가 변화 후에 어떤 모습일지를 예측하는 법을 배웁니다.
  2. 시간적 예측(Temporal Prediction): 공이 구르는 영상을 보고 있다고 상상해 보세요. UniJEPA는 다음 프레임의 "정신적 메모리"를 예측하여, 공이 다음에 어디에 있을지를 파악합니다.

놀라운 점은 UniJEPA가 이 두 가지 기술을 동일한 정신적 공간에서 학습한다는 것입니다. 이는 마치 로봇이 "빛을 바꾸는 것"과 "시간을 앞으로 진행시키는 것"이 동일한 근본적 현실과 상호작용하는 두 가지 다른 방식임을 배우는 것과 같습니다.

작동 원리: 붕괴 방지 트릭

"두 가지 서로 다른 것을 동시에 배우라고 하면, 로봇이 혼란에 빠져서 모든 것에 대해 똑같이 지루한 답변만 내놓으며 포기해 버리지 않을까?"라고 의문을 가질 수 있습니다. AI 용어로 이를 "붕괴(collapse)"라고 하며, 모델이 학습을 멈추고 평탄한 결과값만을 출력하는 현상을 말합니다.

이 논문은 **가우시안 정규화 도구(Gaussian regularizer)**라는 영리한 안전망을 도입했습니다. 이것은 마치 학생들이 모두 같은 의자에 앉지 못하도록 감시하는 엄격한 선생님과 같습니다. 이 선생님은 학생들이 모든 "정신적 메모리"가 고유하고 뚜렷하게 유지되도록 강제하여 메모리가 퍼지도록 만듭니다. 저자들은 이 단순한 규칙이 복잡한 트릭(다른 방법에서 흔히 쓰이는 '그래디언트 중단(stopping gradients)'과 같은 번거로운 해결책)이나 사전 훈련된 두뇌를 사용하지 않고도 모델의 붕괴를 막기에 충분하다는 것을 수학적으로 증명했습니다. 이는 학습을 건강하게 유지하는 깔끔하고 단일한 규칙입니다.

결과: 더 빠르고, 더 똑똑하며, 더 단순하게

연구진은 이미지(유명한 ImageNet 데이터셋), 비디오(요리하거나 손 동작을 하는 영상), 그리고 제어 작업(미로를 탐색하는 로봇)에 대해 UniJEPA를 테스트했습니다. 결과는 다음과 같습니다:

  • 팔방미인: UniJEPA는 이미지만 학습했거나 비디오만 학습한 특화된 로봇들과 대등하거나 오히려 더 나은 성능을 보였습니다. 이미지 테스트에서 UniJEPA는 **74.9%**의 정확도를 기록하며, 특화된 "사진 예측가"(73.5%)를 앞질렀습니다. 비디오 테스트에서는 **78.1%**를 기록하여, 특화된 "비디오 예측가"(77.3%)보다 높은 성적을 냈습니다.
  • 계획 기계: 진짜 시험은 계획(planning)이었습니다. 로봇이 목표에 도달하는 방법을 알아낼 수 있을까요? 과거 데이터를 통한 추가 훈련 후, UniJEPA는 인간이 길을 알려주지 않아도 시각적 목표(예: "빨간 사각형으로 가기")에 도달하는 경로를 계획할 수 있었습니다. 성공률은 **75.8%**였습니다.
  • 압도적인 속도: 이것이 가장 큰 승리입니다. UniJEPA는 매번 전체 그림을 다시 그리려 노력하는 대신, 압축된 "정신적 메모리" 내에서 예측하기 때문에 믿을 수 없을 정도로 빠릅니다. 논문에 따르면 UniJEPA는 생성형 월드 모델(모든 픽셀을 그리려고 시도하는 모델들)보다 최대 44배 빠르게 계획을 세웁니다. 다른 모델들이 움직임을 계획하는 데 몇 초가 걸릴 때, UniJEPA는 1초도 안 되는 찰나에 이를 해냅니다.

이것이 중요한 이유

이 논문은 우리가 매번 다른 직업을 위해 다른 두뇌를 가질 필요는 없다고 주장합니다. 우리가 기계에게 세상을 보는 법을 가르치는 방식을 통합함으로써, 우리는 더 효율적이고, 훈련하기 쉬우며(조정해야 할 주요 설정이 하나뿐임), 더 유연한 시스템을 얻을 수 있습니다.

저자들은 또한 로봇이 무엇에 집중하여 학습할지를 제어할 수 있다는 점을 보여주었습니다. 만약 당신이 로봇에게 "사진" 부분에 더 집중하라고 명령하면, 로봇은 조명 변화를 무시하는 데 매우 능숙해집니다(불변성, invariant). 만약 "비디오" 부분에 집중하라고 명령하면, 로봇은 움직임을 추적하는 데 매우 능숙해집니다(동변성, equivariant). 당신은 자신에게 필요한 최적의 균형을 찾기 위해 조절 노브를 돌릴 수 있습니다.

요약하자면, UniJEPA는 단일화된 하나의 두뇌가 사진의 정적인 아름다움과 비디오의 역동적인 흐름을 모두 이해할 수 있으며, 동시에 놀라운 속도로 다음 움직임을 계획할 수 있음을 입증했습니다. 이는 세부 사항에 발목 잡히지 않고 우리 세상을 진정으로 이해하고 탐험할 수 있는 AI 에이전트를 구축하기 위한 중요한 단계입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →