← 최신 논문
🤖 AI

Video Generation Models are General-Purpose Vision Learners

이 논문은 사전 학습된 텍스트-비디오 확산 백본을 기반으로 구축된 피드포워드 인지 모델인 GenCeption을 제안하며, 대규모 비디오 생성이 다양한 컴퓨터 비전 작업 전반에 걸쳐 최첨단의 데이터 효율적이고 범용적인 시각 지능을 달성하기 위한 우수한 사전 학습 패러다임임을 입증한다.

원저자: Letian Wang, Chuhan Zhang, Rishabh Kabra, Jasper Uijlings, Steven Waslander, Andrew Zisserman, Joao Carreira, Kaiming He, Misha Andriluka, Eduard Gabriel Bazavan, Andrei Zanfir, Cristian Sminchisescu

게시일 2026-07-13
📖 5 분 읽기🧠 심층 분석

원저자: Letian Wang, Chuhan Zhang, Rishabh Kabra, Jasper Uijlings, Steven Waslander, Andrew Zisserman, Joao Carreira, Kaiming He, Misha Andriluka, Eduard Gabriel Bazavan, Andrei Zanfir, Cristian Sminchisescu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 완벽한 스테이크, 폭신한 오믈렛, 혹은 매콤한 커리를 만드는 완벽한 레시피를 따르는 데 천재적인 초지능 로봇 셰프를 만들기 위해 수년간 공을 들였다고 상상해 보십시오. 하지만 여기 함정이 있습니다. 만약 당신이 셰프에게 "주방 온도를 말해줘"라거나 "냉장고에 달걀이 몇 개 있는지 세어봐"라고 요청한다면, 그들은 그저 멍하니 바라볼 뿐입니다. 그들은 무언가를 '만드는' 데는 달인이지만, 자신이 만들고 있는 세상에 대해 '이해하는' 데는 서툽니다.

오랫동안 컴퓨터 비전(컴퓨터에게 보는 법을 가르치는 분야)은 마치 그 로봇 셰프와 같았습니다. 우리는 모든 개별적인 작업에 특화된 별도의 로봇들을 만들어 왔습니다. 깊이를 측정하는 로봇, 얼굴을 추적하는 로봇, 가장자리를 찾는 로бо트가 따로 있었죠. 그들은 각자의 특정 작업에는 뛰어났지만, 서로 대화하거나 완전히 새로 구축하지 않고는 새로운 기술을 배울 수 없었습니다.

그러던 중, Google DeepMind와 여러 대학의 연구진이 기발한 질문을 던졌습니다. "만약 우리가 그 완벽한 영상을 생성함으로써 학습하는 그 로봇 셰프에게, 범용적인 탐정 역할을 맡긴다면 어떻게 될까?"

"Video Generation Models are General-Purpose Vision Learners"라는 제목의 이 논문은 그 대답이 강력한 "그렇다"라고 제안합니다. 그들은 GenCeption이라는 새로운 모델을 소개합니다.

마법 같은 기술: "만들기"에서 "알기"로

기존의 비전 모델 학습 방식을 학생에게 플래시 카드를 보여주며 가르치는 것에 비유해 봅시다. 나무 그림을 보여주며 "나무"라고 말하고, 자동차 그림을 보여주며 "자동차"라고 말하는 식입니다. 효과는 있지만, 느리고 경직되어 있습니다.

저자들이 GenCeption이라고 부르는 이 새로운 방식은, 학생에게 세상에 대한 수백만 가지의 서로 다른 이야기를 쓰게 하는 것과 같습니다. 카메라를 향해 손을 흔드는 고릴라에 대한 이야기를 쓰려면, 학생은 고릴라가 어떻게 생겼는지, 손이 어떻게 움직이는지, 빛이 털에 어떻게 닿는지, 그리고 카메라 각도가 시간에 따라 어떻게 변하는지를 반드시 이해해야 합니다. 이야기를 논리적으로 만들기 위해서라도 그들은 세상의 물리 법칙을 내면화해야만 합니다.

논문은 이러한 텍text-to-video generation(텍스트 기반 영상 생성) 과정이 사실 비전을 위한 궁극의 훈련장이라고 주장합니다. 모델이 텍스트 프롬프트(예: "카메라를 향해 손을 흔드는 고릴라")로부터 고품질의 영상을 생성하도록 훈련함으로써, 모델은 의도치 않게 방대한 양의 "세상 지식(world knowledge)"—즉, 3D 공간이 어떻게 작동하는지, 물체가 어떻게 움직이는지, 빛이 어떻게 행동하는지—을 습득하게 됩니다.

거대한 변화: 모든 것을 다스리는 하나의 모델

연구진은 거대한 영상 생성 모델(정적인 노이즈를 점진적으로 선명한 이미지로 바꾸는 '디퓨전 모델' 기술 기반)을 가져와서 이를 새롭게 단장시켰습니다.

모델이 한 프레임씩 천천히 "꿈을 꾸듯" 영상을 생성하게 두는 대신(이는 시간이 너무 오래 걸립니다), 그들은 이를 피드포워드(feed-forward) 모델로 수정했습니다. 이렇게 생각해보세요. 모델이 정답을 추측하기 위해 50단계를 거치는 대신, 입력을 보고 단 한 번의 빠르고 번개 같은 단계로 정답을 내뱉도록 훈련한 것입니다.

그 후, 그들은 단 하나의 모델이 텍스트 프롬프트만 바꾸는 것만으로 모든 것을 할 수 있도록 가르쳤습니다.

  • 프롬프트: "Depth(깊이)" → 모델은 깊이 맵(사물이 얼마나 멀리 있는지)을 출력합니다.
  • 프롬프트: "Surface Normal(표면 법선)" → 모델은 표면이 향하는 방향을 출력합니다.
  • 프롬프트: "Segmentation(세그멘테이션)" → 모델은 물체의 윤곽을 그려냅니다.
  • 프롬프트: "3D Keypoints(3D 키포인트)" → 모델은 사람의 신체 관절을 찾아냅니다.

이것은 마치 주머니에 별도의 칼, 드라이버, 가위를 따로 가지고 다닐 필요 없이, 필요한 도구가 요청에 따라 자동으로 나타나는 스위스 아미 나이프와 같습니다.

결과: 전문가들을 이기다

연구진은 깊이를 측정하는 것부터 스키를 타는 사람의 포즈를 추적하는 것까지 방대한 목록의 작업들을 대상으로 GenCeption을 테스트했습니다. 결과는 놀라웠습니다.

  • 전문가를 능가하다: 많은 경우, 이 단일 "범용" 모델은 해당 작업을 위해 특별히 제작된 전문 모델만큼, 혹은 그보다 더 우수한 성능을 보였습니다. 예를 들어, 이 모델은 깊이 전문가인 DepthAnything3나 세그멘테이션 전문가인 SAM3와 대등하거나 더 나은 성능을 보여주었습니다.
  • 데이터의 마술사: 가장 놀라운 부분 중 중 하나는 이 모델이 얼마나 적은 데이터를 필요로 했는가 하는 점입니다. 저자들은 GenCeption이 최고 수준의 모델인 D4RTVGGT-Ω와 대등한 성능을 달성하면서도, 실제로는 이들보다 7배에서 500배나 적은 학습 데이터를 사용했다는 것을 발견했습니다. 이는 모델이 게임의 규칙을 너무 잘 배웠기 때문에 모든 플레이를 일일이 암기할 필요가 없었음을 의미합니다.
  • 범용성: 이 모델은 거의 전적으로 합성 데이터(인간을 생성한 컴퓨터 그래픽 영상)로 훈련되었습니다. 그럼에도 불구하고, 연구진이 한 번도 본 적 없는 동물이나 로봇, 혹은 사람의 실제 영상을 보여주었을 때도 여전히 작동했습니다. 모델은 본 적 없는 영상 속에서도 고양이의 수염을 추적하거나 털을 분리해낼 수 있었습니다. 이는 모델이 단순히 특정 사진을 암기한 것이 아니라, "털"이나 "머리카락"이라는 개념을 학습했음을 시사합니다.

이 논문이 주장하지 않는 것

이 논문이 무엇을 주장하지 않는지 아는 것도 중요합니다. 저자들은 이것이 아직 세상의 모든 문제를 해결하는 마법 지팡이가 아니라고 조심스럽게 밝히고 있습니다.

  • 그들은 모든 비전 작업을 위해 새로운 맞춤형 구조를 구축해야 한다는 생각에 명시적으로 반대합니다. 그들은 이러한 "특화된 모델" 방식이 이 통합된 접근 방식보다 덜 효율적임을 보여줍니다.
  • 또한, 모델이 매우 뛰어나긴 하지만 완벽하지는 않다는 점도 언급했습니다. 모든 작업을 하나의 훈련 세션으로 결합하려고 했을 때, 모델은 3D 인간 키포인트 추정(신체 관절 추적)에서 약간 혼란을 겪었습니다. 성능이 해당 작업만을 위해 훈련되었을 때보다 약간 떨어졌습니다. 이는 "범용" 접근 방식이 강력하긴 하지만, 서로 매우 다른 유형의 작업들을 섞을 때 해결해야 할 과제가 여전히 남아 있음을 시사합니다.
  • 또한, 합성 데이터로 훈련된 후 실제 영상을 처리하는 능력은 그들이 명시적으로 프로그래밍한 것이 아니라, 훈련 과정에서 나타난 창발적 행동(emergent behavior), 즉 행복한 우연임을 명확히 했습니다.

결론

이 논문은 컴퓨터 비전의 미래가 더 많은 특화된 로봇을 만드는 것이 아니라, 세상을 아주 생생하게 "상상"하게 함으로써 세상을 완벽하게 이해하는 하나의 슈퍼 로봇을 가르치는 데 있을지도 모른다고 제안합니다.

영상 생성을 사전 훈련 도구로 사용함으로써, GenCeption은 모델이 세상을 창조하려는 시도만으로도 세상을 보고, 측정하고, 이해할 수 있다는 것을 보여주었습니다. 이는 "모든 문제에 대한 솔루션을 설계하는 것"에서 "모든 문제를 해결할 수 있는 스마트한 토대를 만드는 것"으로의 전환입니다.

저자들은 이 경로—생성 모델을 인지(perception)의 기초로 사용하는 것—가 거대 언어 모델(LLM)이 텍스트를 혁신했던 것처럼, 진정한 범용 비전 지능을 구축하는 열쇠가 될 수 있다고 제안합니다. 이는 유망한 단계이지만, 논문에서 언급했듯이, 이 범용적인 두뇌를 모든 작업에 완벽하게 만드는 정확한 방법을 알아내는 과정은 아직 초기 단계에 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →