1. 기존 방식: "모든 비디오는 똑같은 두꺼운 책"
지금까지 비디오를 다루는 AI 모델들은 대부분의 비디오를 **고정된 크기의 3D 격자 (3D Grid)**로 변환했습니다.
- 비유: 비디오를 한 권의 두꺼운 사전으로 생각해보세요.
- 비디오가 1 초짜리 짧은 클립이든, 10 분짜리 긴 영화든, AI 는 항상 똑같은 두께의 책을 만들어야 했습니다.
- 만약 비디오가 단순한 '하늘' 장면이라면, 책의 90% 는 빈 페이지로 채워져야 하고, 복잡한 '폭발 장면'이라면 책이 너무 두꺼워져서 읽기 (학습하기) 가 힘들어집니다.
- 문제점: AI 는 이 두꺼운 책의 **모든 페이지 (픽셀)**를 하나하나 외워야 하므로, 컴퓨터 자원이 엄청나게 많이 들고 학습 속도가 느립니다.
2. VideoFlexTok 의 방식: "요약본부터 시작하는 유연한 스토리텔링"
VideoFlexTok 은 비디오를 **가변적인 길이 (Flexible-Length)**의 토큰 (데이터 조각) 시퀀스로 변환합니다. 핵심은 ' coarse-to-fine (거칠게 → 정교하게)' 접근법입니다.
- 비유: 비디오를 소설의 줄거리로 생각해보세요.
- 첫 번째 토큰 (요약): "한 남자가 붉은 차를 타고 숲속 도로를 달린다." (이것만으로도 전체적인 의미와 움직임이 잡힙니다.)
- 중간 토큰 (디테일 추가): "나무들이 흔들리고, 차는 약간 속도를 줄인다."
- 마지막 토큰 (고해상도): "나뭇잎의 무늬, 차의 반사광, 도로의 갈라진 틈까지."
VideoFlexTok 의 장점:
- 간단한 비디오: 요약만 1~2 줄로 표현해도 충분합니다. (데이터 양이 줄어듦)
- 복잡한 비디오: 요약 뒤에 디테일을 조금씩 추가하면 됩니다.
- 핵심: AI 는 처음에 **가장 중요한 정보 (의미, 움직임)**를 먼저 배우고, 나중에 세부적인 묘사를 추가합니다.
3. 이 기술이 가져온 놀라운 변화
① "10 초짜리 영화를 8 배 더 가볍게!"
기존 방식은 10 초짜리 비디오를 생성하려면 약 5,376 개의 데이터 조각이 필요했습니다. 하지만 VideoFlexTok 은 672 개의 조각만으로 같은 영상을 만들 수 있습니다.
- 비유: 10 분짜리 영화를 보려면 기존에는 5,000 페이지짜리 책을 읽어야 했지만, 이제는 핵심 요약 600 페이지만 읽어도 영화의 흐름과 감동을 다 느낄 수 있게 된 것입니다.
- 결과: 컴퓨터의 계산 비용 (연산량) 이 8 배나 줄어듭니다.
② "작은 모델도 큰 일을 한다"
기존 방식은 고화질 영상을 만들려면 거대한 AI 모델 (52 억 개 파라미터) 이 필요했습니다. 하지만 VideoFlexTok 을 쓰면 **10 배 작은 모델 (11 억 개 파라미터)**로도 비슷한 화질의 영상을 만듭니다.
- 비유: 거대한 트럭 (큰 모델) 이 없어도, 효율적인 스포츠카 (작은 모델) 로도 목적지까지 빠르게 도착할 수 있게 된 것입니다.
③ "원하는 만큼만 디테일을 조절"
사용자가 "간단한 스케치만 보여줘"라고 하면 1~2 개의 토큰만 사용하고, "고화질로 보여줘"라고 하면 토큰을 더 추가하면 됩니다.
- 비유: 그림을 그릴 때, 처음엔 막대인형으로 대략적인 포즈를 잡고, 필요하면 근육과 옷 주름을 하나씩 추가하는 것과 같습니다.
4. 결론: 왜 이것이 중요한가요?
VideoFlexTok 은 비디오 생성 AI 의 '효율성'과 '접근성'을 혁신했습니다.
- 지금까지: 고화질 비디오를 만들려면 거대한 서버와 엄청난 전기가 필요했습니다.
- 이제부터: 이 기술을 통해 더 작은 컴퓨터에서도 더 긴 시간의 고품질 비디오를 만들 수 있게 되었습니다. 마치 고해상도 영화를 스마트폰에서도 부드럽게 재생할 수 있게 된 것과 같습니다.
이 기술은 앞으로 우리가 매일 접하게 될 AI 비디오 생성 서비스 (예: Sora, Runway 등) 가 더 빠르고, 저렴하며, 더 많은 사람들이 이용할 수 있는 기반이 될 것입니다.
1. 문제 정의 (Problem)
기존 비디오 생성 모델 (Text-to-Video 등) 은 다음과 같은 근본적인 한계에 직면해 있습니다:
- 고정된 3D 그리드 토큰화: 대부분의 기존 토크나이저 (VAE 기반) 는 비디오를 시공간적 3D 그리드로 고정된 크기의 토큰으로 변환합니다. 이는 비디오의 내용 복잡도와 관계없이 항상 동일한 수의 토큰을 생성함을 의미합니다.
- 비효율적인 학습: 생성 모델은 모든 토큰을 통해 저수준의 픽셀 세부 사항부터 고수준의 의미론적 정보 (의미, 운동) 까지 모두 예측해야 하므로 학습 복잡도가 매우 높습니다.
- 긴 비디오 생성의 어려움: 비디오 길이가 길어질수록 토큰 수가 기하급수적으로 증가하여, 생성 모델의 컨텍스트 길이 제한과 계산 비용 (FLOPs) 이 급증합니다. 예를 들어, 10 초짜리 비디오를 생성하려면 기존 방식은 수천 개의 토큰이 필요하여 실용성이 떨어집니다.
2. 방법론 (Methodology)
VideoFlexTok 은 비디오를 **유연한 길이 (Flexible-Length)**의 coarse-to-fine (거칠기에서 정밀함으로) 순서로 배열된 토큰 시퀀스로 표현하는 새로운 아키텍처입니다.
핵심 구성 요소
Coarse-to-Fine 토큰 구조:
- 비디오를 고정된 그리드가 아닌, 가변 길이의 토큰 시퀀스로 인코딩합니다.
- 초기 토큰: 가장 중요한 추상적 정보 (시맨틱, 객체, 전체 장면 기하학, 카메라/객체 운동) 를 포착합니다.
- 후속 토큰: 세부적인 디테일 (색상, 질감 등) 을 추가합니다.
- Nested Dropout: 인코더의 레지스터 토큰 (Register Tokens) 에 무작위로 일부 토큰을 드롭하여, 모델이 적은 토큰으로도 핵심 정보를 학습하도록 유도합니다.
생성형 플로우 디코더 (Generative Flow Decoder):
- 임의의 개수의 토큰 (예: 1 개부터 전체 토큰까지) 을 입력받아 현실적인 비디오를 복원할 수 있는 Rectified Flow 기반 디코더를 사용합니다.
- 이는 토큰 수를 줄여도 비디오가 끊기지 않고 자연스럽게 생성되도록 보장합니다.
시맨틱 바이어스 (Semantic Bias Loss):
- REPA (Representation Alignment) 손실 함수를 사용하여, 디코더가 사전 학습된 시맨틱 특징 추출기 (DINOv2) 와 정렬되도록 합니다.
- 이를 통해 초기 토큰들이 픽셀 수준의 세부사항이 아닌 의미론적 정보 (객체 종류, 운동 패턴 등) 를 효과적으로 인코딩하도록 유도합니다.
시간적 인과성 (Time-Causal Attention):
- 인코더와 디코더 모두 시간적 인과성 (Time-Causal) 어텐션 마스크를 사용합니다. 이는 미래 프레임을 보지 않고 과거 정보만으로 토큰을 생성하므로, 스트리밍 및 긴 비디오 생성에 적합합니다.
3. 주요 기여 (Key Contributions)
- 가변 길이 및 계층적 표현: 비디오의 복잡도나 하위 작업의 필요에 따라 토큰 수를 동적으로 조절할 수 있습니다. 적은 토큰으로 핵심 의미와 운동을, 많은 토큰으로 고해상도 디테일을 표현합니다.
- 계산 효율성 극대화: 하위 생성 모델 (Autoregressive Transformer) 이 예측해야 하는 토큰 수를 획기적으로 줄여, 동일한 성능을 더 작은 모델로 달성하거나 더 적은 학습 데이터로 훈련할 수 있게 합니다.
- 긴 비디오 생성 가능: 10 초 (81 프레임) 길이의 비디오를 생성하는 데 기존 방식 (5376 토큰) 대비 8 배 적은 672 개의 토큰만 사용하여 성공적으로 구현했습니다.
4. 실험 결과 (Results)
논문은 Class-to-Video 및 Text-to-Video 작업에서 VideoFlexTok 의 우수성을 입증했습니다.
- 생성 효율성 (Efficiency):
- 모델 크기: VideoFlexTok 을 사용하면 3D 그리드 토크나이저 대비 **5 배 작은 모델 (1.1B vs 5.2B 파라미터)**로도 동등한 생성 품질 (gFVD, ViCLIP 점수) 을 달성했습니다.
- 학습 비용: 동일한 성능을 위해 필요한 학습 토큰 수를 5~10 배 줄일 수 있었습니다.
- 긴 비디오 생성:
- 10 초 길이의 비디오를 672 개의 토큰만으로 생성하여, 기존 방식의 8 배 효율성을 입증했습니다. 이는 긴 비디오 생성 시 컨텍스트 길이 제한을 우회하는 핵심 기술입니다.
- 품질 유지:
- 토큰 수를 줄여도 (예: 프레임당 1~4 개 토큰) 시맨틱 정보와 운동 패턴은 잘 유지되며, 토큰 수를 늘리면 세부 사항이 추가되는 유연한 제어가 가능했습니다.
- 기타 비교:
- 기존 VidTok, Cosmos-DV, LARP 등 주요 토크나이저들과 비교했을 때, 더 적은 토큰 수 (160 개) 로도 동등하거나 더 나은 생성 품질과 정렬도 (Alignment) 를 보여주었습니다.
5. 의의 및 결론 (Significance)
VideoFlexTok 은 비디오 생성 분야에서 다음과 같은 중요한 의의를 가집니다:
- 계산 비용의 민주화: 비디오 생성 모델의 훈련 및 추론 비용을 획기적으로 낮추어, 더 많은 연구자와 개발자가 고품질 비디오 생성 모델을 접근하고 활용할 수 있게 합니다.
- 효율적인 추상화 학습: 픽셀 단위의 예측 대신, 의미론적 추상화 단계를 먼저 학습하는 계층적 구조를 통해 모델이 비디오의 장기적 의존성 (Long-range dependencies) 을 더 효율적으로 학습할 수 있게 합니다.
- 유연한 생성 제어: 생성자가 원하는 디테일 수준에 따라 토큰 수를 조절함으로써, 빠른 프로토타이핑부터 고해상도 생성까지 하나의 토크나이저로 다양한 시나리오를 지원할 수 있습니다.
결론적으로, VideoFlexTok 은 고정된 3D 그리드 방식의 한계를 극복하고, 유연한 길이와 계층적 구조를 통해 비디오 생성의 효율성과 확장성을 혁신한 획기적인 연구로 평가됩니다.
매주 최고의 machine learning 논문을 받아보세요.
스탠포드, 케임브리지, 프랑스 과학 아카데미 연구자들이 신뢰합니다.
받은편지함에서 구독을 확인해주세요.
문제가 발생했습니다. 다시 시도하시겠어요?
스팸 없음, 언제든 구독 취소 가능.
주간 다이제스트 — 가장 새로운 연구를 쉽게 설명.구독