← 최신 논문
💻 computer science

Flex-Forcing: Towards a Unified Autoregressive and Bidirectional Video Diffusion Model

Flex-Forcing은 유연한 청킹 메커니즘을 채택하여 전역적 일관성을 위한 양방향 추론과 효율성을 위한 자기회귀적 생성을 결합함으로써, 경직된 베이스라인 방법들보다 우수한 비디오 품질, 긴 비디오 안정성 및 더 빠른 추론을 달성하는 통합 비디오 확산 프레임워크이다.

원저자: Xinyin Ma, Julius Berner, Chao Liu, Arash Vahdat, Weili Nie, Xinchao Wang

게시일 2026-07-07
📖 3 분 읽기☕ 가벼운 읽기

원저자: Xinyin Ma, Julius Berner, Chao Liu, Arash Vahdat, Weili Nie, Xinchao Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 30초짜리 영화 장면을 그려내는 화가라고 상상해 보세요. 당신에게는 두 가지 주요한 방법이 있지만, 둘 다 결점이 있습니다.

  1. "역방향-순방향" 화가 (양방향 방식): 이 예술가는 캔버스 전체를 한꺼번에 봅니다. 시작, 중간, 끝을 동시에 보죠. 덕분에 이야기가 말이 되고, 조명이 일관되며, 캐릭터의 옷이 갑자기 바뀌는 일도 없습니다. 하지만 엄청나게 느립니다. 붓질을 한 번 할 때마다 전체 그림을 다시 검토해야 하기 때문입니다.
  2. "한 번에 한 획씩" 화가 (자기회귀 방식): 이 예술가는 왼쪽에서 오른쪽으로 프레임 단위로 그림을 그립니다. 이미 그린 부분만 봅니다. 매우 빠르고 스트리밍에 적합하지만, 미래를 볼 수 없기 때문에 첫 프레임에서는 캐릭터가 왼쪽으로 걷게 했다가, 마지막 프레임에서는 실수로 오른쪽으로 걷게 만들 수도 있습니다. 이야기가 시간이 지날수록 "표류"하고 일관성을 잃게 됩니다.

**플렉스 포싱(Flex-Forcing)**은 이 두 세계의 장점만을 결합한 새로운 "슈퍼 화가"입니다. 이는 당신에게 속도와 품질 중 하나를 선택하도록 강요하지 않습니다. 대신, 상황에 따라 두 스타일 사이를 자유롭게 전환할 수 있는 **스마트하고 유연한 자(ruler)**를 제공합니다.

이것이 어떻게 작동하는지, 쉬운 비유를 통해 설명하겠습니다.

1. 유연한 자 (유연한 청킹/Flexible Chunking)

긴 책을 읽는다고 상상해 보세요.

  • 기존 방식: 책 전체를 한꺼번에 읽거나(느리지만 전체 줄거리를 파악함), 단어 하나하나를 읽거나(빠르지만 줄거리를 잊어버릴 수 있음) 둘 중 하나를 선택해야 합니다.
  • 플렉스 포싱 방식: 당신은 자를 사용하여 책을 "덩어리(chunk)"로 나눕니다.
    • 과정 초반 (높은 노이즈 단계): 영상이 그저 흐릿한 아이디어 덩어리일 때, 플렉스 포싱은 큰 덩어리를 사용합니다. 영상의 큰 구도(카메라 움직임이나 주요 장면 등)를 계획하기 위해 한 번에 넓은 구역을 봅니다. 이를 통해 이야기가 탄탄한 구조를 갖추게 합니다.
    • 과정 후반 (낮은 노이즈 단계): 영상이 점점 선명해지고 세부 묘사가 생겨날 때, 모델은 작은 덩어리로 전환합니다. 타들어 가는 양초나 특정 얼굴 표정 같은 아주 작은 디테일에 집중합니다. 이는 빠르고 효율적입니다.

즉, 이 모델은 필요한 디테일의 정도에 따라 언제 앞을 내다보고 언제 앞으로 나아갈지를 결정하는 "똑똑함"을 갖추고 있습니다.

2. 노이즈 번역기 (K-프로젝션/K-Projection)

까다로운 문제가 하나 있습니다. 모델이 "과거"(이미 그린 부분)를 볼 때, 그 부분은 매우 깨끗하고 선명합니다. 하지만 "미래"(아직 그리지 않은 부분)를 볼 때는 여전히 흐릿하고 노이즈가 섞인 추측일 뿐입니다.

만약 깨끗한 사진과 흐릿한 스케치를 서로 비교하려고 하면, 서로 맞지 않아 예술가가 혼란에 빠질 수 있습니다.

  • 해결책: 플렉스 포싱은 특별한 "번역기"(K-프로젝션이라 불림)를 사용합니다. 모델이 과거와 미래를 비교하기 전에, 깨끗한 과거 부분에 의도적으로 약간의 "흐림(blur)"을 추가하여 미래 부분의 노이즈 수준과 일치시킵니다.
  • 결과: 이제 모델은 과거와 미래를 나란히 놓고도 혼란 없이 비교할 수 있으며, 이를 통해 영상을 빠르게 생성하면서도 전체 과정을 매끄럽게 계획할 수 있습니다.

3. "어디든 편집 가능한" 슈퍼 파워

이 모델은 생성하는 동안에도 전체 영상의 구조를 이해하고 있기 때문에, 일반적인 빠른 화가들은 할 수 없는 일을 해냅니다. 바로 중간 부분을 편집해도 끝부분을 망치지 않는 것입니다.

  • 일반적인 빠른 화가: 만약 당신이 영화 중간에 캐릭터의 셔츠를 바꿔달라고 요청하면, 그들은 원래의 계획을 놓쳐버려 마지막 프레임에서 캐릭터의 얼굴까지 바꿔버릴 수도 있습니다.
  • 플렉스 포싱: "중간에 셔츠를 바꿔줘"라고 말하면, 모델은 이를 수행합니다. 왜냐하면 머릿속에 "큰 그림" 계획을 계속 유지하고 있었기 때문에, 영화의 끝이 시작과 완벽하게 일치하도록 만들 수 있기 때문입니다. 마치 책 전체를 다시 쓰지 않고도 챕터를 재배열하는 것처럼, 어떤 순서로든 영상의 어느 부분이든 편집할 수 있습니다.

이것이 왜 중요한가 (논문에 따르면)

이 논문은 플렉스 포싱이 기존의 최고 방법들(예: "셀프 포싱/Self-Forcing")을 두 가지 핵심적인 면에서 능가한다고 주장합니다.

  1. 더 나은 품질: 영상이 더 일관적입니다. 캐릭터가 이상하게 변형되지 않으며, 움직임이 훨씬 부드럽습니다.
  2. 더 나은 속도: "모든 것을 다 보는" 느린 모델들보다 훨씬 빠르게 영상을 생성하면서도, 높은 품질을 유지합니다.

요약하자면, 플렉스 포싱은 GPS(경로 계획용)와 스포츠카(빠른 주행용)를 모두 갖춘 비디오 생성기입니다. 목적지를 아는 것과 빠르게 달리는 것 중 하나를 선택할 필요 없이, 두 가지를 동시에 해낼 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →