기존의 방식 (VACE): imagine 하세요. 한 편의 영화를 다 찍고 나서, 편집자가 모든 장면을 한 번에 펼쳐놓고 "이 장면은 배경을 바꿔주고, 저 장면은 캐릭터를 바꿔주고, 이 부분은 지워줘"라고 지시하는 방식입니다.
장점: 정교하고 완벽합니다.
단점: 모든 장면을 다 봐야만 편집이 가능합니다. 실시간으로 방송을 나가면서 "지금부터 이 장면을 고쳐줘"라고 하면, 이미 지나간 장면을 다시 뒤로 돌려서 봐야 하므로 실시간 방송에는 쓸 수 없습니다.
실시간 방식 (Autoregressive): 반면, 실시간 방송은 현재 화면과 과거 화면만 보고 다음 장면을 그리는 방식입니다. "이제부터 이 그림을 그려줘"라고 하면, 과거의 그림만 기억하고 새로운 그림을 그립니다.
문제: 기존에 있던 '강력한 편집 도구 (VACE)'는 모든 장면을 한 번에 보는 방식이라서, 실시간 방송 시스템과는 상극이었습니다.
2. 해결책: "참고 자료"를 따로 떼어놓다
저자는 이 문제를 해결하기 위해 아주 똑똑한 방법을 고안했습니다.
기존 방식의 문제점: VACE 는 '참고할 사진 (Reference)'과 '만들고 싶은 영상 (Video)'을 같은 상자에 섞어서 처리했습니다. 실시간 방송에서는 이 상자가 계속 커지고, 과거의 '참고 사진'까지 기억해야 하므로 시스템이 혼란에 빠집니다. 마치 요리사가 레시피 (참고 사진) 와 재료를 섞어서 냄비에 넣고 끓이다가, 나중에 레시피를 빼내려고 애쓰는 상황과 같습니다.
새로운 방식 (이 논문의 핵심): 저자는 '레시피 (참고 사진)'를 냄비에서 꺼내서, 옆에 따로 놓았습니다.
주요 역할 (DiT): 냄비 속의 재료 (영상) 만을 끓입니다.
보조 역할 (Context Blocks): 옆에 있는 레시피를 보고 "이제 소금 좀 넣으세요", "이제 색을 바꿔주세요"라고 **메시지 (Hint)**만 전달합니다.
결과: 냄비 (영상) 의 크기는 일정하게 유지되면서, 옆에서 레시피를 보고 지시만 받으면 됩니다.
이렇게 하면 실시간 방송 시스템이 요구하는 '고정된 크기'와 '과거만 기억하는 방식'을 해치지 않으면서, 강력한 편집 기능을 그대로 쓸 수 있게 됩니다.
3. 왜 이 방법이 멋진가요? (장점)
재교육 불필요 (Zero-shot Transfer): 기존에 훈련된 거대한 '편집 도구 (VACE)'를 아예 다시 가르칠 필요 없이 그대로 가져다 쓸 수 있습니다. 마치 기존에 만든 고급 조리 도구를 새로운 주방에 그대로 가져와서 바로 쓰는 것과 같습니다.
실시간 성능: 일반 가정용 컴퓨터 (RTX 5090 등) 에서도 초당 1722 장의 영상을 실시간으로 만들 수 있습니다. 편집 기능을 추가해도 속도가 2030% 만 느려질 뿐, 거의 실시간에 가깝습니다.
다양한 기능:
구조 제어: 손짓 (포즈), 깊이 지도 (Depth), 낙서 (Scribble) 로 영상을 만들 수 있습니다.
부분 편집: 영상의 특정 부분만 지우거나 (Inpainting), 새로 그릴 수 있습니다.
시간 확장: 영상의 길이를 늘릴 수 있습니다.
4. 아쉬운 점 (한계)
모든 것이 완벽하지는 않습니다.
참고 사진의 정밀도: "이 사진과 똑같은 얼굴로 영상을 만들어줘"라는 기능 (Reference-to-Video) 은 기존 방식보다 품질이 떨어집니다. 실시간으로 과거만 보고 그리는 특성상, 참고 사진의 디테일을 완벽하게 따라가기 어렵기 때문입니다. (비유: 과거의 기억만 가지고 그리는 그림이라, 원본 사진의 미세한 주름까지 완벽하게 재현하기는 어렵습니다.)
오래된 영상: 영상이 너무 길어지면 (100 프레임 이상) 앞뒤가 안 맞을 수 있습니다.
5. 요약
이 논문은 **"실시간 영상 생성 AI 에도 기존에 있던 강력한 '편집 기능'을 붙이고 싶다면, 참고 자료를 영상 자체에서 떼어내서 '지시 메시지'로만 전달하면 된다"**는 것을 증명했습니다.
기존의 거대한 AI 모델을 다시 훈련시킬 필요 없이, 아키텍처 (구조) 만 살짝 바꿔서 실시간 방송이 가능한 '스마트한 편집 도구'를 만들어낸 것입니다. 이는 실시간 영상 생성 기술의 한계를 넓히는 중요한 한 걸음입니다.
논문 요약: 실시간 자동회귀 비디오 생성을 위한 VACE 적응
이 논문은 일괄 처리 (Batch) 기반의 통합 비디오 제어 모델인 VACE(Video All-in-one Creation and Editing) 를 **실시간 자동회귀 **(Real-time Autoregressive) 생성 파이프라인에 호환되도록 적응시키는 방법을 제안합니다. 기존 VACE 는 전체 시퀀스에 대한 양방향 주의 (Bidirectional Attention) 를 가정하여 스트리밍 환경과 비호환되었으나, 본 연구는 기존 가중치를 재학습 없이 그대로 활용하면서도 실시간 스트리밍 생성을 가능하게 하는 아키텍처 변경을 제시합니다.
**1. 문제 정의 **(The Problem)
실시간 비디오 생성의 한계: LongLive, Krea Realtime Video, StreamDiffusion V2 와 같은 최신 실시간 모델들은 고정된 크기의 청크 (Chunk) 단위로 비디오를 생성하며, 과거 프레임에만 주의하는 **인과적 주의 **(Causal Attention)와 KV 캐싱을 사용하여 메모리 효율성을 확보합니다. 그러나 이러한 모델들은 참조 가이드, 구조적 조건부 생성, 선택적 편집 (Inpainting/Outpainting) 등 일괄 처리 모델이 제공하는 고급 제어 기능을 결여하고 있습니다.
기존 VACE 의 비호환성: VACE 는 참조 프레임 (Reference Frames) 을 확산 잠재 공간 (Diffusion Latent Space) 에 직접 연결 (Concatenation) 하고 전체 시퀀스를 양방향으로 처리합니다. 이는 다음과 같은 이유로 스트리밍 파이프라인과 충돌합니다.
가변 시퀀스 길이: 작업에 따라 참조 프레임 수가 달라 고정된 청크 크기를 요구하는 스트리밍 모델과 호환되지 않음.
KV 캐시 오염: 참조 프레임이 생성된 과거 프레임처럼 캐시되어 인과적 역사에 포함되면, 위치 인코딩 (RoPE) 이 왜곡되고 의미론적으로 잘못된 생성이 발생함.
후처리 오버헤드: 각 디노이징 단계 후 참조 프레임을 식별하고 제거해야 하는 추가 비용 발생.
**2. 방법론 **(Methodology)
저자들은 VACE 의 제어 기능을 실시간 스트리밍 환경에 적용하기 위해 아키텍처적 수정을 제안합니다.
**병렬 조건부 경로 **(Parallel Conditioning Pathway)
참조 프레임을 확산 잠재 공간 (Video Latents) 에 연결하는 대신, 별도의 병렬 경로로 이동시킵니다.
비디오 잠재 변수는 청크 단위로만 디노이징되며, 참조 프레임은 별도의 Context Blocks를 통해 처리되어 "힌트 (Hints)"라는 가산 신호를 생성합니다.
이 힌트는 제로 초기화 (Zero-initialized) 된 선형 프로젝션을 통해 메인 Diffusion Transformer (DiT) 경로에 주입됩니다.
**가중치 재사용 **(Weight Transfer)
VACE 는 베이스 DiT 를 동결 (Frozen) 하고 Context Blocks 만 학습하는 Context Adapter Tuning 방식을 사용합니다.
제안된 아키텍처는 참조 프레임의 입력 위치와 힌트 주입 위치만 변경할 뿐, Context Blocks 내부의 가중치 구조나 제로 초기화 프로젝션은 유지합니다. 따라서 **추가 학습 **(Fine-tuning)
스트리밍 호환성 확보:
고정된 청크 크기를 유지하여 KV 캐싱을 가능하게 합니다.
마스크 (Mask), 깊이 (Depth), 포즈 (Pose) 등 다양한 제어 신호는 기존 메커니즘을 그대로 사용하되, 인코더 캐시를 분리하여 시간적 통계의 오염을 방지합니다.
**3. 주요 기여 **(Key Contributions)
아키텍처 혁신: 참조 프레임을 잠재 공간에서 분리하여 병렬 조건부 경로로 이동시킴으로써, VACE 의 참조 처리 방식과 고정 크기 청크 처리 간의 비호환성을 해결했습니다.
**학습 없는 전이 **(Zero-shot Transfer) 사전 학습된 VACE Context Block 가중치가 미세 조정 없이 적응된 아키텍처에 직접 적용 가능함을 증명했습니다.
실시간 성능 검증: Wan2.1 기반의 1.3B 및 14B 모델 규모에서 구조적 제어 (Depth, Scribble, Flow 등), 마스크 생성 (Inpainting/Outpainting), 시간적 확장 (Temporal Extension) 이 소비자 하드웨어에서 17~22 FPS의 실시간 속도로 작동함을 검증했습니다.
범용성: 동일한 적응 코드를 사용하여 1.3B 와 14B 모델 규모 모두에서 모델별 수정 없이 작동함을 확인했습니다.
**4. 실험 결과 **(Results)
성능 오버헤드:
**1.3B 모델 **(RTX 5090) 구조적 제어 및 인페인팅 시 레이턴시가 약 20~30% 증가 (기반 539ms → 698ms), VRAM 사용량은 약 1.4GB 증가.
**14B 모델 **(H100) VRAM 오버헤드는 베이스 모델 대비 무시할 수준이며, 레이턴시 증가폭은 1.3B 모델과 유사한 20~30% 수준입니다.
기능별 성능:
구조적 제어 및 마스크 생성: 깊이, 스케치, 광학 흐름, 레이아웃, 인페인팅/아웃페인팅이 실시간으로 잘 작동하며 제어 준수도가 높습니다.
**참조-to-비디오 **(Reference-to-Video) 인과적 주의 제약과 청크 단위 처리로 인해 품질이 일괄 처리 VACE 에 비해 심각하게 저하됩니다. 세부 사항 보존 및 참조 충실도가 떨어집니다.
시간적 확장: 첫 번째와 마지막 프레임을 기반으로 한 확장은 청크 크기의 제한으로 인해 일괄 처리 대비 유용성이 감소합니다.
**5. 의의 및 결론 **(Significance)
이 연구는 **사전 학습된 대규모 비디오 제어 모델 **(VACE)을 보여줍니다.
효율성: 별도의 재학습 없이 기존 가중치를 재활용하여 개발 시간을 단축하고, 실시간 스트리밍 환경에 고급 제어 기능을 도입할 수 있습니다.
실용성: 소비자급 하드웨어에서도 실시간으로 구조적 제어와 편집이 가능한 비디오 생성 파이프라인을 구축할 수 있게 되었습니다.
한계 및 향후 과제: 참조-to-비디오 생성의 품질 저하와 인과적 주의의 한계는 여전히 존재하며, 이를 해결하기 위한 추가적인 아키텍처 연구가 필요합니다. 또한, 일괄 처리 모델과의 직접적인 품질 비교는 베이스 모델의 차이로 인해 명확히 분리하기 어렵다는 점도 지적됩니다.
결론적으로, 이 적응 방식은 실시간 비디오 생성 분야에서 제어 가능성 (Controllability) 과 실시간성 (Real-time capability) 사이의 균형을 잡는 중요한 진전으로 평가됩니다.