← 최신 논문
💻 computer science

MOVA: Towards Scalable and Synchronized Video-Audio Generation

MOVA는 고품질의 동기화된 시청각 콘텐츠 생성을 위해 32B 파라미터 규모의 MoE(Mixture-of-Experts) 구조를 채택하여 이미지와 텍스트로부터 비디오와 오디오를 동시에 생성하는 오픈 소스 모델입니다.

원저자: OpenMOSS Team, Donghua Yu, Mingshu Chen, Qi Chen, Qi Luo, Qianyi Wu, Qinyuan Cheng, Ruixiao Li, Tianyi Liang, Wenbo Zhang, Wenming Tu, Xiangyu Peng, Yang Gao, Yanru Huo, Ying Zhu, Yinze Luo, Yiyang Zh
게시일 2026-02-11
📖 2 분 읽기☕ 가벼운 읽기

원저자: OpenMOSS Team, Donghua Yu, Mingshu Chen, Qi Chen, Qi Luo, Qianyi Wu, Qinyuan Cheng, Ruixiao Li, Tianyi Liang, Wenbo Zhang, Wenming Tu, Xiangyu Peng, Yang Gao, Yanru Huo, Ying Zhu, Yinze Luo, Yiyang Zhang, Yuerong Song, Zhe Xu, Zhiyu Zhang, Chenchen Yang, Cheng Chang, Chushu Zhou, Hanfu Chen, Hongnan Ma, Jiaxi Li, Jingqi Tong, Junxi Liu, Ke Chen, Shimin Li, Shiqi Jiang, Songlin Wang, Wei Jiang, Zhaoye Fei, Zhiyuan Ning, Chunguo Li, Chenhui Li, Ziwei He, Zengfeng Huang, Xie Chen, Xipeng Qiu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🎬 한 줄 요약: "눈과 귀가 동시에 똑똑해진 AI 영화 감독"

지금까지의 AI는 영상을 만드는 능력(눈)과 소리를 만드는 능력(귀)이 따로 놀았습니다. 영상 AI에게 "강아지가 짖는 영상 만들어줘"라고 하면 영상은 잘 만드는데, 소리가 엉뚱한 타이밍에 나오거나 아예 안 나오는 경우가 많았죠.

MOVA는 이 '눈'과 '귀'를 하나의 뇌로 연결해서, 영상과 소리가 마치 실제 세상처럼 완벽하게 딱딱 맞아떨어지게 만드는 기술입니다.


💡 이해를 돕는 비유: "따로 노는 오케스트라 vs 완벽한 지휘자"

1. 기존 방식: "악보 없이 연주하는 두 팀" (Cascaded Pipeline)

기존에는 영상 팀이 먼저 영상을 다 만들고 나면, 소리 팀에게 "자, 여기 영상 줄 테니까 대충 어울리는 소리 좀 입혀봐"라고 시켰습니다.

  • 문제점: 영상 팀이 드럼을 '쾅!' 하고 쳤는데, 소리 팀은 한 박자 늦게 '쾅!' 소리를 내는 식이죠. 눈과 귀가 서로 대화하지 않으니 박자가 어긋나고 어색해집니다.

2. MOVA 방식: "천재 지휘자가 이끄는 통합 오케스트라" (Dual-Tower Architecture)

MOVA는 영상 팀과 소리 팀 사이에 **'초고속 통신 브릿지(Bridge)'**라는 지휘자를 세웠습니다.

  • 작동 원리: 영상이 만들어지는 찰나의 순간에 소리 팀과 끊임없이 대화를 나눕니다. "지금 입 모양이 이렇게 움직이니까, 소리는 이 타이밍에 이 느낌으로 내야 해!"라고 실시간으로 맞추는 거죠. 덕분에 사람이 말할 때 입 모양과 목소리가 자석처럼 착 달라붙게 됩니다.

✨ MOVA가 잘하는 3가지 필살기

  1. "입 모양의 마법" (Precise Lip-Sync):
    사람이 말을 할 때 입술이 움직이는 미세한 모양과 목소리의 발음을 완벽하게 일치시킵니다. 외국어를 하는 영상에서도 입 모양이 어색하지 않게 만들 수 있죠.

  2. "현장감 넘치는 효과음" (Environment-aware Sound):
    단순히 소리를 넣는 게 아니라, 영상 속 상황을 이해합니다. 유리잔이 깨지면 '챙그랑', 숲속을 걸으면 '바스락' 하는 소리를 영상 속 움직임과 정확한 타이밍에 맞춰 생성합니다.

  3. "글자까지 써주는 똑똑함" (Scene Text Generation):
    영상 속에 "새해 복 많이 받으세요" 같은 글자를 자연스럽게 그려 넣는 능력도 갖추고 있습니다.


🚀 왜 이 연구가 대단한가요? (Open Source의 힘)

가장 중요한 점은, 이 엄청난 기술을 가진 모델을 **'오픈 소스(Open Source)'**로 공개했다는 것입니다.

지금까지 구글이나 오픈AI 같은 거대 기업들이 자기들만 알고 있던 '비밀 레시피'를, MOVA 팀은 전 세계 누구나 가져다 쓸 수 있도록 **'공개 레시피'**로 풀어버린 셈입니다. 덕분에 이제 전 세계의 창작자들이 이 기술을 이용해 훨씬 더 실감 나는 영화, 애니메이션, 게임 영상을 만들 수 있는 길이 열렸습니다.


📝 요약하자면...

MOVA는 영상과 소리를 따로 만드는 게 아니라, 처음부터 '하나의 세트'로 생각하고 만드는 AI입니다. 덕분에 우리는 이제 AI가 만든 영상에서도 "어? 소리가 왜 저 타이밍에 나와?"라는 어색함 없이, 진짜 현실 같은 몰입감을 느낄 수 있게 되었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →