← 최신 논문
💻 computer science

MobileWan: Closing the Quality Gap for Mobile Video Diffusion

MobileWan은 순환적 재구성(recurrent reformulation), 구조적 어텐션 프루닝(structured attention pruning) 및 증류(distillation)를 통해 메모리가 제한된 모바일 기기에서 고품질 50억 파라미터 비디오 확산 트랜스포머를 효율적으로 배포할 수 있게 하는 새로운 프레임워크를 도입하여, 낮은 지연 시간과 함께 최첨단 생성 성능을 달성합니다.

원저자: Mohsen Ghafoorian, Denis Korzhenkov, Adil Karjauv, Ioannis Lelekas, Noor Fathima, Spyridon Stasis, Hanno Ackermann, Boris van Breugel, Markus Nagel, Fatih Porikli, Animesh Karnewar, Amirhossein Habibi
게시일 2026-07-08
📖 4 분 읽기☕ 가벼운 읽기

원저자: Mohsen Ghafoorian, Denis Korzhenkov, Adil Karjauv, Ioannis Lelekas, Noor Fathima, Spyridon Stasis, Hanno Ackermann, Boris van Breugel, Markus Nagel, Fatih Porikli, Animesh Karnewar, Amirhossein Habibian

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 엄청난 고화질 비디오 요리를 할 수 있는 마스터 셰프(거대하고 강력한 AI 모델)를 가지고 있다고 상상해 보세요. 문제는 이 셰프의 주방이 축구 경기장만큼 거대하며, 재료를 보관하기 위해 창고 하나가 통째로 필요하다는 점입니다. 당신은 이 셰프를 데려와서 스마트폰(작은 푸드 트럭) 안에서 이동하며 똑같이 맛있는 요리를 만들게 하고 싶습니다.

보통 거대한 셰프를 푸드 트럭에 맞게 줄이려고 하면, 직원의 절반을 해고하고 더 작고 저렴한 가스레인지를 사용해야 합니다. 그 결과, 음식은 먹을만하겠지만 경기장 버전만큼 맛있거나 디테일하지는 않게 됩니다.

MobileWan은 이 문제에 대한 팀의 해결책입니다. 그들은 단순히 셰프를 줄인 것이 아니라, 거대한 50억 파라미터 규모의 "경기장 셰프"(Wan2.2 모델 기반)가 공간이나 시간 부족 없이 실제로 스마트폰 안에서 작동할 수 있도록 주방을 완전히 재구성했습니다.

이들이 어떻게 했는지, 쉬운 비유를 통해 설명해 드리겠습니다.

1. "메모리 블랙홀" 문제

비디오 AI 모델은 보통 움직임을 부드럽게 유지하기 위해 비디오의 모든 프레임을 한꺼번에 기억하려고 시도합니다. 하드 드라이브가 아주 큰 컴퓨터라면 괜찮지만, 휴대폰에서는 이것이 마치 도서관의 책들을 주머니 속에 동시에 넣으려는 것과 같아서 휴대폰을 다운시켜 버립니다(메모리 부족 현상).

해결책: "청킹(Chunking)" 전략
영화 전체를 한꺼번에 기억하는 대신, MobileWan은 비디오를 작은 "덩어리(chunk)"(마치 짧은 장면들처럼)로 나눕니다. 하나의 덩어리를 생성하고, 그것의 아주 작은 요약본을 저장한 다음, 다음 덩어리로 넘어갑니다.

  • 비유: 이야기를 쓰는 것을 상상해 보세요. 지금까지 쓴 모든 단어를 머릿속에 담아두는 대신, 한 단락을 쓰고 나서 포스트잇에 짧은 요약을 적어둔 뒤 다음 단락으로 넘어가는 것입니다. 당신은 전체 책이 아니라 손에 든 포스트잇만 들고 있으면 됩니다. 이를 통해 휴대폰은 메모리 부족 없이 긴 비디오를 생성할 수 있습니다.

2. "과로하는 직원" 문제

AI 내부에는 많은 "어텐션 헤드(attention heads)"(비디오를 보고 있는 서로 다른 팀원들로 생각할 수 있음)가 있습니다. 50억 파라미터 모델에는 수백 명의 이런 팀원들이 있습니다. 어떤 이들은 훌륭하게 일하지만, 많은 이들이 그저 다른 사람들이 하는 일을 반복하거나 거의 아무것도 하지 않습니다.

해결책: "스마트한 해고"
팀은 어떤 팀원이 정말 필수적인지, 그리고 어떤 팀원을 내보낼 수 있는지 식별하기 위해 특별한 방법을 사용했습니다.

  • 비유: 100명의 위원회가 메뉴를 결정하려고 한다고 상상해 보세요. 팀은 그중 30명이 그저 고개를 끄덕이거나 아이디어를 반복하고 있을 뿐이라는 것을 알아냈습니다. 그들은 조용히 그 30명을 제거했습니다. 남은 70명은 더 열심히, 더 똑똑하게 일했고, 메뉴(비디오)는 여전히 맛있게 나왔지만, 회의는 훨씬 빨라졌고 더 적은 공간을 필요로 했습니다.

3. "느린 요리" 문제

더 작은 팀과 청킹 전략을 사용하더라도, 5초짜리 비디오를 요리하는 데 보통 100단계(식사를 하기 위해 100번의 작은 입질을 하는 것과 같음)가 걸립니다. 이는 휴대폰에게 너무 느립니다.

해결책: "빨리 감기 레시피"
그들은 "증류(distillation)"라고 불리는 기술을 사용했습니다.

  • 비유: 학생(모바일 모델)이 마스터 선생님(거대 서버 모델)으로부터 배우는 것을 상상해 보세요. 선생님이 학생에게 춤을 배우기 위해 100번의 작은 발걸음을 떼게 하는 대신, 선생님이 춤 전체를 보여주면 학생은 단 3번의 크고 자신감 있는 동작만으로 그 춤을 배울 수 있습니다. 결과는 같은 춤이지만, 훨씬 더 빠르게 수행됩니다.

4. "흐릿한 재생" 문제

휴대폰에서 비디오를 재생할 때, 디코더(AI의 수학적 계산을 실제 그림으로 바꾸는 부분)는 때때로 움직임을 덜컥거리거나 글리치(glitch)가 있는 것처럼, 마치 화질이 안 좋은 영상 통화처럼 만들 수 있습니다.

해결책: "더 좋은 카메라 렌즈"
그들은 각 새로운 프레임을 생성할 때 과거를 더 멀리 내다볼 수 있도록 디코더를 업그레이드했습니다.

  • 비유: 영화를 그리고 있다면, 현재 프레임 바로 앞의 프레임만 본다면 당신의 그림은 흔들릴 수 있습니다. MobileWan의 디코더는 움직임이 매끄럽게 흐르도록 마지막 4개의 프레임을 되돌아봅니다. 이는 마치 감독이 배우의 움직임이 일관적인지 확인하기 위해 지난 몇 개의 샷을 체크하는 것과 같습니다.

결과

이러한 기술들을 결합함으로써, 팀은 거대한 고품질 비디오 AI를 상용 스마트폰(Snapdragon 칩 탑재)에 담아내는 데 성공했습니다.

  • 성능:20초 만에 5초 길이의 비디오(480x832 해상도)를 생성할 수 있습니다.
  • 품질: 테스트 결과, 생성된 비디오는 거대 서버 버전만큼 높은 품질으로 평가되었으며, 기존 최고의 모바일 모델보다 인간 사용자들에게 80% 더 높은 선호도를 보였습니다.
  • 주장: 그들은 품질을 희생하지 않고도 휴대폰에서 비디오 AI를 구현할 수 있다는 것을 증명했습니다. 단, 모델이 생각하고 기억하는 방식이 더 똑똑해야 한다는 조건하에 말이죠.

요약하자면, MobileWan은 엔진을 재설계하고, 인력을 감축하며, 경로를 변경함으로써 호화로운 크루즈 선을 속도감 있는 모터보트로 변신시킨 것과 같습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →