LongCat-Video-Avatar 1.5 Technical Report
LongCat-Video-Avatar 1.5는 생산 준비도와 체계적인 공학을 우선시하여 가속화된 추론을 통해 상업용 등급의 안정적이고 신원 일관성이 보장된 장편 비디오 생성을 실현하며, 다양한 시나리오에서 주요 폐쇄형 소스 시스템을 능가하는 업그레이드된 오픈소스 프레임워크입니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 실제 인간처럼 말하고, 노래하고, 연기할 수 있는 디지털 캐릭터를 만들고 싶다고 상상해 보세요. 하지만 당신에게는 그들의 사진과 목소리 녹음 파일만 있습니다. 오랫동안 이 캐릭터들을 몇 초 이상 '실제처럼' 보이게 만드는 것은 폭풍 속의 카드 하우스를 균형 있게 유지하려는 시도와 같았습니다. 잠시 동안은 잘 보일지라도, 곧 얼굴이 왜곡되거나 입술이 말과 맞지 않거나 몸이 이상하게 움직이기 시작하곤 했습니다.
미투안 LongCat 팀의 LongCat-Video-Avatar 1.5 논문은 이러한 디지털 캐릭터를 구축하기 위한 새로운 오픈소스 '레시피'에 관한 기술 보고서입니다. 완전히 새로운 마법을 발명하는 대신, 그들은 영화, 뉴스, 고객 서비스 등 실제 현장에서 사용할 만큼 안정적인 결과를 얻기 위해 공학을 정교하게 다듬는 데 집중했습니다.
그들이 어떻게 이를 달성했는지 간단한 비유로 설명해 드리겠습니다.
1. "귀" 업그레이드: Whisper Large
이전 버전에서는 모델이 목소리를 듣기 위해 표준 "귀"(Wav2Vec2 라는 오디오 인코더) 를 사용했습니다. 나쁘지는 않았지만 때로는 말의 미묘한 뉘앙스를 놓치기도 했습니다.
- 업그레이드: 그들은 이를 훨씬 더 강력한 오디오 시스템인 Whisper Large로 교체했습니다.
- 비유: 이전 귀는 소음 방지를 위해 귀마개를 끼고 시끄러운 방에서 노래를 듣는 사람과 같습니다. 새로운 Whisper Large 는 조용한 스튜디오에 있는 최상급 노이즈 캔슬링 헤드폰을 끼는 것과 같습니다. 이는 목소리의 미세한 디테일까지 모두 들을 수 있게 하여, 캐릭터의 입술이 소리와 정확히 일치하도록 완벽하게 움직이게 하며, 긴 영상에서도 이를 유지합니다.
2. 데이터용 "헬스장": 학습 데이터셋 선별
디지털 배우에게 무작위 비디오만 보여준다고 해서 가르칠 수는 없습니다. 흐릿한 얼굴이 담긴 비디오나, 간판을 들고 있는 사람, 혹은 두 사람이 동시에 말하는 비디오를 보여주면 모델이 혼란에 빠집니다.
- 해결책: 그들은 엄격한 "데이터 헬스장"을 구축했습니다. 단순히 수천 개의 비디오를 시스템에 쏟아부은 것이 아니라, 도서관 사서가 도서관을 정리하듯 데이터를 분류했습니다.
- 침묵 데이터: 아무도 말하지 않을 때 (깜빡임, 숨 쉬기, 주변을 둘러보기 등) 모델이 무엇을 해야 하는지 가르쳐서, 오디오가 멈추었을 때 캐릭터가 얼어붙거나 이상해 보이지 않도록 했습니다.
- 감정 데이터: 모델에 다양한 감정 (웃음, 울음, 반응 등) 을 보여주는 사람들의 비디오를 특별히 공급하여, 캐릭터가 대본을 읽는 로봇처럼 보이지 않도록 했습니다.
- 다중 인물 데이터: 두 사람이 대화하는 장면을 모델이 처리하는 방법을 가르쳤습니다. 배경에 있는 캐릭터들에게 "침묵" 오디오 트랙을 제공하는 특수한 기법을 사용하여, 말해야 할 사람만 입을 움직이고 나머지는 가만히 있도록 했습니다.
3. "코치"(RLHF): 인간 피드백을 통한 학습
좋은 데이터가 있더라도 모델은 여전히 손이 약간 비틀리거나 얼굴이 비자연스럽게 움직이는 것과 같은 작은 실수를 할 수 있습니다.
- 방법: 그들은 Group-Relative Policy Optimization(GRPO) 이라는 기법을 사용했습니다.
- 비유: 무용가가 춤을 추는 것을 지켜보는 무용 강사를 상상해 보세요. 강사는 단순히 "잘했다"거나 "나쁘다"고 말하는 대신, 학생의 춤을 다른 무용가들의 춤과 비교하며 "팔 움직임은 평균보다 10% 좋지만, 발놀림은 5% 나쁘다"고 말합니다. 모델은 이러한 비교를 통해 프레임 단위로 움직임을 미세 조정하여 손이 실제처럼 보이고 몸이 자연스럽게 움직이도록 학습합니다.
4. "터보 모드": 속도 향상
일반적으로 고품질 비디오 생성은 느립니다. 1 시간 동안 5 분마다 오븐을 확인해야 하는 케이크 굽기와 같습니다.
- 혁신: 그들은 Distillation(증류) 이라는 기법을 사용하여 과정을 압축했습니다.
- 비유: 그들은 모델에게 보통 50 단계인 케이크 굽기를 8 단계로 줄여 가르쳤습니다. 이는 50 개의 작고 느린 걸음 대신 8 개의 거대한 걸음으로 전체 경주를 질주하도록 훈련하는 것과 같습니다. 그 결과, 품질은 그대로 유지하면서 생성 속도가 훨씬 빨라져 실시간 사용이 가능해졌습니다.
5. 결과: 비교 평가
팀이 새로운 모델을 현재 시장에서 가장 좋은 "클로즈드박스"(비밀, 유료) 시스템인 HeyGen과 Kling Avatar와 비교 테스트했습니다.
- 판단: 500 개 이상의 다양한 시나리오 (대화형 헤드, 노래, 애니메이션 스타일, 심지어 동물 포함) 를 포함한 블라인드 테스트에서 LongCat-Video-Avatar 1.5 는 종종 이러한 비싼 상용 시스템보다 더 우수하거나 동등한 평가를 받았습니다.
- 주요 성과:
- 립 싱크: 입술 움직임이 오디오와 완벽하게 일치했습니다.
- 안정성: 긴 영상 동안 캐릭터가 깜빡이거나 얼굴이 바뀌지 않았습니다.
- 정체성: 시작부터 끝까지 캐릭터가 같은 사람처럼 보였습니다.
- 복잡성: 기타를 들고 있는 사람이나 두 사람이 대화하는 것과 같은 까다로운 상황에서도 배경 캐릭터들이 실수로 입을 움직이는 일이 없었습니다.
요약
LongCat-Video-Avatar 1.5 는 본질적으로 "생산 준비 완료" 툴킷입니다. 이는 AI 비디오 생성의 messy(지저분하고) 실험적인 성격을 더 나은 귀 (Whisper), 더 나은 학습 데이터 (침묵/감정/다중 인물), 엄격한 코치 (RLHF), 그리고 속도 향상 (Distillation) 으로 다듬은 것입니다. 목표는 단순히 멋진 데모를 만드는 것이 아니라, 실제 비즈니스에서 신뢰할 수 있게 작동할 수 있는 시스템을 구축하는 것이었으며, 그들은 이것이 오늘날 이용 가능한 최상위 유료 도구만큼 잘 (또는 더 잘) 작동함을 증명했습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.