← 최신 논문
💻 computer science

Unison: Harmonizing Motion, Speech, and Sound for Human-Centric Audio-Video Generation

Unison는 의미 기반 오디오 분리 및 양방향 교차 모달 강제 전략을 통해 운동, 음성, 음향 효과를 명시적으로 조화시킴으로써 정밀한 시간적 정렬과 음향적 선명도를 보장하는 최첨단 인간 중심 오디오-비디오 생성을 달성하는 통합 프레임워크입니다.

원저자: Shihao Cheng, Jiaxu Zhang, Quanyue Song, Shansong Liu, Zhizhi Guo, Xiaolei Zhang, Chi Zhang, Xuelong Li, Zhigang Tu

게시일 2026-05-12
📖 3 분 읽기☕ 가벼운 읽기

원저자: Shihao Cheng, Jiaxu Zhang, Quanyue Song, Shansong Liu, Zhizhi Guo, Xiaolei Zhang, Chi Zhang, Xuelong Li, Zhigang Tu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

영화 한 장면을 연출한다고 상상해 보세요. 비가 내리는 가운데 한 배우가 기타를 치며 노래를 부르는 장면입니다. 이상적인 세상에서는 노래, 기타 연주, 빗소리가 모두 완벽한 타이밍에 일어나 아름다운 자연스러운 경험으로 어우러질 것입니다.

하지만 현재 이러한 영상을 제작하려는 AI 도구들은 종종 어려움을 겪습니다. 배우의 목소리가 기타와 빗소리를 압도할 정도로 너무 크게 나오거나, 배우의 입술이 가사의 단어 대신 기타 음정에 맞춰 움직이는 식입니다. 마치 밴드에서 가수가 악기 소리를 압도하며 비명을 지르고, 드러머가 박자를 잃고 연주하는 것과 같습니다.

이 논문은 이러한 문제들을 해결하기 위해 Unison(함께 행동한다는 의미)이라는 새로운 AI 프레임워크를 소개합니다. Unison을 영상 속 모든 요소가 완벽한 조화를 이루도록 보장하는 고도로 숙련된 오디오·비주얼 지휘자로 생각하세요.

다음은 간단한 비유를 통해 Unison 이 두 가지 주요 문제를 어떻게 해결하는지 설명합니다:

1. "볼륨 조절" 문제 (대사 vs. 효과음)

문제점: 이전 AI 모델들에서 "대사"(배우의 말이나 노래) 는 파티장의 괴롭힘꾼과 같았습니다. 모든 공간을 차지하며 "효과음"(빗소리, 바람 소리, 기타 스트럼 등) 을 거의 들리지 않을 정도로 배경으로 밀어냈습니다. 그 결과 환경이 가짜처럼 느껴지는 평면적이고 지루한 오디오가 만들어졌습니다.

Unison 의 해결책: Unison 은 두 개의 별도 믹싱 콘솔을 갖춘 스마트한 사운드 엔지니어처럼 작동합니다.

  • 분리: 목소리와 기타를 하나의 지저분한 더미로 섞으려 하는 대신, Unison 은 이를 두 개의 별도 트랙에 구축합니다.
  • 스마트 게이팅 (SCG): 교통 신호 시스템이라고 상상해 보세요. 장면이 배우의 대사가 주를 이룬다면, 시스템은 목소리가 명확하게 들리도록 배경 소음의 볼륨을 자동으로 적절히 낮춥니다. 하지만 장면이 콘서트나 폭풍우라면, 배경 소리가 묻히지 않도록 시스템이 배경 소리를 키웁니다.
  • 핸드셰이크 (Bi-ACA): 음성 트랙과 사운드 트랙은 끊임없이 서로 "대화"합니다. 목소리가 실수로 기타 소리를 삼키지 않는지, 그리고 그 반대의 경우도 확인합니다. 이를 통해 최종 오디오는 가수와 빗소리를 모두 명확하게 들을 수 있는 균형 잡히고 풍부한 믹스가 됩니다.

2. "립싱크" 문제 (동작 vs. 소리)

문제점: 종종 영상과 오디오가 맞지 않습니다. 배우가 소리가 난 직후에야 입을 열거나, 손이 기타를 튕긴 후에야 음이 들리는 식입니다. 마치 영상과 오디오가 함께 연습하지 않은 두 다른 사람인 것처럼 느껴집니다.

Unison 의 해결책: Unison 은"크로스모달 포싱 (Cross-Modal Forcing)"이라는 훈련 drill을 사용합니다.

  • 비유: 안무를 배우는 두 명의 댄서를 상상해 보세요. 보통 그들은 같은 속도로 전체 안무를 배우려 합니다. 한 명이 넘어지면 다른 한 명도 넘어지고, 둘 다 혼란에 빠집니다.
  • Unison 의 변주: Unison 은 한 명의 댄서 (예를 들어 오디오) 가 다른 댄서 (비디오) 보다 약간 더 빠르고 깔끔하게 스텝을 배우도록 합니다. 그런 다음 더"깔끔한"댄서가 가이드 역할을 하여 더"소음이 많은"댄서에게 다음 스텝이 어디인지 정확히 보여줍니다.
  • 결과: 더 명확한 신호가 더 혼란스러운 것을 안내하도록 함으로써, AI 는 영상 동작과 소리를 완벽하게 동기화하는 법을 배웁니다. 시간이 지남에 따라 배우의 입술은 대사가 말해지는 순간에 딱 맞춰 움직이고, 기타 스트럼은 손이 현을 튕기는 순간에 정확히 울립니다.

최종 결과

이 두 가지 해결책을 결합하면 Unison 은 현실감이 느껴지는 영상을 만들어냅니다.

  • 더 이상 압도되지 않음: 가수와 배경 음악을 모두 들을 수 있습니다.
  • 더 이상 지연 없음: 동작과 소리가 정확히 같은 시간에 발생합니다.

이 논문은 Unison 이 단순히 잘 보이는 영상을 만드는 것을 넘어, 소리도 좋고 동기화된 느낌을 주어 이전 AI 모델들보다 훨씬 몰입감 있는 경험을 창출한다고 보여줍니다. 이는 거대한 컴퓨터 없이도 달성되며, 트랙 분리 및 학습 안내와 같은 지적인 조직화가 raw 한 파워만큼이나 중요함을 입증합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →