← 최신 논문
💻 computer science

Omni-Customizer: End-to-End MultiModal Customization for Joint Audio-Video Generation

Omni-Customizer 는 Omni-Context Fusion, Masked TTS Cross-Attention, Semantic-Anchored Multimodal RoPE 와 같은 새로운 모듈을 도입하여 음성 누출과 같은 과제를 해결하고 최첨단 멀티모달 커스터마이징을 달성함으로써, 여러 대상에 걸쳐 일관된 시각적 정체성과 발성 음색을 유지하면서 정밀한 결합 오디오 - 비디오 생성을 가능하게 하는 엔드 - 투 - 엔드 프레임워크입니다.

원저자: Yuheng Chen, Qingdong He, Teng Hu, Yuji Wang, Yabiao Wang, Lizhuang Ma, Jiangning Zhang

게시일 2026-05-19
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yuheng Chen, Qingdong He, Teng Hu, Yuji Wang, Yabiao Wang, Lizhuang Ma, Jiangning Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

여러 배우가 등장하는 영화 장면을 촬영하려는 감독이 되어 상상해 보세요. 대본은 있지만, 배우 A가 고용한 특정 인물처럼 보이고 고유한 목소리 그대로 들리도록 해야 하며, 배우 B도 자신에 대해 똑같은 조건을 충족해야 합니다. 카메라가 혼란에 빠지면 배우 A 의 얼굴이 움직이는 동안 배우 B 의 목소리가 들리거나, 더 나쁘게는 장면 노트에서 묘사한 내용 때문에 배우들이 대본에 없는 대사를 말하기 시작할 수 있습니다.

이것이 바로 Omni-Customizer가 해결하는 문제입니다. 이는 여러 사람이 대화하고 상호작용하는 비디오를 생성하면서도 그들의 고유한 외모와 목소리를 완벽하게 유지하도록 설계된 새로운 AI 시스템입니다.

다음은 간단한 비유로 설명한 작동 원리입니다:

1. 문제: "혼란스러운 감독"

이전 AI 도구들은 비디오 생성에는 뛰어나거나 오디오 생성에는 뛰어나지만, 여러 사람을 대상으로 둘을 동시에 시도할 때 혼란에 빠졌습니다.

  • 혼동: AI 가 누가 말하는지 혼동할 수 있습니다. 빨간 셔츠를 입은 남자가 여자의 대사를 말하게 만들 수 있습니다.
  • "유령" 목소리: 때때로 AI 는 장면의 묘사를 말로 바꾸는 실수를 저지릅니다. "남자는 키가 크다"라고 작성했다면, AI 가 대사에 없는데도 캐릭터가 실제로 "나는 키가 크다"라고 말하게 만들 수 있습니다.
  • 이탈: 비디오가 진행됨에 따라 캐릭터들의 얼굴이나 목소리가 서서히 변하여 정체성을 잃을 수 있습니다.

2. 해결책: "Omni-Customizer" 툴킷

연구자들은 이러한 문제들을 해결하기 위해 세 가지 주요 "도구"를 갖춘 시스템을 구축했습니다:

A. "슈퍼 커넥터" (Omni-Context Fusion)

AI 의 뇌를 텍스트, 이미지, 사운드용 각기 다른 부서가 있는 것으로 상상해 보세요. 보통 이 부서들은 서로 매우 느리고 간접적으로 소통합니다.

  • 해결책: Omni-Customizer 는 모든 부서가 같은 테이블에 앉아 즉시 대화하도록 강제하는 "슈퍼 커넥터"를 구축합니다. 이는 사람의 묘사, 사진, 음성 샘플을 비디오 생성이 시작되기 전에 하나의 단단한 패키지로 융합합니다. 이를 통해 AI 는 "이 얼굴, 이 목소리, 이 이름은 모두 같은 사람에게 속한다"는 것을 알게 됩니다.

B. "이름표" 시스템 (Semantic-Anchored RoPE)

얼굴, 목소리, 단어가 섞인 퍼즐 조각 더미가 있다고 상상해 보세요. 그냥 상자에 던져 넣으면 섞여 버립니다.

  • 해결책: 이 시스템은 특수한 "이름표"(SA-MRoPE) 를 사용합니다. 이는 대본 속의 "주제 1"이라는 단어에 "얼굴 A"와 "목소리 A" 퍼즐 조각을 직접 부착합니다. 마치 퍼즐 조각에 자석 태그를 붙여 다른 사람에게 잘못 붙지 않고 떠다니지 못하게 하는 것과 같습니다. 이렇게 하면 3~4 명이 등장하는 복잡한 장면에서도 AI 가 누가 누구인지 혼동하지 않게 됩니다.

C. "침묵 버튼" (Masked TTS Cross-Attention)

AI 가 실수로 장면 묘사를 말해 버렸던 문제를 기억하시나요?

  • 해결책: 연구자들은 "침묵 버튼"(MTP-CA) 을 설치했습니다. AI 에게 다음과 같이 지시합니다: "<S>(시작) 과 <E>(종료) 태그 안에 있는 말만 하라." 날씨나 캐릭터의 옷에 대한 묘사와 같은 그 밖의 모든 내용은 엄격히 침묵시킵니다. AI 는 음성 생성 시 설명 텍스트를 무시하도록 강제되므로, 무대 지시를 실수로 소리 내어 읽는 일은 없습니다.

3. 훈련: "짐 루틴"

이 시스템을 가르치기 위해 연구자들은 모든 데이터를 한 번에 던져 넣지 않았습니다. 그들은 스마트한 훈련 일정을 사용했습니다:

  • "오디오 전용" 훈련: 때때로 AI 는 비디오를 걱정하지 않고 오디오(목소리 듣기 및 언어 학습) 만으로 연습합니다. 이는 혼란 없이 여러 언어를 배우는 데 도움이 됩니다.
  • "비디오 - 오디오" 훈련: 다른 때는 비디오와 오디오가 완벽하게 일치하도록(립싱크) 연습합니다.
  • "쉬운 것에서 어려운 것" 사다리: 그들은 AI 에게 먼저 한 사람이 말하는 것만 처리하도록 가르쳤습니다. 이를 마스터하자마자 두 사람, 그리고 마침내 여러 사람이 서로 겹쳐서 말하는 복잡한 장면으로 넘어갔습니다. 이러한 단계별 접근 방식은 AI 가 압도되지 않도록 방지했습니다.

4. 결과

테스트 결과, Omni-Customizer 는 다음을 증명했습니다:

  • 긴 대화에서도 얼굴과 목소리를 일관되게 유지합니다.
  • "유령 목소리" 문제 (묘사가 말해지는 현상) 를 방지합니다.
  • 이전 오픈소스 모델보다 여러 사람이 등장하는 복잡한 장면을 더 잘 처리합니다.

간단히 말해: Omni-Customizer 는 어느 배우가 누구인지 절대 잃어버리지 않고, 실제 대본의 대사만 말하도록 보장하며, 첫 번째 순간부터 마지막 순간까지 목소리와 얼굴을 일관되게 유지하는 매우 조직적인 영화 제작 팀과 같습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →