← 최신 논문
💻 computer science

SyncAnyone: Implicit Disentanglement via Progressive Self-Correction for Lip-Syncing in the wild

이 논문은 야생 환경에서도 정체성과 배경의 일관성을 유지하면서 고충실도의 오디오 기반 립싱크를 달성하기 위해, 디퓨전 기반 마스크 인페인팅 모델과 그 뒤를 잇는 마스크 프리 자기 교정 튜닝 파이프라인을 결합한 새로운 2단계 프레임워크인 SyncAnyone을 제안한다.

원저자: Xindi Zhang, Dechao Meng, Steven Xiao, Qi Wang, Peng Zhang, Bang Zhang

게시일 2026-02-09
📖 3 분 읽기☕ 가벼운 읽기

원저자: Xindi Zhang, Dechao Meng, Steven Xiao, Qi Wang, Peng Zhang, Bang Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 어떤 사람이 말하는 영상을 가지고 있지만, 새로운 오디오 트랙에 맞춰 그가 하는 말을 바꾸고 싶다고 상상해 보세요 (마치 영화를 다른 언어로 더빙하는 것처럼 말이죠). 목표는 인물의 얼굴이나 배경을 바꾸지 않으면서, 새로운 단어에 완벽하게 맞춰 입술이 움직이게 만드는 것입니다.

오랫동안 AI 연구자들은 이를 해결하기 위해 "디지털 스텐실"을 사용하는 방법을 시도해 왔습니다. 여기서는 기존의 방식이 어떻게 작동했는지, 그리고 이 논문에서 소개하는 SyncAnyone이라는 새로운 방법이 왜 혁신적인 게임 체인저인지 설명합니다.

기존 방식: "흐릿한 스텐실" 문제

사진 위에 새로운 입 모양을 그려 넣으려고 한다고 상상해 보세요. 기존의 AI 방식은 테이프(마스크)를 가져와서 사람의 입과 그 주변 영역을 가려버립니다. 그런 다음, AI는 소리에 기반하여 입이 어떻게 보여야 하는지 추측하는 동시에, 나머지 얼굴은 그대로 유지하려고 노력합니다.

이 논문은 이러한 접근 방식에 큰 결함이 있다고 설명합니다:

  • 테이프가 너무 작으면: AI가 속임수를 씁니다. 소리를 듣는 대신 입 모양을 추측하기 위해 턱이나 볼을 봅니다.
  • 테이프가 너무 크면: AI가 혼란에 빠집니다. 실수로 사람의 정체성이나 배경 풍경까지 덧칠하게 되어, 특히 사람이 고개를 돌리거나 장면이 빠르게 바뀔 때 영상이 흐릿해지거나 왜곡됩니다.

이는 벽에 난 구멍을 메우기 위해 방 전체에 페인트를 칠하는 것과 같습니다. 구멍은 메울 수 있겠지만, 옆에 있는 벽지와 가구까지 망쳐버릴 수 있습니다.

새로운 방식: SyncAnyone의 "2단계 자기 교정"

이 논문의 저자들은 SyncAnyone이라 불리는 새로운 프레임워크를 제안합니다. 단 한 번의 불완전한 시도에 의존하는 대신, 이들은 2단계 "점진적 자기 교정(Progressive Self-Correction)" 과정을 사용합니다. 이것은 마치 숙련된 화가가 먼저 거친 초안을 그린 다음, 이를 걸작으로 다듬어 나가는 과정과 같습니다.

1단계: "거친 초안" 화가

첫 번째 단계에서 AI는 숙련되었지만 약간은 엉성한 화가처럼 행동합니다.

  • AI는 소리에 따라 입술이 정확하게 움직이는 법을 배우기 위해 기존의 "스텐실" 방식(입을 마스킹하는 방식)을 사용합니다.
  • 스텐실을 사용하기 때문에 입술의 움직임은 제대로 구현하지만, 입 주변 가장자리나 배경에 "얼룩"이나 이상한 아티팩트(왜곡)를 남길 수 있습니다.
  • 마법 같은 기술: 연구진은 이 "거친 초안" AI가 스스로 수천 개의 연습용 영상을 생성하도록 가르칩니다. 즉, 영상을 가져와서 오디오를 바꾸고, 입술은 다르게 움직이되 나머지 영상은 그대로 유지되는 버전을 만들어내는 것입니다.

2단계: "완벽주의자" 편집자

이제 영리한 부분이 등장합니다. 연구진은 "거친 초안" AI와 그 AI가 만든 연습용 영상을 가져와서, 실수를 바로잡는 두 번째 AI(2단계)를 훈련시킵니다.

  • 설정: 연구진은 두 번째 AI에게 "손상된" 영상(1단계의 얼룩이 있는 영상)과 "완벽한" 원본 영상을 함께 보여줍니다.
  • 교훈: 그들은 두 번째 AI에게 이렇게 말합니다. "너의 임무는 이 지저�한 영상을 보고, 새로운 오디오를 들은 뒤, 오직 입술만 수정하는 것이다. 너는 배경과 사람의 얼굴을 원래 모습 그대로 유지해야 한다."
  • 결과: AI는 이 "뒷수습" 과정을 통해 배경을 무시하고 순수하게 입술에만 집중하는 법을 배웁니다. 즉, 움직이는 입과 정지된 얼굴을 분리(또는 해체)하는 법을 배웁니다.

이 과정이 끝나면, 두 번째 AI는 더 이상 "스텐실"(마스크)이 필요하지 않습니다. AI는 어떤 픽셀이 입술에 속하고 어떤 픽셀이 배경에 속하는지 정확히 알게 되어, 장면을 흐릿하게 만들지 않고도 변화를 줄 수 있게 됩니다.

이것이 왜 중요한가 (논문에 따르면)

이 논문은 이 새로운 방법이 기존 방식보다 실제 환경의 혼란스러운 상황을 훨씬 더 잘 처리한다고 주장합니다. 구체적으로는 다음과 같습니다:

  • 큰 머리 회전: 사람이 고개를 옆으로 돌리는 경우에도 작동합니다 (기존 방식은 여기서 자주 실패했습니다).
  • 장애물: 누군가 얼굴 앞에 손을 가져다 대더라도, AI는 손을 그대로 유지하면서 그 뒤의 입술만 움직입니다.
  • 장면 전환: 영상의 배경이 바뀌어도 AI는 혼란스러워하지 않고 새로운 배경을 선명하게 유지합니다.
  • 정체성: 영상 속 인물은 흐릿한 버전이 아닌, 본래의 모습 그대로 유지됩니다.

핵심 요약

SyncAnyone은 2단계 편집 과정과 같습니다:

  1. 1단계: "보조 바퀴"(마스크)를 사용하여 입술이 움직이는 법을 가르칩니다. 비록 가장자리에 약간의 실수가 생기더라도 말이죠.
  2. 2단계: AI가 자신의 실수를 직접 고치는 연습을 하게 하여, 보조 바퀴 없이도 배경을 망치지 않고 입술을 완벽하게 편집하는 법을 배우게 합니다.

그 결과, 이 도구는 이전의 AI 도구들이 실패했을 상황에서도 더 빠르고, 더 선명하며, 더 효과적으로 작동하는 영상 더빙 툴이 됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →