InstructAV2AV: Instruction-Guided Audio-Video Joint Editing
본 논문은 새로 구축된 대규모 데이터셋(InsAVE-80K)과 전문적인 2 단계 학습 전략을 활용하여 기존 방법들보다 동기화된 고품질 편집 콘텐츠 생성에서 더 우수한 성능을 보이는, 지시 기반 오디오-비디오 공동 편집을 위한 최초의 엔드 투 엔드 프레임워크인 InstructAV2AV를 소개합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
친구가 연설하는 친구의 홈 비디오가 있다고 상상해 보세요. 이제 그들이 말하는 내용을 바꾸거나, 아예 다른 사람으로 완전히 교체하고 싶다고 가정해 보되, 배경 소음, 조명, 타이밍은 완벽하게 자연스럽게 유지되기를 원한다고 해 봅시다.
보통 비디오 편집과 오디오 편집은 두 개의 별개의 작업입니다. 비디오를 변경하면 오디오가 종종 싱크가 맞지 않거나 이상하게 들립니다 (입술과 맞지 않는 내레이션처럼). 이 논문은 비디오와 오디오를 하나의 분리 불가능한 패키지로 취급하는 새로운 도구인 InstructAV2AV를 소개합니다. 간단한 텍스트 명령을 입력하면 그림과 소리를 즉시 함께 다시 작성합니다.
다음은 이를 단순한 개념으로 분해한 작동 원리입니다:
1. "마법 레시피" (데이터 문제)
컴퓨터에게 이를 가르치려면 "전"과 "후" 비디오 수천 개의 예제가 필요합니다. 하지만 누군가가 "안녕하세요"라고 말하다가 배경은 그대로 유지한 채 마법처럼 "안녕히 가세요"라고 말로 바뀌는 비디오 라이브러리는 아무도 가지고 있지 않습니다.
저자들은 데이터 공장 (InsAVE-80K 라고 명명됨) 을 구축했습니다. 이는 고급 주방과 같습니다:
- 인터넷에서 원시 비디오를 가져왔습니다.
- "마스크 기반" 로봇 셰프를 사용하여 특정 부분 (예: 사람의 얼굴이나 자동차) 을 잘라냈습니다.
- 텍스트 지침 (예: "남자를 여성으로 변경") 에 따라 해당 부분에 대한 새로운 오디오와 비디오를 AI 로 생성했습니다.
- 그런 다음 이러한 새로운 부분을 원래 비디오에 다시 넣어 배경은 변경되지 않도록 했습니다.
- 마지막으로, 인간과 스마트 컴퓨터가 결과가 실제처럼 보이고 들리는지 확인하기 위해 시식 테스트를 실시했습니다. 이를 통해 8 만 개의 훈련 예제로 구성된 거대한 요리책이 만들어졌습니다.
2. "스마트 편집기" (모델)
시스템의 핵심은 이중 스트림 브레인입니다. 지휘자가 한 번에 두 개의 오케스트라 (하나는 시각적 장면인 비디오, 다른 하나는 소리인 오디오) 를 지휘한다고 상상해 보세요.
- 앵커: 편집을 요청할 때 시스템은 단순히 추측하지 않습니다. 하늘, 나무, 배경 소음을 실수로 변경하지 않도록 원래 비디오와 오디오를 "안전 앵커"로 확인합니다.
- 지시: "남자를 갈색 머리의 젊은 여성으로 바꾸고 '다시 시도해 봐야 한다고 생각해요'라고 말하게 하세요"와 같은 명령을 입력합니다.
- 게이트드 어텐션 (SIGA): 이것이 이 논문의 비법 소스입니다. 비디오의 모든 순간마다 딤머 스위치나 신호등이 있다고 상상해 보세요.
- 불이 빨간색이면 시스템은 "배경을 유지하기 위해 원래 비디오/오디오를 그대로 유지한다"고 말합니다.
- 불이 초록색이면 "이 부분을 지침에 맞게 변경한다"고 말합니다.
- 이 스위치는 자동으로 조정되므로 시스템이 정확히 무엇을 변경하고 무엇을 남겨둘지 알아내어, 새로운 목소리가 새로운 얼굴과 완벽하게 일치하도록 보장합니다.
3. "두 단계 춤" (훈련 전략)
컴퓨터에게 비디오와 오디오를 동시에 편집하도록 가르치는 것은 어렵습니다. 한 번에 모든 것을 가르치려고 하면 혼란에 빠집니다.
저자들은 이중 단계 훈련 전략을 사용합니다:
- 1 단계 (솔로 연습): 먼저 비디오 부분이 어떻게 편집하는지, 오디오 부분이 어떻게 편집하는지 각각 가르칩니다. 서로를 걱정하지 않고 각자의 동작을 배웁니다.
- 2 단계 (듀엣): 솔로 연주가 능숙해지면 함께 춤추도록 가르칩니다. 비디오에서 자동차 엔진이 시동되는 장면이 나올 때 오디오가 정확히 같은 밀리초에 엔진 소리를 재생하도록 완벽하게 동기화하는 법을 배웁니다.
무엇을 할 수 있나요?
이 논문은 텍스트 지침만을 사용하여 네 가지 주요 "동작"을 시연합니다:
- 정체성 교체: 목소리와 입술 움직임이 동기화된 상태에서 남자를 여성으로 (또는 그 반대로) 변경합니다.
- 연설 재작성: 사람의 얼굴과 목소리는 유지하되, 그들이 말하는 말을 새로운 내용으로 변경합니다.
- 삽입: 새로운 객체 (예: 지나가는 빈티지 자동차) 를 추가하고 일치하는 엔진 소리를 생성합니다.
- 제거: 객체 (예: 바위 위의 다람쥐) 를 지우고 그 삐걱거리는 소리를 침묵시켜 마치 처음부터 없었던 것처럼 만듭니다.
결론
간단히 말해, InstructAV2AV는 텍스트 프롬프트만으로 비디오의 스토리와 사운드트랙을 동시에 편집할 수 있는 최초의 시스템입니다. 이는 단순히 오래된 비디오 위에 새로운 소리를 붙여넣는 것이 아니라, 시각을 변경하면 소리도 변경되어야 하고, 소리를 변경하면 시각도 일치해야 한다는 점을 이해합니다. 이는 거대하고 자체 제작된 예제 라이브러리에서 학습하고, 정확히 무엇을 유지하고 무엇을 변경할지 결정하는 스마트한 "딤머 스위치"를 사용하여 이를 수행합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.