Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections
비디오-음악 생성에서의 재현성 및 저작권 문제를 해결하기 위해, 본 논문은 퍼블릭 도메인 영화들로 구성된 재현 가능한 Open Screen Soundtrack Library 버전 2(OSSL-v2) 데이터셋을 소개하고, 화면상의 음성을 통해 비디오 교차 주의(cross-attention)를 조절함으로써 음악 생성을 향상시키는 대화 인지 모델을 제안한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 영화를 보고 있다고 상상해 보세요. 폭풍 속을 달리는 주인공을 보고 있는데, 갑자기 천둥소리가 울려 퍼지며 극적인 오케스트라 선율이 고조됩니다. 그 음악은 단순한 배경 소음이 아닙니다. 그것은 장면을 하나로 묶어주는 정서적 접착제이며, 당신이 어떻게 느껴야 할지를 알려줍니다. 오랫동안 과학자들은 컴퓨터에게 영상의 분위기에 맞춰 자동으로 음악을 생성하는 '작곡가' 역할을 가르치기 위해 노력해 왔습니다. 이 분야를 비디오-투-뮤직(video-to-music) 생성이라고 부릅니다. 하지만 여기에는 거대한 문제가 있습니다. 컴퓨터에게 이 기술을 가르치려면 수천 개의 영화 사례와 그에 딱 맞는 사운드트랙이 필요합니다. 대부분의 연구자들은 인터넷상의 영상 링크 목록을 사용하여 이러한 사례들을 찾아왔습니다. 문제는 인터넷 링크가 모래성 같다는 점입니다. 파도가 밀려오면 영상은 삭제되거나 잠겨버립니다. 이는 컴퓨터가 학습하는 '교과서'가 계속 사라지게 만들어, 어떤 컴퓨터가 실제로 더 똑똑한지 확인하는 것을 불가능하게 만듭니다. 이를 해결하기 위해서는 사라지지 않는 영화 도서관이 필요하며, 컴퓨터에게 등장인물의 외형뿐만 아니라 그들이 무엇을 말하고 있는지도 가르칠 방법이 필요합니다.
여기 UC 샌디에이고와 미시간 대학교의 연구진이 구축한, 흔들림 없는 새로운 라이브러리인 OSSL-v2가 있습니다. 이것을 누구도 폐쇄할 수 없는 거대하고 독립적인 영화관이라고 생각해보세요. 연구진은 사라질 수 있는 인터넷 링크를 가리키는 대신, 누구나 사용할 수 있는 공공 저작물인 1,886편의 영화를 다운로드하여 34,343개의 작은 클립으로 잘게 나누었습니다. 이는 약 246.4시간의 영상과 음악을 모두 한곳에 안전하게 저장한 것입니다. 자체 호스팅 방식이기 때문에 사라지지 않으며, 모든 연구자에게 훈련을 위한 공정하고 동일한 데이터 세트를 제공합니다.
하지만 연구팀은 단순히 도서관을 구축한 것에 그치지 않았습니다. 그들은 컴퓨터가 결정적인 단서를 놓치고 있다는 사실을 깨달았습니다. 영화에서 음악은 종종 등장인물이 말을 시작하는 순간 변합니다. 누군가 소리를 지르면, 목소리가 들릴 수 있도록 음악이 작아지거나 멈출 수도 있습니다. 연구진은 이 새로운 라이브러리에서 대화의 크기와 음악의 크기 사이에 미세하지만 실제적인 연결 고리가 있다는 것을 발견했습니다. 이를 활용하기 위해 그들은 '대화 인지형(dialogue-aware)' 시스템을 발명했습니다. 컴퓨터가 지휘자라고 상상해 보세요. 이전의 지휘자는 오케스트라의 속도를 높이거나 늦추기 위해 배우의 얼굴과 움직임만을 보았습니다. 이제 지휘자는 실시간으로 배우의 목소리를 들을 수 있는 새로운 안경을 썼습니다. 이 시스템은 대화의 소리를 가져와 프레임 단위로 음악 생성을 부드럽게 유도함으로써, 음악이 캐릭터와 함께 정확하게 숨 쉬고 멈출 수 있게 합니다.
이 거대한 라이브러리를 통해 이 새로운 접근 방식을 테스트했을 때, 결과는 유망했습니다. 그들은 자신들의 '대화 인지형' 모델을 기존의 가장 뛰어난 시스템들과 비교했습니다. 새로운 방식이 반드시 일반적인 의미에서(예를 들어 음악을 더 복잡하거나 다양하게 만드는 것) 음악을 더 '좋게' 만드는 것은 아니었지만, 음악이 영상에 훨씬 더 긴밀하게 밀착되도록 만들었습니다. 구체적으로, 생성된 사운드트랙은 특히 대화와 음악이 겹치는 까다로운 순간을 처리할 때 원래의 영화 장면에 훨씬 더 충실해졌습니다. 연구진은 이러한 개선이 모델이 한 번도 본 적 없는 상업 영화를 테스트할 때도 유효하다는 것을 발견했으며, 이는 대화를 듣는 것이 단순히 영상을 보는 것보다 AI가 장면의 리듬을 더 잘 이해하도록 돕는다는 것을 시사합니다.
또한 논문은 몇 가지 잠재적인 '꼼수'를 신중하게 배제했습니다. 연구진은 혹시 컴퓨터가 대화 트랙에 남아있는 잔여 음악에 의존하고 있는 것은 아닌지(음성을 분리하는 작업이 완벽하지 않기 때문) 우려했습니다. 이를 확인하기 위해, 그들은 대화에 음악 소음이 거의 전혀 없는 클립을 찾는 특별한 필터를 실행했습니다. 이러한 '깨끗한' 클립들을 사용했음에도 불구하고, 대화 인지형 시스템은 여전히 더 나은 성능을 보였습니다. 이는 개선의 원인이 음악을 우연히 들었기 때문이 아니라, 실제로 대화를 이해하는 데서 온다는 것을 시사합니다. 이 시스템이 아직 인간 작곡가를 완벽히 대체할 수는 없지만, 이번 연구는 등장인물의 목소리를 추가하는 것이 컴퓨터가 이야기에 진정으로 연결된 느낌을 주는 음악을 쓰는 데 강력한 방법이 될 수 있음을 보여줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.