← 최신 논문
🤖 machine learning

Visual Representation Matters: Exploiting Temporal Differences in Video-to-Audio Generation

이 논문은 기존 방식들과 비교하여 아키텍처의 수정을 최소화하면서도, 핵심적인 시각적 표현으로서 시간적 차이(temporal differences)를 활용하고 어닐드 가이던스(annealed guidance)를 갖춘 계층적 지속 학습 전략을 채택함으로써 비디오-오디오 생성 품질을 크게 향상시키는 프레임워크인 TD-V2A를 소개한다.

원저자: Zehua Chen, Junyou Wang, Yuxuan Jiang, Zhenying Fang, Yusheng Dai, Jianfei Chen, Ziwei Liu, Jun Zhu

게시일 2026-08-06
📖 6 분 읽기🧠 심층 분석

원저자: Zehua Chen, Junyou Wang, Yuxuan Jiang, Zhenying Fang, Yusheng Dai, Jianfei Chen, Ziwei Liu, Jun Zhu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 영화용 효과음을 만드는 사운드 아티스트가 되는 법을 가르치려 한다고 상상해 보세요. 보통, 로봇에게 개의 정지된 사진 한 장을 보여주면, 로봇은 그 소리를 "짖는 소리(bark)"라고 추측할 수 있습니다. 하지만 만약 당신이 로봇에게 비디오를 보여준다면 어떨까요? 개는 그냥 앉아 있는 것이 아니라, 달리고 있고, 귀는 펄럭이고 있으며, 꼬리는 흔들거리고 있습니다. 움직임에 따라 소리도 변합니다. 이것이 바로 비디오 투 오디오(Video-to-Audio, V2A) 생성의 과제입니다. 단순히 보이는 것에 맞추는 것을 넘어, 시간의 흐름에 따른 움직임변화에 완벽하게 동기화되는 소리를 만들어내는 것입니다.

오랫동안 과학자들은 로봇에게 추가적인 도움을 주는 방식으로 이 문제를 해결하려 노력했습니다. 그들은 비디오를 듣기 위한 특별한 "귀"를 만들거나, 소리의 형태를 미리 예측하도록 로봇을 가르쳤습니다. 이는 마치 로봇에게 참조 가이드를 제공하는 것과 같았습니다. 하지만 이 논문은 더 단순한 질문을 던집니다. 만약 비디오 자체가 이미 비밀을 품고 있다면 어떨까요? 그 비밀은 바로 **시간적 차이(Temporal Differences, TD)**입니다. TD를 영상의 프레임 사이의 "변화"라고 생각해 보세요. 잔잔한 연못의 사진을 찍은 후 1초 뒤에 다른 사진을 찍으면 두 사진은 거의 똑같아 보입니다. 하지만 부서지는 파도의 사진을 찍는다면, 두 번째 사진은 첫 번째 사진과 매우 다르게 보일 것입니다. 그 차이가 바로 '움동(motion)'입니다. 이 논문은 만약 우리가 로봇에게 단순히 "그림"이 아니라 이러한 "변화"에 주목하도록 가르칠 수 있다면, 복잡한 추가 가이드나 새로운 부품 없이도 훨씬 더 뛰어난 사운드 아티스트가 될 수 있다고 제안합니다.

"변화"가 핵심이다

칭화 대학교의 Chen으로 대표되는 연구진은 흥미로운 점을 발견했습니다. 대부분의 비디오 투 오디오 시스템은 비디오를 정지 영상의 묶음처럼 취급한다는 것입니다. 그들은 첫 번째 프레임, 두 번째 프레임을 보고 그다음 프레임으로 어떻게 넘어가는지에 대한 이야기를 놓치는 경우가 많습니다. 저자들은 비디오를 정적인 이미지와 구분 짓는 마법 같은 요소가 바로 프레임 간의 차이 그 자체라고 주장합니다.

그들은 이 새로운 방법을 TD-V2A라고 부릅니다. 거대하고 복잡한 새로운 기계를 만드는 대신, 그들은 비디오 자체의 "변화"를 사용하여 사운드 생성기를 가르치기로 했습니다. 친구에게 전화로 춤 동작을 설명한다고 상상해 보세요. 단순히 "그녀는 빨간 드레스를 입고 있어"라고 말한다면, 그것은 정지된 이미지입니다. 하지만 "그녀가 회전하자 드레스가 퍼졌고, 그다음 그녀가 점프했어"라고 말한다다면, 당신은 순간 사이의 차이를 설명하고 있는 것입니다. 이것이 바로 TD-V2A가 하는 일입니다. 이 모델은 연속된 비디오 프레임 사이의 차이를 계산하고, 그 "차이 맵(difference map)"을 사운드 생성기를 위한 강력한 힌트로 사용합니다.

변화를 바라보는 두 가지 방식

연구팀은 먼저 이 변화를 어떻게 측정할지 결정해야 했습니다. 그들은 마치 두 쌍의 안경을 통해 영화를 보는 것처럼 두 가지 다른 방식을 테스트했습니다.

  1. 프레임 수준의 차이 (Frame-Level Differences, FTD): 이것은 가공되지 않은 픽셀을 보는 것과 같습니다. 두 개의 비디오 프레임을 가져와 서로 빼서 그 결과를 유지합니다. 이는 나뭇잎이 흔들리거나 드럼 스틱이 드럼을 치는 것과 같은 모든 미세한 움직임의 디테일을 포착합니다. 매우 상세하며 원래의 시각적 구조를 그대로 유지합니다.
  2. 특징 수준의 차이 (Feature-Level Differences, CTD): 이것은 프레임의 "의미"를 보는 것과 같습니다. 컴퓨터의 고차원적 이해(CLIP 임베딩이라 불리는)를 가져와서 그 차이를 구합니다. 이는 "개가 달리고 있다"와 같은 큰 개념은 포착하지만, 작고 빠른 움직임의 세부 사항은 놓칠 수 있습니다.

실험을 수행한 결과, 연구팀은 **프레임 수준의 차이(FTD)**가 승자라는 것을 발견했습니다. 왜일까요? 이미지의 "의미"를 빼버리면 소리를 만드는 데 필수적인 미세한 디테일들을 잃게 되기 때문입니다. 반면 픽셀을 직접 빼면 무엇이 얼마나 빠르게 움직였는지에 대한 완벽한 지도를 얻을 수 있습니다. 결국, 변화의 "노이즈"가 실제로 좋은 소리를 만드는 데 가장 중요한 신호가 된다는 사실이 밝혀졌습니다.

3단계의 춤 (계층적 지속 학습)

로봇에게 이 모든 것을 한꺼번에 가르치는 것은 어렵습니다. 그래서 저자들은 **계층적 지속 학습(Hierarchically Continual Learning, HCL)**이라는 영리한 훈련 전략을 고안했습니다. 이는 악기를 배우는 과정과 비슷합니다.

  • 1단계: 음표 배우기. 먼저, 모델에게 텍스트 설명을 통해 소리를 만드는 법을 가르쳤습니다(Text-to-Audio). 이를 통해 로봇은 소리가 일반적으로 어떤 모습이어야 하는지에 대한 강력한 기초를 쌓았습니다.
  • 2단계: 그림 배우기. 다음으로, 텍스트를 정지 이미지로 바꿨습니다. 이제 로봇은 단일 사진을 소리에 맞추는 법을 배웠습니다.
  • 3단계: 움직임 배우기. 마지막으로, **시간적 차이(Temporal Differences)**를 도입했습니다. 로봇은 자신이 배운 그림 지식에 "변화" 정보를 더하는 법을 배웠습니다. 이를 통해 비디오가 단순한 그림이 아니라, 무언가를 하고 있는 그림이라는 것을 이해할 수 있게 되었습니다.

이러한 층위를 하나씩 추가함으로써, 모델은 혼란을 겪지 않고 지식을 단계별로 쌓아 올릴 수 있었으며, 움직이는 비디오에 소리를 동기화하는 복잡한 작업을 처리할 수 있게 되었습니다.

"어닐드(Annealed)" 가이드 (완벽한 타이밍)

스마트한 모델이라 할지라도 까다로운 부분이 있습니다. 바로 로봇이 언제 변화 신호에 귀를 기울여야 하는가 하는 문제입니다.

연구진은 사운드 생성 과정(무작위 노이즈에서 시작하여 서서히 선명해지는 과정) 동안 로봇에게 서로 다른 종류의 도움이 필요하다는 것을 깨달았습니다.

  • 초기 단계 (거친 스케치): 로봇은 움직임의 큰 그림을 알아야 합니다. 리듬과 타이밍을 제대로 잡기 위해 시간적 차이로부터 강력한 가이드를 받아야 합니다.
  • 마지막 단계 (미세한 디테일): 로봇은 소리의 구체적인 질감에 집중해야 합니다. 만약 마지막까지 변화 신호에 너무 강하게 의존한다면, 소리가 왜곡될 수 있습니다.

이를 해결하기 위해 그들은 **어닐드 시간적 차이 가이드(Annealed Temporal Differences Guidance, ATDG)**를 발명했습니다. 이는 소리가 명확해짐에 따라 "움직임" 신호를 자동으로 줄이는 볼륨 조절 노브과 같습니다. 프로세스 초기에는 "움직임" 신호가 크고 명확하여 소리가 비디오의 움직임과 일치하도록 보장합니다. 소리가 더 세밀해짐에 따라 "움직임" 신호는 부드럽게 사라지며, 로봇이 선명하고 고품질의 소리를 만드는 데 집중할 수 있게 해줍니다. 이러한 동적 조절은 소리가 완벽하게 타이밍이 맞으면서도 매우 깨끗하게 들리도록 보장합니다.

결과: 전문가보다 뛰어나다

연구팀은 수천 개의 비디오 클립과 원래의 사운드가 포함된 두 개의 유명한 데이터셋인 VGGSoundAudioSet을 통해 이 방법을 테스트했습니다. 그들은 TD-V2A를 추가적이고 복잡한 네트워크를 사용하는 다른 최첨단 시스템들과 비교했습니다.

결과는 인상적이었습니다. TD-V2A는 단순히 잘하는 수준을 넘어 거의 모든 모델을 압도했습니다.

  • 생성된 소리가 실제 인간이 만든 소리와 얼마나 유사한지를 나타내는 척도인 **Fréchet Audio Distance (FAD)**에서 0.53을 기록했습니다(낮을수록 좋습니다). 이는 목록에 있는 거의 모든 다른 방법보다 우수한 성적입니다.
  • **시간적 정렬 정확도(Temporal Alignment Accuracy, AA)**에서 89.1점을 기록했는데, 이는 소리가 비디오의 정확한 순간에 발생했음을 의미합니다. 이는 다른 방법들에 비해 엄청난 향상이며, 심지어 이 점수를 최적화하기 위해 설계된 특정 시스템조차 능가했습니다.
  • 인간 대상 테스트에서도 사람들은 생성된 소리가 다른 AI 모델보다 더 현실적이고 동기화가 잘 되어 있다고 평가했습니다.

이 논문은 좋은 결과를 얻기 위해 거대하고 별도의 네트워크나 (소리의 구조를 미리 예측하는 것과 같은) 추가적인 참조 가이드가 필요하다는 생각을 명시적으로 부정합니다. 대신, 단순히 비디오의 자체적인 "변화" 정보를 적절한 방식으로 처리하는 것만으로도 고품질의 동기화된 소리를 만들기에 충분하다는 것을 보여주었습니다.

이것이 왜 중요한가

이 논문은 비디오 투 오디오 생성에 대한 강력하고 새로운 사고방식을 제시합니다. 더 크고 복잡한 기계를 만드는 대신, 우리는 이미 가지고 있는 데이터에서 숨겨진 단서를 찾을 수 있습니다. 프레임 사이의 "차이"에 집중함으로써, 저자들은 더 직접적인 접근 방식이 오히려 더 복잡한 방식보다 더 뛰어난 성능을 낼 수 있음을 증명했습니다. 이는 때때로 영화를 이해하는 가장 좋은 방법은 프레임을 보는 것이 아니라, 그들이 어떻게 변하는지를 관찰하는 것임을 상기시켜 줍니다.

저자들은 이 방법이 단순한 미세 조정이 아니라 근본적인 변화라고 결론짓습니다. 시간적 차이를 명시적으로 모델링하는 것은 비디오 투 오디오 생성을 개선하는 단순하면서도 강력한 방법이며, 향에 완전히 새로운 복잡한 구조를 발명하지 않고도 더 나은 사운드 효과의 길을 열어줄 수 있다고 제안합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →