← 최신 논문
🤖 machine learning

Training-Free Multimodal Guidance for Video to Audio Generation

본 논문은 비디오, 오디오, 텍스트 간의 통합된 정렬을 강제하기 위해 모달리티 임베딩을 활용하여 비용이 많이 드는 재학습 없이 비디오-오디오 생성의 지각적 품질과 의미적 일관성을 향상시키는 새로운 학습 없는 다중 모달 안내 메커니즘을 제안한다.

원저자: Eleonora Grassucci, Giuliano Galadini, Giordano Cicchetti, Aurelio Uncini, Fabio Antonacci, Danilo Comminiello

게시일 2026-05-18
📖 3 분 읽기☕ 가벼운 읽기

원저자: Eleonora Grassucci, Giuliano Galadini, Giordano Cicchetti, Aurelio Uncini, Fabio Antonacci, Danilo Comminiello

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 소리가 없는 무성 영화 클립이 있습니다. 개가 짖거나, 차가 충돌하거나, 비가 내리는 모습을 볼 수는 있지만 화면은 완전히 무음입니다. 당신의 목표는 보이는 것과 완벽하게 맞는 사운드 이펙트를 만들어내는 것입니다. 이것이 바로 비디오-오디오 (V2A) 생성의 과제입니다.

오랫동안 컴퓨터에게 이를 가르치는 것은 개에게 수천 시간의 비디오와 오디오를 함께 암기시키며 말하게 하려는 시도와 같았습니다. 이는 비용이 많이 들고 느렸으며 방대한 양의 데이터가 필요했습니다.

최근 몇몇 똑똑한 연구자들은 Seeing&Hearing과 같은 방법으로 '학습 없는 (training-free)' 접근법을 시도했습니다. 그들은 그림을 보고 소리를 추측할 수 있는 사전 훈련된 '번역기'를 사용했습니다. 그러나 이 번역기는 다소 서툴렀습니다. 비디오와 오디오를 한 쌍씩 (개 사진과 짖는 소리를 매칭하는 것처럼) 만 비교했을 뿐입니다. 때로는 전체 그림을 보지 못해 혼란을 겪으며 정적 잡음이나 장면과 잘 맞지 않는 소리를 만들어내기도 했습니다.

새로운 해결책: '부피' 나침반

이 논문의 저자들은 다중 모달 확산 안내 (Multimodal Diffusion Guidance, MDG) 라는 새롭고 영리한 트릭을 제안합니다. 그들은 컴퓨터에 새로운 두뇌를 만든 것이 아니라, 기존 두뇌에 더 나은 나침반을 제공한 것입니다.

간단한 비유를 들어 작동 원리를 설명해 보겠습니다:

1. 세 명의 친구 (비디오, 오디오, 텍스트)
넓고 빈 방에 세 명의 친구가 서 있다고 상상해 보세요:

  • 친구 V는 비디오를 들고 있습니다.
  • 친구 A는 소리를 들고 있습니다.
  • 친구 T는 텍스트 설명 (예: "개가 짖는다") 을 들고 있습니다.

2. 옛날 방식 (쌍별 매칭)
옛날 방식은 친구 V 에게 친구 A 와 악수를 하라고 한 뒤, 별도로 친구 A 에게 친구 T 와 악수하라고 하는 것과 같았습니다. 악수가 "괜찮다"고 느껴지면 컴퓨터는 "좋아, 이게 맞는구나!"라고 생각했습니다. 하지만 때로는 친구들이 실제로는 낯선 사람임에도 악수가 괜찮게 느껴지기도 했습니다. 이로 인해 잘못된 소리가 만들어졌습니다.

3. 새로운 방식 (부피)
새로운 방식은 세 명의 친구가 함께 서서 모양을 만들도록 요청합니다.

  • 그들이 모두 같은 것 (개가 짖는 것) 에 대해 이야기하고 있다면, 서로 가까이 서서 작고 단단한 모양을 만듭니다. 이때 '부피' (그들이 차지하는 공간) 는 작습니다.
  • 그들이 서로 다른 것 (개, 자동차 충돌, "비") 에 대해 이야기하고 있다면, 서로 멀리 떨어져 거대하고 퍼진 모양을 만듭니다. 이때 '부피'는 큽니다.

마법의 트릭:
컴퓨터의 임무는 오디오를 생성하는 것입니다. 소리를 만들어가는 동안, 컴퓨터는 비디오, 텍스트, 그리고 현재 만들고 있는 소리가 형성하는 '부피'를 끊임없이 점검합니다.

  • 부피가 크다면, 컴퓨터는 "아이고, 이건 맞지 않는군!"이라고 알고 소리를 변경하도록 밀어냅니다.
  • 세 친구의 이해가 완벽하게 일치하여 부피가 매우 작아질 때까지 소리를 계속 조정합니다.

이것이 특별한 이유는 무엇일까요?

  • 새로운 학습 불필요: 컴퓨터에게 새로운 것을 가르치는 데 며칠을 보낼 필요가 없습니다. 기존 오디오 생성기에 이 '부피 나침반'을 연결하기만 하면 됩니다. 이미 엔진이 있는 자동차에 GPS 를 추가하는 것과 같습니다. 엔진을 다시 짓는 것이 아니라, 올바른 방향으로 운전하도록 보장하는 것일 뿐입니다.
  • 더 나은 품질: 저자들의 테스트에서 이 방법은 훨씬 더 선명하고 현실적인 소리를 생성함을 보여주었습니다.
    • 예시: 수중 장면의 소리를 생성할 때, 옛날 방식은 정적 잡음처럼 들리게 만들었습니다. 반면 새로운 방식은 수중에서 들리는 뭉개진 듯한 물방울 소리를 정확하게 생성했습니다.
  • 대본 준수: 새로운 방식은 소리가 비디오뿐만 아니라 제공된 텍스트 설명에도 일치하도록 보장하여 모든 것을 의미적으로 일관되게 유지합니다.

결과

연구자들은 이 방법을 두 개의 대규모 데이터셋 (비디오 클립 모음) 에서 테스트했습니다:

  1. VGGSound: 특정 사운드 이벤트가 포함된 비디오 모음.
  2. AudioCaps: 소리가 비디오에서 항상 직접 보이지 않을 수도 있는 모음 (더 어려운 테스트).

두 경우 모두 그들의 '부피 나침반' 방법은 이전 최고 방법들보다 더 자연스럽고 시각적 장면과 더 잘 맞는 고품질 오디오를 생성했습니다. 이는 비디오, 오디오, 텍스트가 쌍이 아닌 그룹으로 어떻게 어울리는지 살펴봄으로써, 전체 시스템을 다시 학습시킬 필요 없이 AI 가 훨씬 더 좋고 현실적인 사운드스케이프를 만들도록 안내할 수 있음을 증명했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →