← 최신 논문
🤖 machine learning

SALSA-V: Shortcut-Augmented Long-form Synchronized Audio from Videos

SALSA-V는 마스크된 확산 목적 함수(masked diffusion objective)와 새로운 숏컷 손실(shortcut loss)을 활용하여, 단 8단계만으로 소리가 없는 영상으로부터 매우 동기화된 고충실도의 장기 오디오를 합성함으로써 정렬과 효율성 측면 모두에서 기존의 최첨단 방식들을 크게 능가하는 멀티모달 비디오-투-오디오 생성 모델입니다.

원저자: Amir Dellali, Luca A. Lanzendörfer, Florian Grötschla, Roger Wattenhofer

게시일 2026-08-17
📖 4 분 읽기☕ 가벼운 읽기

원저자: Amir Dellali, Luca A. Lanzendörfer, Florian Grötschla, Roger Wattenhofer

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

모든 무성 영화가 생생한 사운드트랙을 입고 갑자기 살아 움직이는 세상을 상상해 보세요. 단순히 일반적인 피아노 연주가 아니라, 상자가 떨어지는 '쿵' 소리, 타이어가 자갈을 밟는 '드르륵' 소리, 혹은 바람에 나뭇잎이 '사락'거리는 소리 같은 것들 말이죠. 이것이 바로 컴퓨터가 눈에 보이는 것을 '듣도록' 시도하는 컴퓨터 과학 분야인 "비디오-투-오디오(video-to-audio)" 생성 기술의 꿈입니다. 오랫동안 컴퓨터는 이 작업에 서툴렀습니다. 전반적인 분위기는 짐작할 수 있었지만, 타이밍을 놓쳐 마치 파티에 늦게 도착한 듯한 어색한 소리를 만들어내곤 했습니다. 핵심적인 과제는 두 가지입니다. 컴퓨터는 '무엇이' 일어나고 있는지(의미론적 이해)와 그것이 '정확히 언제' 일어나는지(시간적 정렬)를 모두 이해해야 합니다. 공이 벽에 부딪힌다면, 소리는 정확히 그 밀리초(ms)에 발생해야 합니다. 그렇지 않으면 우리 뇌는 혼란을 느낍니다. 지금까지 이러한 소리를 만드는 데는 마치 느린 오븐에서 케이크를 굽는 것처럼 오랜 시간이 걸렸으며, 짧은 클립이 아닌 긴 영상을 만들려고 하면 결과물이 무너지는 경우가 많았습니다.

여기에 문제들을 해결하기 위해 등장한 새로운 디지털 마법사, SALSA-V가 있습니다. 이 모델을 마치 초능력을 부여받은 숙련된 폴리 아티스트(영화의 효과음을 만드는 사람)라고 생각해보세요. 그 초능력이란 믿기 힘들 정도로 빠르게 작업하면서도 결코 박자를 놓치지 않는 능력입니다. SALSA-V의 연구진은 무음 영상을 입력받아 고품질의 완벽하게 동기화된 오디오를 순식간에 생성할 수 있는 모델을 구축했습니다. 긴 영상에서도 헤매거나 몇 시간씩 기다려야 했던 기존 방식들과 달리, SALSA-V는 몇 분 분량의 소리를 단 몇 초 만에 만들어낼 수 있으며, 제공된 오디오 샘플을 듣고 그 스타일을 흉내 내는 음악적 카멜레온처럼 작동할 수도 있습니다.

이 새로운 마법사가 어떻게 작동하며 무엇을 발견했는지 소개합니다:

"지름길"의 마법
소리를 생성하는 대부분의 AI 모델은 조각가가 돌덩어리에서 불필요한 부분을 조금씩 깎아내며 형상을 드러내는 방식처럼 작동합니다. 보통 이는 수십 단계의 과정을 거쳐야 하므로 매우 느립니다. 하지만 SALSA-V는 "지름길"을 배웠습니다. 집에서 공원까지 걸어가는 상황을 상상해 보세요. 일반적인 모델은 매 인치마다 땅을 확인하며 조심스럽고 작은 발걸음을 내딛습니다. 반면 SALSA-V는 앞을 내다보고 크고 자신감 있는 보폭으로 성큼성큼 걷는 법을 배웠습니다. 한 번의 큰 걸음이 두 번의 작은 걸음을 합친 것과 같다는 점을 이해하도록 모델을 훈련함으로써, 연구진은 모델이 지루한 과정을 건너뛰도록 가르쳤습니다. 그 결과, SALSA-V는 단 8단계의 샘플링만으로 고품질의 오디오를 생성할 수 있게 되었습니다. 이는 거의 실시간에 가까운 속도로, 예전에 몇 분씩 걸리던 과정을 거의 즉각적인 일로 바꾸어 놓았습니다.

마스킹된 퍼즐
긴 영상에서 오디오가 뭉개지지 않도록 하기 위해, SALSA-V는 "마스크드 플로우 매칭(masked flow matching)"이라는 영리한 기법을 사용합니다. 이는 마치 크로스워드 퍼즐을 푸는 것과 같습니다. 처음부터 시작하는 것이 아니라, 이미 몇 개의 단어가 채워져 있고 나머지를 추측해야 하는 상황 말이죠. SALSA-V는 소리로 이 작업을 수행합니다. 훈련 과정에서 모델은 비디오와 오디오 클립을 함께 보여주지만, 오디오의 임의의 구간을 숨겨둡니다(마스킹). 그러면 모델은 비디오와 여전히 들리는 소리 부분을 바탕으로 숨겨진 소리가 무엇인지 알아내야 합니다. 이는 모델을 유연하게 만듭니다. 즉, 짧은 영상과 오디오 조각을 주면, 모델은 소리를 "아웃페인팅(outpainting)"하여 더 긴 영상에 맞춰 자연스럽게 확장하거나, 빈틈을 채워 연속적인 사운드스케이프를 만들어낼 수 있습니다.

리듬 섹션
비디오-투-오디오에서 가장 중요한 부분은 타이밍입니다. 영상 속에서 개가 짖는다면, 개의 입이 벌어지는 순간과 정확히 일치해야 합니다. 기존 모델들은 종종 타이밍이 미세하게 어긋나 인간의 귀에 부자연스럽게 느껴지곤 했습니다. SALSA-V는 특별한 "동기화 코치"를 훈련시켜 이 문제를 해결했습니다. 이 코치는 별도의 AI로, 영상 속에서 사건이 발생하는 정확한 순간을 인식하고 이를 소리와 일치시키는 법을 배웁니다. 연구진은 이 코치를 정말 유능하게 만들기 위해 주의가 필요하다는 것을 발견했습니다. 너무 많은 예시를 한꺼번에 사용하면 오히려 유사한 소리 사이의 미세한 차이를 포착하는 능력이 떨어졌기 때문입니다. 이렇게 세밀하게 조정함으로써, SALSA-V는 인간이 다른 최첨단 모델들보다 우수하다고 평가할 정도의 동기화 수준을 달elle 성했습니다. 청취 테스트에서 사람들은 SALSA-V의 타이밍과 전반적인 품질을 다른 최신 모델들보다 선호했습니다.

롱폼(Long-Form)의 도전
많은 AI 모델은 짧은 클립(약 10초)에는 뛰어나지만, 30초 이상의 긴 영상을 요청하면 무너지곤 합니다. 메모리가 부족해지거나 소리의 흐름이 어긋나기 때문입니다. SALSA-V는 "점진적(progressive)" 접근 방식을 사용하여 이 문제를 해결합니다. 전체 1분 분량의 소리를 한꺼번에 예측하려 하는 대신, 이전 구간의 끝부분을 다음 구간의 가이드로 삼아 오디오를 작은 단위로 나누어 생성합니다. 이를 통해 훨씬 더 긴 시간 동안 리듬과 스타일을 일관되게 유지할 수 있습니다. 30초 영상 테스트에서 SALSA-V는 높은 품질과 동기화를 유지한 반면, 다른 모델들은 길을 잃기 시작했습니다.

아직 할 수 없는 것 (한계점)
저자들은 모델의 한계에 대해서도 솔직하게 밝히고 있습니다. 모델이 이전 구간을 확장하며 소리를 구축하기 때문에, 만약 영상에서 장면이 갑자기 완전히 다른 장면으로 전환된다면(예: 조용한 도서관에서 시끄러운 공사 현장으로 급격히 바뀌는 경우), 사용자가 개입하지 않는 한 모델은 조용한 도서관의 소리를 공사 현장까지 그대로 이어가려 할 수 있습니다. 이 모델은 급격한 변화 없이 연속적인 장면에 가장 적합합니다.

결론
SALSA-V는 우리가 원하는 것을 모두 가질 수 있다는 것을 보여줍니다. 즉, 몇 분이 아닌 몇 초 만에 생성되는 고충실도(high-fidelity)의 완벽하게 동기화된 오디오를 얻을 수 있다는 것입니다. 이 모델은 단순히 소리를 만드는 것이 아니라, 시각적 리듬에 맞춰 정밀하게 소리를 구현함으로써 이전 모델들이 어려워했던 수준의 몰입감을 만들어냅니다. "지름길" 훈련 방식과 긴 시퀀스를 다루는 스마트한 방식을 결합함으로써, 이 모델은 실시간에 가까운 사운드 디자인의 길을 열어주며, 영화, 게임, 심지어 무성 기록 영상의 제작 방식을 바꿀 잠재력을 가지고 있습니다. 모든 영상 시나리오에 완벽한 해결책은 아닐지라도, 기계가 눈에 보이는 것을 진정으로 "들을 수 있게" 만드는 데 있어 중대한 도약을 의미합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →