← 최신 논문
💻 computer science

Reference-Driven Multi-Speaker Audio Scene Generation from In-the-Wild Priors

이 논문은 야생 데이터(in-the-wild data)로 사전 학습된 텍스트-오디오 플로우 매칭 모델을 활용하여, 참조 음성과 자유 형식의 프롬프트를 조건으로 설정함으로써 주변 소음이 포함된 사실적인 중첩 대화 장면을 생성하는 동시에, 고노이즈 편향(high-noise-biased) 학습 전략을 통해 "참조 지름길(Reference Shortcut)" 문제를 극복하는 참조 기반 다중 화자 오디오 생성 방법인 ScenA를 소개한다.

원저자: Michael Finkelson, Daniel Segal, Eitan Richardson, Shahar Armon, Nani Goldring, Poriya Panet, Nir Zabari, Benjamin Brazowski, Or Patashnik, Yoav HaCohen

게시일 2026-06-19
📖 3 분 읽기☕ 가벼운 읽기

원저자: Michael Finkelson, Daniel Segal, Eitan Richardson, Shahar Armon, Nani Goldring, Poriya Panet, Nir Zabari, Benjamin Brazowski, Or Patashnik, Yoav HaCohen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 두 명의 서로 다른 배우, 배경 음악, 그리고 북적이는 카페 소리가 담긴 짧고 활기찬 라디오 드라마를 만들고 싶다고 상상해 보세요.

과거의 방식 ( "조립 라인" 접근법)
이전에 이런 장면을 만들려면, 당신은 클립보드를 든 엄격한 영화 감독처럼 행동해야 했습니다. 당신은 다음과 같은 과정을 거쳐야 했습니다:

  1. 누가 언제 말할지를 정확하게 명시한 대본을 작성합니다 (예: "대사 1: 화자 A", "대사 2: 화자 B").
  2. 화자 A의 목소리를 별도로 생성합니다.
  3. 화자 B의 목소리를 별도로 생성합니다.
  4. 이 클립들을 수동으로 이어 붙입니다.
  5. 그 위에 배경 소음을 얹습니다.

그 결과물은 깔끔하긴 했지만 가짜처럼 들렸습니다. 마치 두 사람이 진공 상태에서 대화하는 것처럼 느껴졌는데, 이는 시스템이 그들이 어떻게 겹쳐서 말해야 하는지, 어떻게 함께 웃어야 하는지, 혹은 공간의 음향 특성에 어떻게 반응해야 하는지를 알지 못했기 때문입니다.

새로운 방식 (SCENA: "즉흥 연기 감독")
이 논문은 SCENA라고 불리는 새로운 시스템을 소개합니다. 클립보드 대신, 당신은 그저 평이한 영어로 된 자유로운 흐름의 이야기 묘사를 제공하기만 하면 됩니다.

  • 프롬프트: 당신은 이렇게 입력합니다: "부드러운 피아노 연주가 흐른다. 첫 번째 화자가 '안녕!'이라고 빠르게 말한다. 두 번째 화자가 동시에 '어서 오세요!'라고 외치며, 두 목소리는 완벽하게 어우러진다."
  • 참조 자료: 당신은 사용하고 싶은 목소리(목소리 1과 목소리 2)의 짧은 오디오 클립 두 개를 업로드합니다.
  • 마법: AI는 당신의 이야기를 읽고 전체 장면을 즉시 생성합니다. AI는 누가 언제 말할지, 목소리가 어떻게 자연스럽게 겹칠지, 피아노 소리를 어떻게 넣을지, 심지어 방 안의 소리가 실제처럼 들리게 할 방법까지 한 번에 알아서 결정합니다.

핵심적인 문제 해결: "속임수 지름길"

연구진이 처음에 이 방식으로 AI를 가르치려 했을 때, AI는 "속임수"를 쓰려고 했습니다.

학생이 사진 속 인물을 설명과 매칭하는 시험을 보고 있다고 상상해 보세요.

  • 목표: 학생은 설명("빨간 모자를 쓴 남자")을 읽고 그에 맞는 사진을 찾아야 합니다.
  • 속임수: 학생이 맞추려는 사진을 슬쩍 보고, 빨간 모자가 있는 것을 확인한 뒤, 설명을 무시하고 그냥 그 특징과 가장 닮은 사진을 골라버립니다.

AI의 경우, 학습 과정 중의 "시험"은 노이즈가 섞이고 뒤섞인 버전의 오디오였습니다. AI는 뒤섞인 노이즈를 듣고, 가장 비슷하게 들리는 목소리를 찾아내어 그대로 복제할 수 있다는 사실을 깨달았습니다. 즉, 당신의 텍text 프롬프트를 읽을 필요 없이 누가 말하고 있는지 알 수 있었던 것입니다. 이것은 학습 단계에서는 아주 잘 작동했습니다(낮은 에러 수치). 하지만 실제로 사용할 때는 처참하게 실패했습니다. 왜냐하면 실제 생성은 순수한 정적(silence) 상태에서 시작되기 때문입니다. AI는 당신의 지시 사항을 듣는 대신, 지시를 무시하는 법을 배워버린 것입니다.

해결책: "고노이즈 식단"

이를 해결하기 위해 연구진은 AI의 "학습 식단"을 변경했습니다.

보통 AI 학습은 정답이 어느 정도 보이는 "중간 노이즈" 수준에서 이루어집니다. 연구진은 바로 이 지점에서 속임수가 발생한다는 것을 깨달았습니다. 그들은 **고노이즈 편향 스케줄(High-Noise-Biased schedule)**로 전환했습니다.

누군가에게 얼굴을 인식하도록 가르치는 상황을 생각해 보세요:

  1. 기존 방식: 약간 안개가 낀 사진을 보여줍니다. 그들은 특징을 보고 설명(힌트)을 읽지 않고도 이름을 추측할 수 있습니다.
  2. 새로운 방식 (SCENA): 사진의 90%가 흰 눈으로 덮여 있는 상태를 보여줍니다. 이 경우 누군지 맞히는 유일한 방법은 **힌트(설명)**를 읽는 것뿐입니다 ("그는 빨간 모자를 쓴 사람이다").

AI가 거의 순수한 정적 상태의 오디오를 가지고 주로 학습하도록 강제함으로써, 연구진은 AI가 속임수를 쓰는 것을 멈추고, 누가 언제 말할지를 결정하기 위해 당신의 텍스트 지시 사항을 실제로 경청하도록 만들었습니다.

결과

이 새로운 시스템을 테스트했을 때 다음과 같은 결과가 나타났습니다:

  • 더 나은 결합(Binding): 이전 시스템들보다 훨씬 더 정확하게 오른쪽 목소리를 오른쪽 이야기 부분에 할당했습니다.
  • 사실성: 겹쳐지는 음성, 웃음, 한숨, 그리고 배경 소음 등을 만들어내어, 박제된 스튜디오 녹음이 아닌 실제의 무질서한 대화처럼 들리게 했습니다.
  • 와일드 카드: 목소리 클립이 스튜디오가 아닌 거리나 공원 같은 노이즈가 있는 실제 환경에서 녹음된 경우에도 잘 작동했습니다.

요약하자면, SCENA는 복잡한 대본을 쓰거나 오디오를 수동으로 편집할 필요 없이, 단지 이야기와 몇 개의 목소리 클립만으로 멀티 액터 오디오 장면을 디렉팅할 수 있게 해주는 시스템입니다. 왜냐하면 이 시스템은 지름길을 찾는 대신 당신의 말을 듣는 법을 배웠기 때문입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →