← 최신 논문
💻 computer science

PS4: Proxy-Supervised Joint Training for Real Target Speaker Extraction

이 논문은 깨끗한 타겟 음성 감독 없이도 실제 타겟 화자 추출에서 최첨단 성능을 달성하기 위해 대규모 이중 언어 코퍼스와 다중 목적 미세 조정 전략을 활용하는 프록시 감독 결합 학습 프레임워크인 PS4를 소개한다.

원저자: Wanyi Ning, Wei Zhou, Yingpeng Li, Yinshang Guo, Haitao Qian, Yiming Cheng

게시일 2026-07-10
📖 4 분 읽기☕ 가벼운 읽기

원저자: Wanyi Ning, Wei Zhou, Yingpeng Li, Yinshang Guo, Haitao Qian, Yiming Cheng

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 시끌벅적한 저녁 식사 자리에 있다고 상상해 보세요. 모두가 서로의 말을 가로채며 떠들고 있습니다. 당신은 오직 한 명의 특정 친구의 이야기만을 듣고 싶지만, 당신이 사용하는 오디오 녹음기는 방 안의 전체적인 소음과 겹쳐진 소리만을 포착했습니다. 보통 컴퓨터에게 특정 목소리를 골라내는 법을 가르치려면, 그 친구가 혼자서 말하는 '깨끗한' 녹음본을 교사(teacher)로 사용해야 합니다. 하지만 현실에서는 그런 깨끗한 녹음본을 구하기가 매우 어렵습니다. 당신에게 있는 것은 오직 이 엉망진창인 소음뿐입니다.

이것이 바로 이 논문의 저자들이 해결하고자 했던 정확한 문제입니다. 그들은 다음과 같이 질문했습니다. "우리는 대상 화자의 '깨끗한' 버전을 가지고 있지 않을 때, 어떻게 컴퓨터가 실제의 무질서한 대화 속에서 단일 화자를 분리하도록 훈련시킬 수 있을까?"

"가짜" 연습의 문제점

이 작업을 수행하는 대부분의 컴퓨터 프로그램은 실험실에서 훈련됩니다. 연구자들은 사람들이 혼자 말하는 깨끗한 녹음본을 가져와서 이를 인위적으로 섞어 가짜 소음을 만들어냅니다. 이는 마치 빈 운동장에서 공을 차며 축구 연습을 하는 것과 같습니다. 논문은 이러한 방식이 실제 경기장에 들어섰을 때 실패한다고 주장합니다. 실제 경기장에는 바람, 고르지 못한 잔디, 예측 불가능한 선수들이 가득하기 때문입니다. 실제 대화에는 배경 소음, 메아리, 그리고 이상한 타이밍에 말하는 사람들 등이 존재하며, 이 때문에 "가짜" 훈련은 쓸모없게 됩니다.

PS4 솔루션: 단서로부터 배우기

Yijiahe AI와 중국의 대학 연구진이 이끄는 팀은 PS4라고 불리는 새로운 시스템을 구축했습니다. 대상 화자의 깨끗한 녹음본이 필요하지 않은 대신, 그들은 컴퓨터가 지저히 섞인 녹음 안에 숨겨진 **단서(clues)**로부터 학습하도록 가르쳤습니다. 그들은 이를 "프록시 감독(proxy supervision)"이라고 부릅니다.

이것은 마치 선명한 사진이 없는 상태에서 군중 속의 특정 인물을 찾으려는 것과 같습니다. 얼굴을 완벽하게 볼 수는 없지만, 다른 단서들을 가질 수 있습니다:

  1. 그들이 말한 내용: 당신은 그들의 말에 대한 텍스트 전사(transcript)를 가지고 있습니다.
  2. 그들이 누구인지: 당신은 대화 초반의 짧고 명확한 목소리 클립(enrollment)을 가지고 있습니다.
  3. 그들이 언제 말했는지: 당신은 누가 언제 말했는지에 대한 대략적인 지도를 가지고 있습니다.
  4. 소리가 어떻게 들리는지: 당신은 오디오 품질이 어느 정도 수준이어야 하는지에 대한 감각을 가지고 있습니다.

훈련장 구축

시스템을 가르치기 위해 팀은 단순히 추측하는 대신, REAL-PS4라는 거대한 훈련 체육관을 구축했습니다. 그들은 네 가지 서로 다른 공개 데이터셋(중국어와 영어 회의 및 저녁 식사를 포함)에서 71,771개의 실제 대화 샘플을 가져왔습니다.

그들은 단순히 이것들을 섞어 놓은 것이 아니라, 다음과 같이 정교하게 처리했습니다:

  • 'enrollment' 참조용으로 사용할 단일 화자의 짧고 명확한 클립을 찾았습니다.
  • 해결해야 할 '혼합물(mixture)'로 사용할 두 명 이상의 사람이 겹쳐서 말하는 무질서한 부분을 찾았습니다.
  • 나쁜 샘플들을 걸러내어, 대상 화자가 시간의 20% 이상을 말하고 전사(transcript)에 최소 2개의 유효한 글자가 있는 경우만 남겼습니다.
  • 컴퓨터가 처리할 수 있도록 혼합 클립이 너무 길지 않게 제한했습니다(3ert_0초).

4단계 훈련 전략

그들의 방법의 핵심은 "결합 훈련(joint training)" 전략입니다. 그들은 단순히 컴퓨터에게 "목소리를 찾아라"라고 말하지 않았습니다. 대신 네 가지 서로 다른 목표를 동시에 달est하도록 했으며, 이는 네 명의 서로 다른 코치 역할을 합니다:

  1. 언어 코치 (ASR): 컴퓨터는 추출된 목소리가 텍스트 전사와 일치하는지 확인해야 합니다. 그들은 단어가 말이 되는지 확인하기 위해 강력한 언어 모델인 Whisper를 사용했습니다.
  2. 정체성 코치 (Speaker Similarity): 컴퓨터는 추출된 목소리가 방 안의 다른 사람들이 아닌, enrollment 클립에 있는 특정 인물의 목소리와 일치하도록 해야 합니다. 그들은 "랭킹(ranking)" 규칙을 사용했습니다: 추출된 목소리가 원래의 혼합된 소리보다 대상 화자와 더 닮아야 한다는 규칙입니다.
  3. 타이밍 코치 (VAD): 컴퓨터는 타이밍을 정확히 맞춰야 합니다. 만약 대상 화자가 침묵 중이었다면, 컴퓨터는 소음을 출력해서는 안 됩니다. 그들은 프레임 단위의 라벨을 사용하여 이를 확인했습니다.
  4. 품질 코치 (Perceptual): 컴퓨터는 결과물이 로봇 같거나 왜곡되지 않고 자연스럽고 명확하게 들리도록 해야 합니다. 그들은 결과의 "지각적 품질"을 판단하기 위해 DNSMOS라는 지표를 사용했습니다.

결과: 효과가 있는가?

팀은 실제 대화 데이터에 대한 테스트의 골드 스탠다드인 REAL-T 챌린지에서 시스템을 테스트했습니다.

  • 개발 세트(Development Set)에서: 그들은 다섯 가지 데이터셋(AISHELL-4, AliMeeting, AMI, CHiME-6, DipCo)에서 추출한 1,991개의 샘플로 테스트했습니다.

    • 그들의 시스템은 "가짜" 데이터로 훈련된 이전의 최고 "공식" 베이스라인들을 모든 지표에서 앞질렀습니다.
    • 예를 들어, AMI 데이터셋에서 그들은 0.388의 토큰 에러율(TER)과 0.714의 화자 유사도(SIM)를 달랐습니다.
    • 가장 어려웠던 AISHELL-4 데이터셋에서도 그들은 0.575의 SIM을 기록한 반면, 기존 베이스라인들은 0.45 미만의 점수에서 고전했습니다.
    • 더욱 놀랍게도, 그들의 시스템의 오디오 품질(DNSMOS OVRL)은 일관되게 3.1 이상이었으나, 기존 시스템들은 2.0 미만이었습니다.
  • 공식 리더보드에서: 최종 경쟁에 참여했을 때, PS4는 전체 2위를 차지했습니다.

    • 이 시스템은 제출된 모든 시스템 중 가장 높은 화자 유사도(Speaker Similarity) 점수인 0.565를 기록했습니다.
    • 또한 가장 높은 타이밍 F1 점수(0.871)를 기록했습니다.
    • 1위 시스템(MERL의 시스템)과 비교했을 때 오디오 품질(DNSMOS-P808)이나 에러율(TER) 측면에서 절대적인 최고 점수를 얻지는 못했지만, 화자의 정체성을 유지하고 타이밍을 맞추는 데 있어서는 압도적인 성능을 보여주었습니다.

결론

이 논문은 실제 생활을 위한 화자 추출 시스템을 훈련하는 데 깨끗하고 격리된 녹음본이 필요하지 않다는 결론을 내립니다. 전사, 목소리 정체성, 타이밍, 품질 점수와 같은 "프록시" 단서들을 사용함으로써, 실제의 무질서한 데이터로 직접 시스템을 훈련할 수 있습니다. 저자들은 이 접근 방식이 기존 방식에 대한 실용적이고 효과적인 대안임을 입증하며, 오직 군중의 소음만을 가지고 있을 때조차 컴퓨터가 군중 속에서 특정 목소리를 골라낼 수 있다는 것을 증명했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →