PASE: Leveraging the Phonological Prior of WavLM for Low-Hallucination Generative Speech Enhancement
본 논문은 사전 학습된 WavLM 모델의 강건한 음운론적 사전 지식을 활용하여 언어적 및 음향적 환각을 효과적으로 완화하는 동시에 기존 방식들보다 우수한 지각적 품질을 달성하는 생성적 음성 향상 프레임워크인 PASE를 제안한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 시끄럽고 포효하는 경기장 한복판에서 친구의 목소리를 들으려고 노력하고 있다고 상상해 보십시오. 당신의 뇌는 공학적 경이입니다. 뇌는 소리 지르는 관중과 울려 퍼지는 음악을 걸러내어 친구의 말에 집중합니다. 수십 년 동안 과학자들은 이와 똑같은 일을 할 수 있는 컴퓨터를 만들기 위해 노력해 왔으며, 이 분야를 **음성 향상(Speech Enhancement)**이라고 부릅니다. 목표는 간단합니다. 엉망진창이고 소음이 섞인 녹음본을 가져와서 마치 조용한 방에서 녹음된 것처럼 깨끗하게 만드는 것입니다.
전통적으로 컴퓨터는 음파의 "나쁜" 부분을 잘라내는 매우 엄격한 편집자처럼 행동하여 이 작업을 수행했습니다. 하지만 이 방식은 종종 목소리를 로봇처럼 만들거나 단조롭게 만들었습니다. 최근에는 새로운 세대의 "생성형(generative)" 컴퓨터가 등장했습니다. 이들을 편집자가 아니라, 목소리가 어떻게 들려야 하는지를 재구상할 수 있는 재능 있는 예술가라고 생각해 보십시오. 이들은 목소리를 자연스럽고 매끄럽게 만드는 데 탁요합니다. 하지만 여기에는 함정이 있습니다. 너무 창의적이기 때문에 가끔 지나치게 창의성을 발휘하기도 합니다. 소음이 너무 크면, 결코 말하지 않은 단어를 만들어내거나 화자의 목소리를 완전히 다른 사람처럼 바꿔버릴 수도 있습니다. 이것을 "환각(hallucination)"이라고 부릅니다. 이는 마치 음악가가 깨진 녹음본을 고치려다, 무엇이 있었어야 하는지 추측했다는 이유로 실수로 틀린 음을 연주하는 것과 같습니다. 과학자들의 큰 질문은 이것입니다: 어떻게 하면 새로운 예술가들의 자연스러운 소리를 얻으면서도 그들이 이야기를 지어내지 않게 할 것인가?
여기에 난징 대학교와 시스코 시스템즈(Cisco Systems)의 연구진이 수행한 새로운 연구가 있습니다. 그들은 이 "너무 창의적인" 문제를 해결하기 위해 PASE(Phonologically Anchored Speech Enhancer, 음운론적 닻을 내린 음성 향상기)라고 불리는 시스템을 제안합니다. 이전의 "생성형" 시스템들은 처음부터 단어를 추측하도록 가르치는 대신, 그들은 실제 인간의 언어가 어떻게 작동하는지에 기반한 참조점을 제공하기로 했습니다.
연구진은 기존의 "생성형" 시스템들이 소음이 섞인 깨진 녹음본만을 보고 언어의 규칙을 배우려 한다는 것을 깨달았습니다. 이는 눈보라 속에서 공이 거의 보이지 않는 경기를 보며 축구의 규칙을 배우려는 것과 같습니다. 컴퓨터는 혼란을 느끼고 새로운 규칙을 만들어내기 시작합니다. PASE는 다른 접근 방식을 취합니다. PASE는 이미 수천 시간의 깨끗한 음성을 학습한 WavLM이라는 사전 훈련된 AI 모델을 사용합니다. WavLM을 인간의 소리(음소)가 어떻게 결합되는지 정확히 알고 있는 숙련된 언어학자라고 생각해 보십시오. PASE는 이러한 규칙을 다시 배우려 하지 않습니다. 대신 단순히 숙련된 언어학자에게 도움을 요청합니다. PASE는 이 언어학자의 지식을 사용하여 정화 과정을 "고정(anchor)"함으로써, 컴퓨터가 인간의 언어 구조에 맞지 않는 단어를 절대 만들어내지 않도록 보장합니다.
목소리의 개성(예: 화자 특유의 톤과 피치)을 처리하기 위해, PASE는 영리한 이중 트랙 시스템을 사용합니다. 컴퓨터가 화가라고 상상해 보십시오. 한 트랙은 숙련된 언어학자의 도움을 받아 이야기(단어와 의미)에 집중하며 이야기가 정확한지 확인합니다. 다른 트랙은 화자의 목소리(텍스트)에 집중하며, 원래 인물처럼 들리도록 AI의 가장 낮은 층위에서 미세한 세부 사항을 끌어옵니다. 이 두 트랙을 분리하면서도 함께 작동하게 함으로써, PASE는 단어를 수정하는 동안 화자의 정체성이 변하는 흔한 함정을 피합니다.
그들의 실험 결과는 상당히 유망합니다. PASE를 다른 최고 수준의 모델들과 테스트했을 때, 단순히 소리가 좋았을 뿐만 아니라 훨씬 더 정확했습니다. 매우 소음이 심한 오디오를 대상으로 한 테스트에서, 다른 모델들은 종종 단어를 만들어냈고, 극단적인 경우에는 "단어 오류율(Word Error Rate, 얼마나 많은 단어가 틀렸는지를 나타내는 척도)"이 36% 또는 72%까지 치솟았습니다. 그러나 PASE는 테스트 결과에 따라 약 7.5%에서 15% 사이의 훨씬 낮은 오류율을 유지하면서도 자연스러운 소리를 냈습니다. 또한 화자의 목소리가 낯선 사람으로 변하지 않고 원래의 인물처럼 들리도록 유지하는 데 더 뛰어난 성능을 보였습니다.
저자들은 이러한 성공의 핵심이 단순히 더 큰 컴퓨터나 더 많은 데이터를 가진 것이 아니라, 올바른 "사전 지식(prior knowledge)"을 사용하는 데 있다고 제áf합니다. 그들은 AI가 누락된 소리를 예측하도록 훈련된 특정 방식으로부터 언어 구조를 이해하는 능력이 온다는 것을 발견했습니다. 이러한 특정 지식을 활용함으로써, PASE는 규율 있는 예술가처럼 행동합니다. 즉, 소음이 섞인 녹음본의 빈틈을 채울 수 있는 창의성을 갖추되, 인간 언어의 규칙에 의해 엄격히 안내되어 결코 선을 넘어 멋대로 이야기를 지어내지 않습니다. 이는 명확성과 정확성이 자연스러움만큼이나 중요한 실제 상황에서 PASE를 더 신뢰할 수 있는 도구로 만듭니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.