An Artificial Glottal Spectrum-Based Excitation Model with LP-Based Spectral Modelling for Prosody Modification
본 논문은 기존의 시역역 피치 마킹을 인공 성대 스펙트럼 기반의 흥분 모델로 대체하여 피치 마킹의 모호성과 아티팩트를 제거함으로써, 텍스트 음성 합성 및 음성 변환 응용 분야에 적합한 고품질의 자연스럽고 효율적인 피치 및 지속 시간 조절을 달성하는 새로운 운율 수정 방법을 제안한다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
인간의 언어는 의미, 감정, 그리고 정체성을 전달하는 공기의 찰나적인 진동이자 복잡한 물리적 사건이다. 그 핵심에는 두 가지 뚜렷한 부분이 협력하여 만들어내는 소리가 있다. 첫 번째는 소스(source)로, 공기가 목의 성대를 통과할 때 발생하는 가공되지 않은 리드미컬한 맥동이다. 두 번째는 시스템(system)으로, 입, 혀, 목의 모양이 필터처럼 작용하여 그 가공되지 않은 맥동에 모음과 자음의 특정한 색을 입히는 것이다. 우리가 말을 할 때 이 두 요소는 불가분하게 연결되어 있어, 하나를 변화시키면 다른 하나에도 영향을 미치게 된다. 이는 엔지니어들이 자연스럽게 말하거나 녹음된 목소리를 변형하는 기계를 만드는 데 있어 큰 과제를 안겨준다. 컴퓨터가 단순히 녹음된 소리를 늘리거나 줄여서 속도나 음높이를 바꾸려고 시도하면, 결과물은 종종 로봇 같거나 왜곡된 소리가 나며 인간 화자의 자연스러운 질감을 잃게 된다.
연구자들은 이 두 구성 요소를 분리하여 독립적으로 조작할 수 있는 방법을 오랫동안 찾아왔다. 수십 년 동안 가장 흔히 사용된 방식은 성대의 진동 타이밍에 따라 음성 신호를 아주 작은 조각들로 자른 뒤, 그 조각들을 재배열하여 속도나 음높이를 바꾸는 기술이었다. 이 방법은 미세한 조정을 하는 데는 효과적이지만, 급격한 변화를 요구할 때는 어려움을 겪는다. 이 방식은 성대가 닫히는 정확한 순간을 찾는 것에 크게 의존하는데, 이는 완벽하게 수행하기 어려운 작업이다. 컴퓨터가 이 순간을 잘못 예측하면, 재구성된 목소리는 특히 음높이가 크게 높아지거나 너무 낮아질 때 금속음이 섞이거나 글리치(glitch)가 발생하는 등 이상한 아티팩트(artifact)를 만들어낸다.
최근 연구에서 인도의 한 연구팀은 이 문제를 다루는 다른 방식을 제안했다. 그들은 원래의 음파를 살려내고 재배열하려 노력하는 대신, 소스 자체를 교체하기로 결정했다. 그들의 방법은 음성 녹음에서 원래의 성대 진동을 제거하고, 이를 컴퓨터로 생성된 완벽하고 깨끗한 인공 버전으로 대체하는 것이다. 그들은 화자의 고유한 입과 목의 모양인 원래의 '필터'는 그대로 유지함으로써 목소리가 여전히 동일한 사람처럼 들리도록 보장한다. 원하는 음높이에 기반하여 새롭고 이상적인 맥동을 생성하고 이를 원래의 필터와 결합함으로써, 그들은 기존 방식들이 겪는 왜곡 없이 목소리를 재형성할 수 있다.
연구진은 타밀어 화자의 녹음본을 사용하여 이 새로운 접근 방식을 전통적인 방식과 비교 테스트했다. 그들은 인간 청취자들에게 수정된 음성의 품질을 1점에서 5점 척도로 평가하도록 요청했다. 결과는 그들의 새로운 방식이 특히 음높이가 크게 변할 때 일관되게 더 높은 품질의 목소리를 생성한다는 것을 보여주었다. 전통적인 방식은 음높이가 일정 수준 이상 변하면 부자연스럽고 저하된 소리를 내기 시작한 반면, 새로운 방식은 넓은 범위에 걸쳐 명료함과 자연스러움을 유지했다. 연구팀은 이 기술이 남성과 여성의 목소리 모두에 잘 작동하며, 음높이가 크게 위아래로 이동하더라도 화자의 정체성을 보존한다는 것을 발견했다.
단순한 음높이 변화를 넘어, 연구는 이 방식이 감정이나 강조를 전달하기 위해 목소리의 톤이 오르내리는 표현력 있는 언어를 얼마나 잘 처리하는지도 탐구했다. 연구진은 질문을 위한 상승조나 평서문을 위한 하강조와 같은 특정 피치 움직임 패턴을 만들고 이를 음성에 적용했다. 새로운 방식은 전통적인 방식보다 이러한 역동적인 변화를 더 매끄럽게 처리했는데, 전통적인 방식은 피치 윤곽(pitch contour)이 빠르게 변할 때 종종 가청 글리치를 유발했다. 그들이 생성한 인공 소스는 소리의 흐름을 깨뜨리지 않고 이러한 복잡한 곡선을 따라갈 수 있을 만큼 유연했다.
목소리를 이 별개의 부분들로부터 재구축하는 과정은 소리가 단순히 주파수들의 집합이 아니라 하나의 일관된 파동이 되도록 하기 위해 특정 단계를 필요로 했다. 연구진은 음파의 크기(magnitude)를 다루었지만 시간적 위상(timing phase)은 다루지 않았기에, 누락된 타이밍 정보를 추정하기 위해 반복적인 수학적 과정을 사용했다. 위상 재구성(phase reconstruction)이라고 알려진 이 단계는 그들이 자연스럽게 들리는 최종 파형을 합성할 수 있게 해주었다. 연구진은 이 재구성 단계가 완벽하지 않으며 약간의 개선 여지를 남겨두고 있다고 언급했지만, 전반적인 음성 품질은 기존 기술보다 우수했다.
연구는 원래의 성대 진동을 완벽하게 추적하려는 시도를 포기하고 깨끗한 인공 소스를 생성함으로써, 더 견고하고 표현력 있는 목소리 변형을 달实现할 수 있다는 결론을 내린다. 이 접근 방식은 성대 폐쇄의 정확한 순간을 감지하는 것과 관련된 모호함과 오류를 제거하며, 이는 해당 분야의 지속적인 병목 현상이었다. 이 연구 결과는 자연스러움과 유연성이 매우 중요한 텍스트 음성 변환 시스템이나 음성 변환과 같은 응용 분야에서, 소스를 통제된 인공 모델로 교체하는 것이 원래의 신호를 늘리려는 시도보다 더 신뢰할 수 있는 길임을 시사한다. 이 작업은 때때로 목소리를 더 인간답게 만들기 위해서, 인간적인 요소를 정밀한 수학적 이상향으로 교체할 용기가 필요하다는 것을 보여준다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.