Context-Adaptive Emotional Speech Synthesis via Feature Control in Multi-Turn Dialogue (ChinaMM 2026)
본 논문은 대화 이력 메모리와 음성 신호 및 텍스트의 이중 모달 결합 입력을 활용하여 음향 특징을 동적으로 예측하고 제어함으로써, 기존의 전사 기반 방식의 한계를 극복하고 자연스럽고 정서적으로 일관된 응답을 구현하기 위한 다회차 감정 음성 합성을 위한 문맥 적응형 프레임워크를 제안한다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
상대방의 목소리가 단순히 단어를 내뱉는 것을 넘어, 숨을 쉬고, 멈추고, 순간의 기분에 맞춰 어조를 바꾸는 방식까지도 완벽하게 인간처럼 들리는 대화를 상상해 보십시오. 수십 년 동안 텍스트를 음성으로 변환하는 기술은 이러한 미묘한 차이를 구현하는 데 어려움을 겪어왔습니다. 기계는 이제 문장을 완벽한 명료함으로 읽어낼 수 있지만, 실제 대화에서 화자 사이에 흐르는 미묘한 감정적 흐름은 놓치기 일쑤입니다. 그들은 평이한 진술과 속삭이는 비밀 사이의 차이를 듣지 못하거나, 이전 문장의 웃음이 다음 문장의 어조에 영향을 미쳐야 한다는 점을 이해하지 못합니다. 이러한 격차는 대부분의 시스템이 중간 매개체에 의존하기 때문에 발생합니다. 즉, 시스템은 먼저 사람의 음성을 텍-스트로 변환하여 맥락을 파악한 다음, 그 텍스트를 사용하여 새로운 목소리를 생성합니다. 이 과정에서 원래 목소리가 가진 풍부하고 보이지 않는 세부 사항들—음높이의 상승과 하강, 날카로운 숨 들이킴, 특유의 휴지 리듬 등—은 모두 제거되어, 컴퓨터에는 대화의 뼈대만을 남기게 됩니다.
중국 통신대학교(Communication University of China)의 연구진은 이러한 간극을 메울 수 있는 새로운 접근 방식을 개발하여, 기계가 단순히 텍스트 전사본을 읽는 것이 아니라 실제 대화의 소리를 직접 들을 수 있게 했습니다. ChinaMM 2026 컨퍼런스에서 발표된 이들의 연구는 다회차 대화를 관찰하고 정서적으로 연속적이며 자연스럽게 일관된 반응을 생성할 수 있는 시스템을 소개합니다. 대화 기록을 단어로 변환하는 대신, 이들의 방법은 이전 차례의 가공되지 않은 오디오를 새로 말해야 할 텍스트와 함께 시스템에 직접 입력합니다. 이를 통해 컴퓨터는 음파 자체에 내재된 웃음, 한숨, 혹은 강조와 같은 파라언어적(paralinguistic) 단서와 감정 상태를 인지할 수 있습니다. 이렇게 함으로써 시스템은 다음 문장이 정확히 어떻게 들려야 하는지를 예측할 수 있으며, 과거의 슬픈 어조가 공감 어린 반응으로 이어지거나, 흥분의 분출이 그에 걸맞은 에너지로 맞받아쳐지도록 보장합니다.
연구진은 인간이 대화를 처리하는 방식을 모방하도록 설계된 두 부분으로 구성된 엔진을 기반으로 솔루션을 구축했습니다. 첫 번째 부분은 매우 주의 깊은 청취자 역할을 하며, 이전 문장의 소리와 다음 문장의 텍ist 사이의 관계를 이해하도록 훈련되었습니다. 이 시스템을 가르치기 위해 연구팀은 '2단계' 학습 전략을 포함한 영리한 전략을 사용했습니다. 먼저, 모델이 짧고 고립된 음성 클립에서 괄호가 아주 짧은 순간보다 길게 지속되는 것을 식별하거나 분노를 나타내는 갑작스러운 음높이 변화를 포착하는 것과 같은 특정 특징들을 인식하도록 가르쳤습니다. 연구팀은 신중하게 라벨링된 작은 사례 집합을 사용하여 기초 지식을 구축했습니다. 그 후, 이 훈련을 대화 쌍, 즉 방금 말해진 소리와 곧 말해질 텍스트를 살펴보는 방식으로 확장했습니다. 이를 통해 모델은 단순히 어떤 특징이 어떤 소리를 내는지뿐만 아니라, 대화 전반에 걸쳐 그 특징이 어떻게 진화하는지를 학습할 수 있었습니다. 모델은 방금 들은 이력을 바탕으로 다가올 응답의 감정적 톤과 구체적인 음향적 세부 사항을 예측하는 법을 배웠습니다.
하지만 이러한 특징들을 예측하는 것은 전투의 절반에 불과합니다. 시스템은 그 예측을 음성 합성기가 실제로 따를 수 있는 명령어로 번역해야 합니다. 프레임워크의 두 번째 부분은 정밀한 번역기 역할을 합니다. 첫 번째 부분이 원하는 목소리에 대한 설명을 자연어로 생성하지만, 가공되지 않은 설명을 음성 생성기에 직접 입력하면 기계가 명령을 따르는 대신 명령 자체를 소리 내어 읽어버리는 혼란을 초생할 수 있습니다. 이를 방지하기 위해 연구진은 예측된 특징들을 표준화된 형식으로 변환하는 엄격한 템플릿 세트를 만들었습니다. 예를 들어, 시스템이 웃음을 예측하면, 번역기는 이를 단순히 모호한 설명이 아니라 특정 시점에 웃음을 삽입하라는 구체적인 명령으로 형식을 지정합니다. 이 단계는 단어 사이의 호흡이나 특정 음절에 대한 강조와 같은 미묘한 세부 사항들이 의도한 대로 정확하게 실행되도록 보장합니다.
기존 방식들과 비교 테스트했을 때, 이 새로운 프레임워크는 대화 전반에 걸쳐 감정적 일관성을 유지하는 명확한 능력을 보여주었습니다. 두 가지 서로 다른 인간 대화 데이터셋을 사용한 실험에서, 이 시스템은 기존 기술보다 훨씬 더 자연스럽고 감정적으로 정확하다고 청취자들에게 평가받은 음성을 생성했습니다. 연구진은 인간 청취자가 목소리의 품질을 평가하게 하고, 소프트웨어를 사용하여 생성된 음성의 감정 범주를 원본 녹음과 비교함으로써 이를 측정했습니다. 결과에 따르면, 이 방식은 의도된 감정과 일치하는 정확도가 더 높았으며, 한 데이터셋에서는 54.7%, 다른 데이터셋에서는 47.4%의 점수를 기록하며 기존의 선도적인 시스템들을 능가했습니다. 또한, 합성된 음성은 소리의 품질에서 왜곡이 적었으며, 이는 베이스라인 모델의 출력물보다 실제 인간의 목소리에 더 가깝게 들렸음을 의미합니다.
이러적인 성공의 시각적 증거는 시스템이 대화의 흐로를 처리하는 방식에서 발견됩니다. 한 테스트 케이스에서 화자가 "여기 계산서입니다(Here is your bill)"라고 말했을 때, 시스템은 문장의 자연스러운 결말을 반영하여 문장 끝에서 음높이가 낮아지는 것을 정확히 예측한 반면, 오래된 모델들은 평이하고 변함없는 톤을 생성했습니다. 또 다른 사례에서는 맥락이 즐거운 순간을 암시할 때, 시스템은 문장 끝에 웃음을 성공적으로 생성했는데, 이는 이전 모델들이 맥락 부족으로 인해 생성하지 못했던 기능입니다. 마찬가지로, 시스템은 적절한 순간에 자연스러운 휴지와 호흡을 삽입하는 법을 학습하여, 단순한 로봇의 낭독이 아닌 실제 인간의 상호작용처럼 느껴지는 리듬을 만들어냈습니다. 이러한 능력들은 프로세스를 너무 늦추지 않으면서도 달성되었습니다. 이전 차례를 듣는 것부터 새로운 목소리를 생성하는 것까지 전체 시스템은 1초 미만으로 작동하여 실시간 대화가 가능할 만큼 빠릅니다.
이 연구는 또한 연구팀이 내린 구체적인 설계 선택의 중요성을 강조했습니다. 연구진이 번역 단계를 제외하고 시스템을 테스트했을 때 음성의 품질이 현저히 떨어졌는데, 이는 모델의 가공되지 않은 예측값이 직접 사용하기에는 너무 무질서하다는 것을 확인시켜 주었습니다. 이는 특징들의 구조화된 매핑이 시스템 작동에 필수적임을 입증했습니다. 연구진은 이 시스템이 일대일 대화에서는 탁월한 성능을 보이지만, 현재는 비교적 조용한 환경을 위해 설계되었다고 언급했습니다. 그들은 이 기술을 그룹 대화나 소음이 있는 환경과 같은 더 복적인 시나리오로 확장하고, 오류를 줄이기 위해 학습 과정을 정교화하는 방향으로 탐구할 계획입니다. 현재로서는, 이 연구는 기계가 진정으로 경청하고 인간 파트너와 같은 감정적 깊이로 응답할 수 있게 만드는 중요한 진전이며, 자연스러운 목소리의 핵심이 단어뿐만 아니라 그 사이의 침묵의 소리에 있다는 것을 증명하고 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.