생각해 보세요. 훌륭한 요리사 (AI) 가 있다고 칩시다. 이 요리사는 손님이 시킨 메뉴 (텍스트) 를 보고 요리를 해줍니다. 그런데 요리사의 실력은 어떤 재료를 먼저 맛보고 시작하느냐에 따라 천차만별입니다.
기존 방식: 요리사가 재료를 고를 때, "아무거나 랜덤하게" 혹은 "메뉴 이름이 비슷한 것"만 보고 골랐습니다. 그래서 감정이 없는 요리가 나오거나, 목소리가 들쭉날쭉해지는 문제가 생겼죠.
이 논문이 제안하는 방식 (ExpPro): 요리사가 재료를 고를 때 두 단계로 꼼꼼하게 선별하는 시스템을 만들었습니다.
🚀 두 단계의 선별 과정 (ExpPro 의 비밀)
이 시스템은 재료를 고르는 과정을 **'정적인 단계 (Static)'**와 **'동적인 단계 (Dynamic)'**로 나눕니다.
1 단계: 정적인 선별 (재료의 '기본기'와 '실력' 검증)
이 단계는 요리가 시작되기 전에, 어떤 재료가 가장 좋은지 미리 골라내는 과정입니다.
감정의 강도 확인 (피치 분석): 목소리의 높낮이 (피치) 를 분석합니다.
비유: "화난 소리"는 보통 목소리가 높고 떨리며, "슬픈 소리"는 낮고 단조롭습니다. 이 논문은 AI 가 감정을 잘 표현할 수 있는 목소리의 높낮이 패턴을 가진 음성만 따로 모았습니다.
청각적 품질과 텍스트의 조화: 소리가 맑은지 (DNSMOS), 그리고 글자와 감정이 잘 맞는지를 ChatGPT 같은 AI 가 점수를 매겨 확인합니다.
비유: "나는 행복해!"라는 글에 슬픈 목소리 샘플을 쓰면 안 되죠. 글과 목소리가 천생연분인지 확인하는 것입니다.
실제 요리사 (AI 모델) 와의 궁합 테스트: 같은 재료라도 요리사 (TTS 모델) 에 따라 맛이 다를 수 있습니다. 그래서 실제 AI 모델에 이 재료를 넣어보며, "목소리가 잘 닮았는지", "감정이 잘 전달되는지"를 테스트합니다.
비유: 어떤 재료를 넣으면 요리사가 맛있게 만들지만, 어떤 재료를 넣으면 맛이 망가질 수 있으니, 실제 요리사에게 가장 잘 맞는 재료를 골라냅니다.
2 단계: 동적인 선별 (상황에 맞는 '최고의 친구' 찾기)
이 단계는 요리가 진행되는 중에, 지금 당장 필요한 재료를 골라내는 과정입니다.
상황에 맞는 매칭: 미리 선별된 좋은 재료들 중에서, **지금 요리사에게 시킨 메뉴 (입력 텍스트)**와 가장 의미적으로 비슷한 것을 골라냅니다.
비유: "화난 상황"을 묘사하는 글을 입력하면, 미리 선별된 '화난 소리' 샘플들 중에서 가장 격렬한 화남을 표현하는 샘플을 골라내는 것입니다.
🌟 왜 이 방법이 좋을까요? (결과)
기존에 무작위로 고르거나 글자만 보고 고르던 방식보다 훨씬 훌륭합니다.
감정이 살아납니다: "화남", "기쁨", "슬픔" 등 감정의 강도가 훨씬 뚜렷해졌습니다.
목소리가 안정적입니다: AI 가 말하는 사람의 목소리를 잘 닮게 유지해 줍니다. (목소리가 갑자기 바뀌는 일이 줄어듦)
학습 없이도 가능: AI 모델을 다시 훈련시키지 않아도, 똑똑한 재료 고르기 전략만 적용해도 성능이 좋아집니다.
💡 한 줄 요약
이 논문은 **"AI 가 목소리를 낼 때, 무작위로 재료를 고르지 말고, 감정의 높낮이와 글의 의미, 그리고 AI 모델의 특성을 모두 고려해 '최고의 참고 음성'을 두 번에 걸쳐 골라내면, 훨씬 더 감동적이고 자연스러운 목소리를 만들 수 있다"**는 것을 증명했습니다.
마치 최고의 셰프가 최고의 식재료를 고르는 것처럼, AI 가 최고의 '참고 음성'을 고르면 우리 귀에 더 즐거운 소리가 들리는 것입니다!
논문 개요
이 논문은 대규모 언어 모델 (LLM) 기반 제로샷 (Zero-shot) 음성 합성 (TTS) 시스템에서 **감정 강도 (Emotion Intensity)**와 **화자 일관성 (Speaker Consistency)**을 향상시키기 위해 제안된 새로운 프롬프트 선택 전략인 ExpPro를 소개합니다. 기존 방법들이 프롬프트 선택에 있어 감정 표현의 풍부함이나 화자 유사성을 보장하지 못하는 한계를 극복하기 위해, 추가 학습 없이 프롬프트를 체계적으로 선별하는 2 단계 전략을 제시합니다.
1. 문제 정의 (Problem)
배경: 최근 LLM 기반 TTS 시스템은 입력 프롬프트를 통해 콘텐츠, 음색, 화자 정체성, 감정을 제어할 수 있는 제로샷 생성이 가능합니다.
현황: 생성된 음성의 품질은 프롬프트의 선택에 크게 의존합니다.
한계: 기존 프롬프트 선택 방법 (무작위 선택 또는 텍스트 유사도 기반 선택) 은 다음과 같은 문제를 가집니다.
무작위 선택: 풍부한 감정 정보나 표현력을 보장하지 못함.
텍스트 기반 선택: 텍스트와 원하는 감정 간의 연결이 약할 경우 감정 표현이 부자연스러워짐.
공통된 문제: 프롬프트에 포함된 화자 정체성 신호의 안정성과 적절한 감정 강도 지표를 보장하지 못하여, 표현력 있고 안정적인 음성 합성이 어렵습니다.
2. 제안 방법: ExpPro (Methodology)
ExpPro 는 추가 학습 없이 적용 가능한 2 단계 프롬프트 선택 전략으로 구성됩니다.
가. 정적 선택 단계 (Static Selection Stage)
합성 전에 프롬프트 후보군을 평가하여 품질이 높은 후보를 선별합니다. 세 가지 차원에서 평가합니다.
피치 (Pitch) 기반 프로소딕 특징:
화자의 평균 피치 (Mean) 와 피치 분산 (Variance) 을 분석합니다.
K-Means 클러스터링을 통해 각 감정 (기쁨, 슬픔, 분노 등) 에 해당하는 피치 패턴을 식별하고, 해당 감정에 가장 적합한 피치 특성을 가진 클러스터를 선택합니다.
지각적 품질 및 텍스트 - 감정 일관성:
지각적 품질: DNSMOS 를 사용하여 오디오 신호의 선명도와 자연스러움을 객관적으로 평가합니다.
텍스트 - 감정 일관성: ChatGPT API 를 활용하여 프롬프트 텍스트와 라벨된 감정 간의 의미적 일치도를 점수화합니다.
위 두 점수를 결합하여 상위 n%의 데이터를 선별합니다.
TTS 모델별 성능 평가:
선별된 후보들을 실제 TTS 모델 (CosyVoice 등) 에 입력하여 생성된 음성을 평가합니다.
평가 지표: 문자 오류율 (CER), 화자 유사성 (Resemblyzer, WavLM), 감정 유사성 (Emotion2Vec).
이 단계는 동일한 프롬프트라도 모델에 따라 출력이 달라질 수 있음을 고려하여, 특정 모델에서 가장 잘 작동하는 프롬프트를 선별합니다.
나. 동적 선택 단계 (Dynamic Selection Stage)
정적 선택을 거친 후보군 중에서, 현재 합성하려는 입력 텍스트와 가장 의미적으로 유사한 프롬프트를 최종적으로 선택합니다.
stsb-distilroberta-base 모델을 사용하여 텍스트 간 유사도를 계산하고, 가장 관련성이 높은 프롬프트를 최종 입력으로 사용합니다.
3. 주요 기여 (Key Contributions)
ExpPro 전략 제안: 추가 학습 없이 LLM 기반 TTS 를 위한 정적 - 동적 2 단계 감정 프롬프트 선택 전략을 최초로 제안했습니다.
다각적 분석: 프롬프트의 텍스트/음성 특성, 모델 내에서의 구체적 성능, 그리고 프롬프트 자체의 감정 품질을 종합적으로 고려한 분석을 수행했습니다.
범용성: 프롬프트 음성 개념을 사용하는 모든 TTS 모델에 적용 가능한 유연한 프레임워크를 제공합니다.
4. 실험 결과 (Results)
데이터셋 및 모델: HE2D(고감정 표현 데이터셋) 와 ESD(오픈소스 감정 데이터셋) 를 사용했으며, CosyVoice 와 GPT-SoVITS 두 가지 최신 LLM 기반 TTS 모델에서 검증했습니다.
성능 향상:
감정 강도 (SP) 및 화자 유사성 (Speaker Similarity): 무작위 선택 및 텍스트 기반 선택 (MiniLM) 대비 모든 감정 카테고리 (기쁨, 슬픔, 분노, 놀람, 위안) 에서 유의미한 향상을 보였습니다.
주관적 평가 (MOS): 생성된 음성의 자연스러움과 감정 표현력이 기존 방법보다 우수했습니다.
모델 의존성 확인: 동일한 프롬프트라도 모델 (CosyVoice vs GPT-SoVITS) 에 따라 성능이 크게 달라짐을 확인하여, 모델별 성능 평가 단계의 중요성을 입증했습니다.
Ablation Study:
프롬프트 음성 품질 선택 단계와 모델 성능 평가 단계를 모두 포함할 때 가장 최적의 성능을 발휘함을 확인했습니다.
파라미터 (m,n,k) 조정을 통해 감정 강도와 선택 범위 간의 균형을 찾았습니다.
5. 의의 및 결론 (Significance)
기술적 의의: 제로샷 TTS 에서 프롬프트 선택이 단순한 입력이 아닌, 성능을 결정하는 핵심 요소임을 강조하고 이를 체계적으로 최적화하는 방법을 제시했습니다.
실용적 가치: 추가적인 모델 학습이나 데이터 수집 없이, 기존 LLM 기반 TTS 시스템의 표현력과 안정성을 즉시 향상시킬 수 있는 솔루션을 제공합니다.
미래 전망: 텍스트 - 오디오 생성 등 다양한 작업으로 확장 가능하며, 프롬프트 선택의 다른 차원 (예: 화자 나이, 화법 등) 을 연구할 수 있는 기반을 마련했습니다.
이 논문은 ExpPro를 통해 프롬프트 엔지니어링의 중요성을 부각시키며, 고품질의 표현적 음성 합성을 위한 표준적인 프롬프트 선택 프로세스를 제시했다는 점에서 의의가 큽니다.