← 최신 논문
⚡ electrical engineering

Expressive Prompting: Improving Emotion Intensity and Speaker Consistency in Zero-Shot TTS

이 논문은 제로샷 TTS 에서 감정 강도와 화자 일관성을 향상시키기 위해, 정적 단계에서 피치 기반 특징과 LLM 점수를, 동적 단계에서 텍스트 유사도를 활용하는 2 단계 프롬프트 선택 전략을 제안하고 그 유효성을 입증합니다.

원저자: Haoyu Wang, Chunyu Qiang, Tianrui Wang, Cheng Gong, Yu Jiang, Yuheng Lu, Chen Zhang, Longbiao Wang, Jianwu Dang

게시일 2026-04-06
📖 3 분 읽기☕ 가벼운 읽기

원저자: Haoyu Wang, Chunyu Qiang, Tianrui Wang, Cheng Gong, Yu Jiang, Yuheng Lu, Chen Zhang, Longbiao Wang, Jianwu Dang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🎙️ 핵심 비유: "요리사와 최고의 재료를 고르는 법"

생각해 보세요. 훌륭한 요리사 (AI) 가 있다고 칩시다. 이 요리사는 손님이 시킨 메뉴 (텍스트) 를 보고 요리를 해줍니다. 그런데 요리사의 실력은 어떤 재료를 먼저 맛보고 시작하느냐에 따라 천차만별입니다.

  • 기존 방식: 요리사가 재료를 고를 때, "아무거나 랜덤하게" 혹은 "메뉴 이름이 비슷한 것"만 보고 골랐습니다. 그래서 감정이 없는 요리가 나오거나, 목소리가 들쭉날쭉해지는 문제가 생겼죠.
  • 이 논문이 제안하는 방식 (ExpPro): 요리사가 재료를 고를 때 두 단계로 꼼꼼하게 선별하는 시스템을 만들었습니다.

🚀 두 단계의 선별 과정 (ExpPro 의 비밀)

이 시스템은 재료를 고르는 과정을 **'정적인 단계 (Static)'**와 **'동적인 단계 (Dynamic)'**로 나눕니다.

1 단계: 정적인 선별 (재료의 '기본기'와 '실력' 검증)

이 단계는 요리가 시작되기 에, 어떤 재료가 가장 좋은지 미리 골라내는 과정입니다.

  • 감정의 강도 확인 (피치 분석): 목소리의 높낮이 (피치) 를 분석합니다.
    • 비유: "화난 소리"는 보통 목소리가 높고 떨리며, "슬픈 소리"는 낮고 단조롭습니다. 이 논문은 AI 가 감정을 잘 표현할 수 있는 목소리의 높낮이 패턴을 가진 음성만 따로 모았습니다.
  • 청각적 품질과 텍스트의 조화: 소리가 맑은지 (DNSMOS), 그리고 글자와 감정이 잘 맞는지를 ChatGPT 같은 AI 가 점수를 매겨 확인합니다.
    • 비유: "나는 행복해!"라는 글에 슬픈 목소리 샘플을 쓰면 안 되죠. 글과 목소리가 천생연분인지 확인하는 것입니다.
  • 실제 요리사 (AI 모델) 와의 궁합 테스트: 같은 재료라도 요리사 (TTS 모델) 에 따라 맛이 다를 수 있습니다. 그래서 실제 AI 모델에 이 재료를 넣어보며, "목소리가 잘 닮았는지", "감정이 잘 전달되는지"를 테스트합니다.
    • 비유: 어떤 재료를 넣으면 요리사가 맛있게 만들지만, 어떤 재료를 넣으면 맛이 망가질 수 있으니, 실제 요리사에게 가장 잘 맞는 재료를 골라냅니다.

2 단계: 동적인 선별 (상황에 맞는 '최고의 친구' 찾기)

이 단계는 요리가 진행되는 중에, 지금 당장 필요한 재료를 골라내는 과정입니다.

  • 상황에 맞는 매칭: 미리 선별된 좋은 재료들 중에서, **지금 요리사에게 시킨 메뉴 (입력 텍스트)**와 가장 의미적으로 비슷한 것을 골라냅니다.
    • 비유: "화난 상황"을 묘사하는 글을 입력하면, 미리 선별된 '화난 소리' 샘플들 중에서 가장 격렬한 화남을 표현하는 샘플을 골라내는 것입니다.

🌟 왜 이 방법이 좋을까요? (결과)

기존에 무작위로 고르거나 글자만 보고 고르던 방식보다 훨씬 훌륭합니다.

  1. 감정이 살아납니다: "화남", "기쁨", "슬픔" 등 감정의 강도가 훨씬 뚜렷해졌습니다.
  2. 목소리가 안정적입니다: AI 가 말하는 사람의 목소리를 잘 닮게 유지해 줍니다. (목소리가 갑자기 바뀌는 일이 줄어듦)
  3. 학습 없이도 가능: AI 모델을 다시 훈련시키지 않아도, 똑똑한 재료 고르기 전략만 적용해도 성능이 좋아집니다.

💡 한 줄 요약

이 논문은 **"AI 가 목소리를 낼 때, 무작위로 재료를 고르지 말고, 감정의 높낮이와 글의 의미, 그리고 AI 모델의 특성을 모두 고려해 '최고의 참고 음성'을 두 번에 걸쳐 골라내면, 훨씬 더 감동적이고 자연스러운 목소리를 만들 수 있다"**는 것을 증명했습니다.

마치 최고의 셰프가 최고의 식재료를 고르는 것처럼, AI 가 최고의 '참고 음성'을 고르면 우리 귀에 더 즐거운 소리가 들리는 것입니다!

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →