← 최신 논문
⚡ electrical engineering

TRACE-EVC: Text-Guided Relative Affective Control for Zero-Shot Emotional Voice Conversion

이 논문은 자연어 지시어를 활용하여 소스에 고정된 rectified flow를 통해 상대적인 감정 변환을 유도함으로써, 화자의 정체성과 음성 품질을 보존하면서도 유연한 감정 조절을 가능하게 하는 제로샷 감정 음성 변환 프레임워크인 TRACE-EVC를 소개한다.

원저자: Zihan Zhang, Shreeram Suresh Chandra, Zongyang Du, Xiutian Zhao, Aurosweta Mahapatra, Hao Zhang, Philipp Koehn, Berrak Sisman

게시일 2026-07-07
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zihan Zhang, Shreeram Suresh Chandra, Zongyang Du, Xiutian Zhao, Aurosweta Mahapatra, Hao Zhang, Philipp Koehn, Berrak Sisman

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 친구가 이야기를 들려주고 있다고 상상해 보세요. 지금 그 친구는 중립적이고 차분한 목소리로 말하고 있습니다.

**전통적인 감정 음성 변환(Traditional Emotional Voice Conversion)**은 친구에게 "이제부터 아주 화가 난 사람처럼 말해봐" 또는 *"이제 슬픈 사람처럼 말해봐"*라고 구체적인 대본을 주는 것과 같습니다. 시작하기 전에 반드시 정확한 목적지를 정의해야만 합니다.

**이 논문(TRACE-EVC)**은 당신의 친구에게 대화하는 새로운 방식을 소개합니다. 목적지를 알려주는 대신, 방향을 알려주는 것입니다. 당신은 "목소리를 조금 더 행복하게 만들어줘," 또는 "조금 더 자신감 있게 말해줘," 혹은 *"흥분을 아주 조금만 가라앉혀줘"*라고 말할 수 있습니다.

이 시스템은 '행복'이나 '자신감'이 진공 상태에서 무엇을 의미하는지 알 필요가 없습니다. 단지 자연어 지시를 바탕으로 당신의 친구의 현재 목소리를 새로운 감정 쪽으로 어떻게 이동시켜야 하는지만 알면 됩니다.

이들이 어떻게 해냈는지, 쉬운 비유를 들어 설명해 드리겠습니다.

1. 문제점: "목적지"의 함정

대부분의 음성 시스템은 특정 주소가 필요한 GPS(예: "공원으로 가세요")처럼 작동합니다. 만약 주소를 모르거나, 그저 "조금 더 북쪽으로 더 가고 싶을" 뿐이라면 GPS는 혼란에 빠집니다.

  • 문제: 기존 도구들은 작동하기 위해 특정 타겟 감정(예: "화남"이라는 라벨)이나 참조 녹음(누군가가 화를 내고 있는 클립)이 필요합니다.
  • 논문의 해결책: 연구진은 현실 세계에서 우리가 종종 목소리를 특정 방향으로 살짝 밀어주고 싶어 한다는 점을 깨달았습니다. "더 따뜻하게 만들어줘", "덜 놀란 듯이 말해줘" 같은 요청 말이죠. 그들은 이러한 "상대적인" 지시를 이해하는 시스템을 원했습니다.

2. 데이터셋: "전과 후"를 알려주는 코치 (TRACE-Instruct)

컴퓨터에게 이 새로운 기술을 가르치기 위해, 연구진은 기존 데이터를 그대로 사용할 수 없었습니다. 목소리가 어떻게 변했는지 '설명'할 수 있는 선생님이 필요했습니다.

  • 비유: 무용수가 "느린 동작"에서 "빠른 동작"으로 움직이는 영상을 보고 있는 무용 강사를 상상해 보세요. 강사가 두 번째 클립을 단순히 "빠름"이라고 라벨링하는 대신, *"무용수가 발걸음을 빠르게 하고 팔을 더 높이 들어 올렸다"*라고 메모를 남기는 것과 같습니다.
  • 그들이 한 일: 그들은 감정이 담긴 음성 쌍(소스와 타겟)을 가져왔습니다. 그리고 스마트한 AI(거대 언어 모델)를 사용하여 두 음성 사이의 차이점을 살펴보고, 그 변화를 설명하는 자연스러운 지시문을 작성하게 했습니다 (예: "톤을 더 행복하고 따뜻한 전달 방식으로 전환하라"). 그들은 이러한 "전과 후"의 지시문들로 이루어진 거대한 라이브러리인 TRACE-Instruct를 구축했습니다.

3. 엔진: "나침반" (TRACE-EVC & Emo-Compass)

이것이 핵심 기술입니다. 논문에서는 메인 모듈을 Emo-Compass라고 부릅니다.

  • 과거 방식: 매번 어딘가로 가고 싶을 때마다 백지 상태에서 지도를 그려야 하는 상황을 상상해 보세요. 당신은 빈 페이지(노이즈)에서 시작하여 텍스트 프롬프트를 바탕으로 목적지를 추측해야 합니다.
  • TRACE-EVC 방식: 당신이 이미 특정 지점(소스 보이스)에 서 있다고 상상해 보세요. 당신에게는 나침반(지시문)이 있습니다. 시스템은 목적지를 추측하는 것이 아니라, 당신이 서 있는 곳으로부터 이동해야 할 벡터(방향과 거리)를 계산합니다.
  • 작동 원리:
    1. 현재의 목소리(앵커)를 가져옵니다.
    2. 당신의 지시(예: "더 차분하게 만들어줘")를 읽습니다.
    3. "현재"에서 "차분함"으로 목소리를 이동시키기 위해 필요한 정확한 수학적 "밀기(push)"를 계산합니다.
    4. 그 밀기를 적용하여 새로운 목소리를 생성합니다.
  • 이점: 실제 목소리에서 시작하기 때문에, 화자의 정체성(누가 말하는지)과 내용(무엇을 말하는지)을 완벽하게 유지하면서 요청에 따라 감정만을 변화시킵니다.

4. 결과: 성공했는가?

연구진은 두 가지 방식으로 이 시스템을 테스트했습니다.

  • 감정 변화: "슬픔"을 "행복"으로 바꾸거나 ("슬픔을 약간 줄이기" 등).
  • 강도 변화: "행복한" 목소리를 "매우 행복하게" 혹은 "적당히 행복하게" 만들기.

연구 결과:

  • 지시 이행: 시스템은 자연어 지시를 매우 잘 따랐습니다. "더 자신감 있게"를 요청하면 목소리가 더 자신감 있게 들렸고, "흥분을 줄여달라"고 하면 차분해졌습니다.
  • 정체성 유지: 목소리는 로봇이나 다른 사람이 아닌, 원래 화자 본인의 목소리를 유지했습니다.
  • 품질: 음성은 명확하고 자연스러웠으며, 특정 타겟 라벨을 요구하는 기존 시스템들과 대등하거나 때로는 능가하는 성능을 보였습니다.
  • 제로샷(Zero-Shot): 이는 시스템이 이전에 들어본 적 없는 화자에 대해서도, 해당 화자의 특정 감정 샘플을 미리 학습하지 않고도 작동함을 의미합니다.

요약

TRACE-EVC를 뉘앙스를 이해하는 음성 편집기라고 생각하세요. 목소리를 "화남"이나 "슬픔"이라는 딱딱한 상자에 강제로 집어넣는 대신, *"이것을 좀 더 극적으로 만들어줘"*와 같은 당신의 자연스러운 요청을 듣고, 화자 고유의 개성과 이야기의 내용은 완벽하게 보호하면서 목소리를 그 방향으로 부드럽게 조종합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →