Is Natural Always Appropriate? Investigating Naturalness and Appropriateness Across Different Domains for TTS Evaluation
이 논문은 음성의 적절성이 도메인에 따라 크게 달라지며 전통적인 자연스러움 점수와 종종 상충하기 때문에, 텍스트 음성 변환(TTS) 평가는 일률적인 접근 방식보다는 문맥을 고려한 지표를 필요로 한다는 점을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
성우를 채용한다고 상상해 보세요. 만약 아이에게 침대 머리맡에서 동화책을 읽어줄 사람이 필요하다면, 당신은 차분하고 안정적이며 부드러운 목소리를 원할 것입니다. 하지만 비디오 게임에서 정신없이 몰아치는 캐릭터를 연기하거나, 커피를 마시며 친구와 수다를 떠는 듯한 느낌을 내야 한다면, 그 똑같은 차분한 목소리는 이상하고 어울리지 않게 느껴질 것입니다.
이 논문은 텍스트 음성 변환(TTS) 기술이 바로 이 문제에 직면해 있다고 주장합니다. 수년 동안 개발자들은 컴퓨터 목소리를 어떻게 하면 더 "자연스럽게"(인간처럼) 만들 수 있을지에 집중해 왔습니다. 하지만 본 연구는 "자연스럽다"는 것이 항상 "적절하다"는 것과 같지는 않다는 점을 보여줍니다.
연구 결과의 핵심 내용을 쉬운 비유를 들어 정리했습니다.
1. "맥가이버 칼"의 신화
오랫동안 목표는 모든 것을 잘 해낼 수 있는 단 하나의 완벽한 TTS 시스템을 구축하는 것이었습니다. 마치 최고의 칼, 드라이버, 가위 역할을 동시에 수행해야 하는 맥가이버 칼처럼 말이죠.
연구진은 오늘날 가장 똑똑하고 진보된 다섯 가지의 TTS 시스템을 테스트했습니다. 그리고 인간 청취자들에게 다음 다섯 가지 "역할"에 따라 평가하도록 요청했습니다.
- 낭독자: 책을 소리 내어 읽기.
- 비서: 시리(Siri)나 알렉사(Alexa)처럼 도움이 되는 AI 역할을 하기.
- 배우: 극적인 장면을 연기하기.
- 캐릭터: 애니메이션 만화 캐릭터 연기하기.
- 자연스러운 화자: 격식 없는 일상적인 대화 나누기.
결과: 단 하나의 시스템도 모든 분야에서 승리하지 못했습니다.
- 어떤 시스템은 책을 읽는 데는 훌륭했지만, 일상적인 대화를 하려고 하면 로봇처럼 들리고 지루해졌습니다.
- 또 다른 시스템은 실제 사람처럼 정돈되지 않은 자연스러운 대화를 하는 데는 놀라웠지만, 도움을 주는 비서 역할을 하기에는 너무 거칠고 다듬어지지 않은 느낌을 주었습니다.
비유: 이것은 마치 진흙투성이 축구 경기에 턱시도를 입고 가는 것과 같습니다. 턱시도는 "고급스럽고" "격식"이 있지만, 그 상황에는 맞지 않는 도구입니다. 마찬가지로, 격식 있는 낭독에 최적화된 TTS 시스템은 일상적인 대화에서는 처참하게 실패할 수 있습니다.
2. "인간다움"의 함정
연구는 놀라운 반전을 찾아냈습니다. 목소리가 인간처럼 들린다고 해서 반드시 그 역할에 적합한 목소리는 아니라는 점입니다.
- "로봇 같은" 비서: 사람들은 AI 비서의 목소리를 들을 때, 오히려 약간 덜 인간적이고 더 안정적인 목소리를 선호했습니다. 사람들은 수다스럽고 감정적인 친구를 원하는 것이 아니라, 믿음직한 도구를 원했습니다.
- "너무 실제 같은" 캐릭터: 애니메이션 캐릭터를 들을 때, 실제 사람처럼 불완전한 목소리(멈춤, 숨소리, 더듬거림 등)는 오히려 어색하게 느껴졌습니다. 청취자들은 캐릭터가 실제 사람처럼 당황한 듯한 모습이 아니라, 양식화된(stylized) 목소리를 갖기를 원했습니다.
핵심 요점: "자연스러움"은 까다로운 척도입니다. 때로는 덜 인간적으로 들리는 것이 특정 작업에 있어 가장 "적절한" 선택이 될 수 있습니다.
3. "불완전함"의 역설
연구진은 목소리가 적절하게 느껴지는 이유를 파악하기 위해 실제 음파를 분석했습니다. 그 결과, 역할마다 서로 다른 종류의 "결함"이 필요하다는 것을 발견했습니다.
- 일상적인 대화: 청취자들은 "음", "어"와 같은 작은 불완전함이나 목소리의 미세한 떨림을 오히려 좋아했습니다. 이러한 요소들이 AI를 마치 즉흥적으로 생각하며 말하는 실제 사람처럼 느끼게 해주었기 때문입니다.
- 낭독 또는 비서: 하지만 동일한 불완전함이 낭독이나 비서 역할에 등장하면 전문성이 떨어지거나 고장 난 것처럼 들리게 만들었습니다.
비유: 재즈 음악가가 즉흥 연주를 하는 것을 생각해 보세요. 몇 개의 틀린 음이나 흐트려진 리듬은 공연을 "생동감 있고" "즉흥적"으로 느껴지게 할 수 있습니다. 하지만 뉴스 앵커가 저녁 뉴스를 읽을 때 그런 실수를 한다면 그것은 재앙이 될 것입니다. "실수"는 오직 잘못된 맥락에서만 나쁜 것이 됩니다.
4. 고장 난 자(Ruler)
마지막으로, 이 논문은 우리가 TTS 품질을 측정하는 도구들이 종종 고장 나 있다는 점을 지적합니다.
대부분의 자동 채점 시스템(개발자들이 성과를 확인하기 위해 사용하는 "자")은 "깨끗하고" "완벽한" 오디오에 보상을 주도록 설계되어 있습니다.
- 문제점: 이 자들은 일상적인 대화나 극적인 설정에서 목소리를 좋게 만드는 요소들(예: 멈춤, 감정, 변화 등)을 오히려 감점합니다.
- 결과: TTS 시스템이 컴퓨터로부터는 "깨끗하다"는 높은 점수를 받을 수 있지만, 인간 청취자에게는 지루하거나 상황에 맞지 않는다는 비판을 받을 수 있습니다.
요약
이 논문의 핵심 메시지는 "이것이 인간처럼 들리는가?"라고 묻는 것을 멈추고, "이것이 이 역할에 적합한 소리인가?"라고 묻기 시작해야 한다는 것입니다.
단 하나의 "최고의" 목소리는 존재하지 않습니다. 해변에 갈 때 수영복을 입지 않고 비즈니스 미팅에 수영복을 입지 않듯, 비디오 게임 캐릭터에 사용하는 TTS 설정과 내비게이션 앱에 사용하는 설정을 동일하게 사용해서는 안 됩니다. 더 나은 AI 목소리를 만들기 위해서는, 단순히 진공 상태에서 얼마나 "인간적인가"를 따지는 것이 아니라, 그 목소리가 맡은 구체적인 역할에 따라 평가해야 합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.