Beyond Naturalness: Probing Automated Text-To-Speech Evaluators on Linguistically Grounded Dimensions
본 논문은 언어학적 근거를 둔 차원 수준의 텍사스-투-스피치(Text-to-Speech) 시스템 메타 평가 벤치마크를 소개하며, 이를 통해 MOS 예측기 및 오디오-LLM 판정기를 포함한 현재의 자동 평가 도구들이 기본적인 음향 품질을 넘어 지각적 음성 차원의 전체 폭을 신뢰성 있게 포착하는 데 실패하고 있음을 밝힌다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 로봇에게 말하는 법을 가르치고 있다고 상상해 보세요. 당신은 로봇이 버그가 난 비디오 게임 캐릭터처럼 들리는 것이 아니라, 진짜 사람처럼 들리기를 원합니다. 하지만 로봇이 잘하고 있는지 어떻게 알 수 있을까요? 오랫동안 과학자들은 '평균 의견 점수(Mean Opinion Score, MOS)'를 사용해 왔습니다. 이것은 마치 인간 청취자가 로봇이 얼마나 자연스럽게 들리는지에 대해 "B" 또는 "5점 만점에 4점"과 같이 단일한 성적을 매기는 학교 성적표와 같습니다. 최근에는 수천 개의 녹음 파일을 듣기 위해 인간에게 요청하는 시간을 아끼고자, 자동화된 점수를 주는 매우 똑똑한 AI 판사들(Audio-LLM이라고 불리는)을 사용하기 시작했습니다.
중요한 질문은 이렇습니다. 이 자동 판사들이 실제로 왜 목소리가 이상하게 들리는지 그 '이유'를 이해하고 있을까요? 로봇이 단어를 잘못 발음해서일까요? 아니면 너무 빨리 말해서일까요? 그것도 아니라면 로봇이 정말 로봇처럼 들리기 때문일까요? 만약 AI 판사가 구체적으로 무엇이 잘못되었는지 알지 못한 채 그냥 "B"라는 점수만 준다면, 그것은 마치 학생이 수학 시험을 망쳤는데 선생님이 덧셈을 틀린 것인지, 뺄셈을 틀린 것인지, 아니면 곱셈을 틀린 것인지 알려주지 않고 그냥 나쁜 점수만 주는 것과 같습니다. 이 논문은 우리의 현재 자동 판사들이 이러한 구체적인 실수를 포착할 만큼 정말 똑똑한지, 아니면 그저 오디오가 얼마나 "노이즈"가 섞여 있는지에 기반해 추측하고 있는 것인지를 파헤칩니다.
ServiceNow의 연구원들은 이 자동 판사들에게 매우 구체적인 테스트를 수행하기로 했습니다. 그들은 8,600개의 음성 샘플으로 구성된 거대하고 맞춤 제작된 데이터셋을 구축했는데, 단순히 무작위 문장을 기록한 것이 아니었습니다. 그들은 마치 미친 과학자처럼 의도적으로 특정 유형의 오류를 주입했습니다. 그들은 아주 작은 단어 수준의 오류(예: "bat" 대신 "cat"이라고 말하기)부터, 잘못된 감정으로 말하거나 인간이 물리적으로 낼 수 없는 목소리를 내는 것과 같은 더 큰 문제에 이르기까지 10가지 서로 다른 "오류의 맛"을 만들어냈습니다. 그러고 나서 훈련된 언어학자들이 모든 클립을 듣고 정확히 무엇이 잘못되었는지 라벨을 붙였습니다.
이 완벽한 "정답지"를 손에 쥐고, 그들은 네 가지 유형의 자동 MOS 예측기와 네 가지 유형의 Audio-LLM 판사를 테스트했습니다. 그들은 AI 모델들에게 다양한 조건 하에서 음성을 평가하도록 요청했습니다. 때로는 일반적인 "자연스러움" 점수만을 요구하기도 했고, 다른 때에는 10가지의 구체적인 오류 유형을 찾아보라는 상세한 체크리스트를 제공하기도 했습니다.
결과는 다소 충격적이었습니다. 전통적인 MOS 예측기들(단일 숫자만을 제공하는 것들)은 화재가 발생했을 때만 울리고 깨진 창문은 무시하는 화재 경보기와 같았습니다. 그들은 로봇 특유의 윙윙거리는 소리나 이상한 정적(논문에서 "인간적 타당성(Human Plausibility)" 오류라고 부르는 것)과 같은 명백하고 낮은 수준의 결함을 포착하는 데는 뛰어났지만, 언어적인 실수에는 완전히 눈이 멀어 있었습니다. 만약 로봇이 단어를 잘못 발음하거나 음절의 강세를 잘못 주더라도, MOS 예측기는 인간 청취자들이 인상을 찌푸릴 때조차 전혀 신경 쓰지 않고 높은 점수를 주곤 했습니다.
Audio-LLM 판사들은 조금 더 복잡했습니다. 그들은 오류를 찾아내는 능력을 보여주긴 했지만, 오직 올바른 방식으로 질문했을 때만 그러했습니다. 연구진이 단순히 "이것이 자연스러운가?"라고 물었을 때, AI 판사들은 일관성이 없었고 많은 구체적인 오류를 놓쳤습니다. 그러나 연구진이 10가지 차원을 확인하라는 상세한 "참조 가이드(schema)"를 제공했을 때, 판사들은 단어 수준의 실수를 훨씬 더 잘 찾아냈습니다. 하지만 함정이 있었습니다. 만약 AI에게 10가지 차원을 한꺼번에 확인하라고 요청하면, AI는 종종 혼란에 빠져 모든 것에 동일한 점수를 주는 '붕괴' 현상을 보였습니다. AI는 한 번에 한 가지 유형의 오류에만 집중하도록 요청했을 때 가장 잘 작동했습니다.
궁극적으로, 이 논문은 텍스트 음성 변환(TTS) 시스템이 좋은지 판단하기 위해 단 하나의 "자연스러움" 점수에 의존해서는 안 된다고 제안합니다. 현재의 자동 판사들은 지저한 책상은 잘 찾아내지만 철자 오류는 찾아내지 못하는 학생들과 같습니다. 그들은 실제 말해지는 언어보다는 녹음된 소리의 품질에 집중하는 경향이 있습니다. 저자들은 이러한 시스템을 진정으로 개선하기 위해서는 "자연스러움"을 하나의 커다란 미스터리로 취급하는 것을 멈추고, 발음, 강세, 감정, 속도와 같은 각 구체적인 차원을 개별적으로 평가해야 한다고 결론짓습니다. 그렇게 하지 않는 한, 우리의 자동 판사들은 로봇이 인간처럼 들리지만 실제로는 엉뚱한 말을 하고 있는 상황에 대해서도 합격점을 줄 수도 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.