Evaluating Speech Articulation Synthesis with Articulatory Phoneme Recognition
본 논문은 발음 인식을 대리 지표로 활용하여 음성 조음 합성을 평가하는 방법을 제안하며, 이 접근 방식이 전통적인 점별 거리 지표보다 생산의 뉘앙스를 더 잘 포착하고 보다 견고한 평가를 제공함을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
사람이 목소리를 내는 실제 소리를 들려주는 대신, 목 안쪽에서 입술이 움직이는 모습을 보여주는 방식으로 로봇에게 말하기를 가르친다고 상상해 보세요. 이것이 조음 음성 합성의 핵심 과제입니다. 즉, 로봇이 만들어야 할 소리(음소) 목록을 바탕으로 발성 기관(입과 목)의 "형태"를 생성하는 것입니다.
저자들이 직면한 큰 문제는 다음과 같습니다: 로봇이 잘하고 있는지 어떻게 알 수 있을까요?
문제: "자"는 맛을 재지 못한다
일반적으로 과학자들은 두 개의 컴퓨터 모델을 비교할 때, 로봇의 출력과 실제 인간의 움직임 사이의 차이를 측정하는 "자"를 사용합니다. 예를 들어 혀 모양의 두 점 사이의 거리를 측정할 수 있습니다.
저자들은 이것이 스푼과 그릇 사이의 거리를 재는 방식으로 요리사의 수프를 평가하는 것과 같다고 주장합니다. 측정하기는 쉽지만, 수프가 맛있는지 알려주지는 못합니다.
- 결함: 실제 인간의 발화는 혼란스럽습니다. 사람들은 "사과"라는 단어를 말할 때마다 혀를 약간씩 다르게 움직입니다. 간단한 자는 로봇이 혀를 1 밀리미터만 다르게 움직여도 소리가 완벽했을지라도 로봇이 "틀렸다"고 말할 수 있습니다.
- 간극: 현재 방법들은 약간 "흔들리지만" 이해 가능한 소리를 내는 로봇과 완전히 이해할 수 없는 소리를 내는 로봇을 구분하는 데 어려움을 겪습니다.
해결책: "미각 테스터"(음소 인식)
이를 해결하기 위해 저자들은 로봇을 평가하는 새로운 방식을 제안했습니다: 사람(또는 똑똑한 컴퓨터)에게 결과를 듣고 어떤 단어가 말해졌는지 추측하게 하세요.
그들은 입 모양을 보고 소리를 식별하려는 "미각 테스터"(신경망) 를 구축했습니다.
- 유사성: 로봇의 혀와 인간의 혀 사이의 거리를 재는 대신, 로봇에게 "이 입 모양을 보여준다면 어떤 소리를 낼 것 같나요?"라고 묻습니다.
- 논리: 로봇의 입 모양이 좋다면 "미각 테스터"는 90% 의 확률로 소리를 올바르게 식별해야 합니다. 모양이 나쁘다면 테스터는 혼란을 겪고 잘못 추측할 것입니다.
실험: 세 명의 경쟁자
연구자들은 특수 MRI 기계(실시간으로 목 안쪽을 촬영하는 장비) 로 촬영된 프랑스 여성의 발화 데이터 세트를 사용하여 세 가지 다른 "로봇"(합성 모델) 을 테스트했습니다.
- "평균적인 조"(기준선): 이 로봇은 각 소리마다 평균 입 모양을 취합니다. 단순하지만 입술을 자연스럽게 움직이지 않는 인형처럼 경직되어 있습니다.
- "자유로운 영혼"(모델 프리): 이 로봇은 엄격한 규칙서를 따르지 않고 데이터에서 직접 입 모양을 배우고 그립니다.
- "건축가"(오토인코더): 이 로봇은 먼저 해부학의 규칙을 학습한 후, 그 규칙을 바탕으로 입 모양을 구축합니다.
결과: "미각 테스터"가 발견한 것
저자들은 세 로봇 모두에서 나온 입 모양을 "미각 테스터"에 입력했습니다. 다음과 같은 일이 발생했습니다:
- "평균적인 조"는 처참하게 실패했습니다. 테스터는 어떤 소리가 만들어지고 있는지 파악하지 못했습니다. 이는 단순히 모양을 평균내는 것만으로는 부족하다는 것을 확인시켜 주었습니다.
- "건축가"(오토인코더) 는 괜찮았습니다. 혀의 위치를 올바르게 잡았습니다 (예: "T" 소리를 내기 위해 손가락을 어디에 둬야 하는지 아는 것처럼) 하지만 타이밍이 약간 어색했습니다.
- "자유로운 영혼"(모델 프리) 이 놀라운 승자였습니다. 엄격한 해부학적 규칙을 따르지 않았음에도 불구하고, "미각 테스터"는 이 로봇의 입 모양을 다른 어떤 모델보다, 어떤 경우에는 실제 인간 데이터보다 더 잘 이해했습니다!
왜일까요? 저자들은 "자유로운 영혼" 로봇이 우연히 실제 인간 데이터의 "노이즈"(작고 혼란스러운 떨림) 를 필터링하여 테스터가 읽기 더 쉬운 더 깨끗하고 일관된 입 모양을 만들어냈다고 제안합니다.
중요한 세부 사항: "목소리 스위치"
MRI 카메라가 볼 수 없었던 한 가지 요소는 성대(목소리를 만드는 진동 부분) 입니다. "T"(무성음) 와 "D"(유성음) 의 입 모양은 거의 동일하게 보입니다.
- 이를 해결하기 위해 연구자들은 컴퓨터에 "이 소리는 유성음이다" 또는 "이 소리는 무성음이다"라고 알려주는 간단한 "스위치"를 데이터에 추가했습니다.
- 결과: 이 스위치를 추가함으로써 "미각 테스터"가 훨씬 더 똑똑해졌으며, 입 모양 자체에 많은 정보가 담겨 있지만 유사한 소리를 구분하기 위해서는 약간의 도움이 필요하다는 것이 입증되었습니다.
결론
이 논문은 아직 병원이나 전화를 위한 완벽한 말하는 로봇을 구축했다고 주장하지 않습니다. 대신 음성 합성 연구자들의 숙제를 채점하는 새로운 방법을 제시합니다.
"음소 인식기"(소리를 식별하는 AI) 를 채점 도구로 사용하여 그들은 다음과 같은 사실을 발견했습니다:
- 단순한 거리 측정은 음성 품질을 평가하는 데 적합하지 않습니다.
- 일부 해부학적 규칙을 무시하더라도 "더 깨끗한" 움직임을 생성하는 모델이 해부학적으로 완벽해 보이려 하지만 혼란스러운 모델보다 실제로 더 이해하기 쉬운 결과를 만들어낼 수 있습니다.
- 유성음인지 무성음인지에 대한 작은 힌트만 추가한다면 입 모양 자체가 텍스트처럼 "읽을" 수 있을 만큼 충분한 정보를 담고 있습니다.
간단히 말해: 로봇의 입을 자로 재지 말고, 책 읽기를 시키세요. 만약 로봇이 책을 읽을 수 있다면, 입은 제대로 작동하는 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.