A Situational Speech Synthesizer for Yoruba: System Design, Phonological Rule Architecture, and Orthographic Extensions for Contour
이 논문은 성조가 표시된 텍스트로부터 오디오를 생성하기 위해 수작업으로 제작된 음운 규칙 체계를 활용하고, 복잡한 비음 및 성조의 모호성을 해결하며, 윤곽 성조를 위한 표준화된 철자 표기법을 도입한 요루바어용 규칙 기반 연결 이음 합성기인 TTSYoruba를 제시한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
단어의 음악: 컴퓨터에게 요루바어 노래를 가르치기
언어를 하나의 노래라고 상상해 보세요. 많은 언어에서 멜로디는 숨겨져 있습니다. 목소리의 높낮이를 바꿀 수는 있지만, 단어의 의미가 변하더라도 적힌 글자는 똑같이 유지됩니다. 하지만 수백만 명이 서아프리카에서 사용하는 언어인 요루바어(Yorùbá)에서는 멜로디가 음표 안에 그대로 적혀 있습니다. 이 언어는 고음, 저음, 그리고 상승 또는 하강하는 음높이인 '성조(tones)'를 사용하여 단어의 의미를 정확하게 전달합니다. 만약 잘못된 음표를 적는다면, 실수로 '사자' 대신 '개'라고 말하게 될 수도 있습니다. 이는 컴퓨터에게 매우 독특한 퍼즐이 됩니다. 보통 우리가 컴퓨터에게 텍스트를 소리 내어 읽도록 요청할 때(텍-투-스피치, 즉 TTS 기술), 기계는 수천 시간의 인간 음성을 듣고 학습한 패턴을 바탕으로 멜로디를 추측해야 합니다. 하지만 멜로디(악보)가 이미 텍스트에 적혀 있는 요루바어와 같은 언어의 경우, 컴퓨터가 추측할 필요가 없습니다. 우리는 그저 컴퓨터가 음표를 완벽하게 읽을 수 있기만 하면 됩니다.
여기서 이야기는 흥미로워집니다. 오랫동안 컴퓨터는 충분한 녹음된 인간의 목소리를 확보하지 못해 요루바어를 자연스럽게 말하는 데 어려움을 겪었습니다. 마치 악보 없이 귀로만 복잡한 노래를 배우려는 음악가처럼, 종종 리듬을 틀리곤 했습니다. 하지만 추측할 필요가 없는 로봇 음악가를 만든다면 어떨까요? 만약 인간이 녹음한 가능한 모든 음표 조합의 라이브러리를 주고, 다음에 어떤 음을 연주할지 알 수 있는 엄격한 규칙을 준다면 어떨까요? 이것이 바로 거대한 온라인 요루바어 성씨 사전의 목소리를 만들고자 했던 연구팀이 해결하고자 했던 과제입니다. 그들은 입력된 이름을 파악하여 정확한 음높이와 리듬을 찾아내고, 세상의 모든 이름을 일일이 사람이 녹음할 필요 없이 즉각적으로 소리 내어 읽을 수 있는 시스템을 구축해야 했습니다.
로봇 합창단과 규칙의 마법
이 논문은 요루바어에 특화되어 설계된 영리한 규칙 기반 로봇 음성인 TTSYoruba를 소개합니다. 이 시스템을 듣고 배우는 뇌라기보다는, 거대한 사전 녹음 클립 상자를 가진 매우 체계적인 사서라고 생각하십시오. 연구진은 인간의 목소리로 다섯 가지 서로 다른 음악적 성조를 가진 모든 자음과 모음의 조합(예: "ba", "de", "go")을 녹음했습니다. 그 결과 651개의 작은 소리 클립 라이브러리를 완성했습니다.
마법은 규칙에서 일어납니다. 사용자가 Adébọ̀wálé와 같은 이름을 입력하면, 컴퓨터는 단순히 클립을 순서대로 재생하는 것이 아닙니다. 그것은 지휘자처럼 행동합니다. 글자 위에 적힌 음표(성조 기호)를 확인하고, 그 앞에 왔던 음을 체크합니다. 요루바어에서는 앞의 음에 따라 음의 높낮이가 변하는 경우가 많습니다. 예를 들어 낮은 음 뒤에 높은 음이 오면, 높은 음은 실제로 위로 '미끄러지듯' 올라가며 상승조처럼 들릴 수 있습니다. 이 시스템에는 특정 규칙이 있습니다. 낮은 음 다음에 높은 음이 오는 것을 발견하면, 표준 '높은' 소리 클립을 특별한 '상승' 소리 클립으로 교체합니다. 하강 성조에 대해서도 마찬가지입니다. 이러한 엄격한 음악적 규칙을 따름으로써, 컴퓨터는 클립들을 엮어 단순한 기계적 클릭 소리가 아닌 흐르는 듯한 문장으로 만들어냅니다.
"N"의 미스터리 해결하기
이 퍼즐에서 가장 까다로운 부분 중 하나는 알파벳 n이었습니다. 요루바어에서 n은 변신술사입니다. 때로는 단어의 시작 부분에서 자음 역할을 합니다(예: nọ́). 때로는 그 자체로 하나의 완전한 음절이 되기도 합니다(예: ń). 그리고 때로는 소리가 전혀 나지 않고, 앞의 모음이 '비음(코를 통한 소리)'임을 알려주는 표식 역할을 하기도 합니다. 컴퓨터에게 이것은 동일한 글자가 섞여 있는 혼란스러운 덩어리로 보입니다.
연구진은 이를 해결하기 위해 "비음 모호성 해소(Nasal Disambiguation)" 시스템을 구축했습니다. 이것은 세 가지 질문을 던지는 탐정과 같습니다:
- n 위에 음악적 음표가 있는가? 그렇다면, 그것은 독립된 음절입니다.
- n이 i나 u와 같은 특정 모음 사이에 위치하는가? 그렇다면, 그것은 비음 표식이며 컴퓨터는 그 앞의 모음 소리를 변경합니다.
- 그것이 그냥 일반적인 자음인가? 그렇다면, 다음 소리의 시작으로 취급합니다.
이 규칙들을 적용함으로써, 시스템은 그렇지 않으면 틀리게 들릴 수 있는 이름들을 정확하게 발음하며, 비음화된 모음과 음절적 n을 구분해 냅니다.
새로운 음악적 표기법: 카론(Carons)과 서컴플렉스(Circumflexes)
여기서 논문은 대담하고 창의적인 움직임을 보여줍니다. 연구진은 한 가지 문제를 발견했습니다. 일부 이름은 단일 모음에 '굴곡 성조(음높이가 오르거나 내리는 것)'를 가지고 있는데, 이를 요루바어에서 전통적으로 표기하는 방식은 모음을 중복해서 쓰는 것입니다(예: Níkẹ̀ẹ́). 이는 많은 원어민에게 생소해 보이고 투박하게 느껴집니다.
연구팀은 컴퓨터 키보드에 이미 존재하지만 표준 요루바어 쓰기에는 사용되지 않았던 기호들을 사용하여 이 소리들을 표기하는 새로운 방법을 제안했습니다. 상승 성조를 위한 카론(체크 표시 모양인 ǎ)과 하강 성조를 위한 서컴플렉스(모자 모양인 â)를 사용하는 것입니다.
이렇게 생각해보세요. 긴 중복 모음 화음을 두 개의 별개 키로 누르는 대신, 특별한 '모자'가 달린 하나의 키를 누르는 것입니다. 컴퓨터는 ǎ가 "상승 소리 클립을 재생하라"는 뜻이고, â가 "하강 소리 클립을 재생하라"는 뜻임을 알게 됩니다. 이를 통해 사람들은 이름의 철자를 바꾸지 않고도 흔히 쓰이는 방식대로 이름을 입력할 수 있으면서도, 완벽한 음악적 음높이를 얻을 수 있습니다. 연구진은 50명의 사람들에게 기존의 "중복 모음" 방식과 새로운 "모자" 방식으로 쓰인 이름을 듣게 하여 테스트했습니다. 결과는 어땠을까요? 청취자들은 두 버전 사이의 차이를 구별하지 못했습니다. 그들은 두 버전 모두 똑같이 자연스럽고 이해하기 쉽다고 평가했습니다. 사실, 일부 청취자들은 새로운 "모자" 버전이 머릿속에 떠오르는 단어의 모습과 더 닮았기 때문에 이 버전을 더 선호하기도 했습니다.
결론: 좋은 시작이지만 완벽하지는 않다
연구팀은 50명의 자원봉사자에게 각각 10개의 서로 다른 이름을 듣게 하여 시스템을 테스트했습니다. 결과는 유망했지만 정직했습니다. 컴퓨터는 이해도(intelligibility) 면에서 매우 높은 점수를 받았는데, 이는 모든 사람이 말하는 단어가 무엇인지 정확히 알 수 있었음을 의미합니다. 그러나 '자연스러움(naturalness)' 점수는 다소 낮았습니다. 청취자들은 이 목소리가 친구와 대화하는 느낌이라기보다, 선생님이 학급에 교과서를 읽어주는 것처럼 약간 느리다고 묘사했습니다. 이는 시스템이 아주 작은 클립들을 이어 붙이기 때문에, 매 음절 사이에 미세하고 부자연스러운 휴지가 발생하기 때문입니다.
논문은 자신들의 시스템이 하지 못하는 부분에 대해서도 매우 명확하게 밝히고 있습니다. 이 시스템은 복잡한 리듬을 가진 긴 문장이나 문단 전체에서 음높이가 떨어지는 방식은 처리하지 못합니다. 이 시스템은 특히 짧은 이름을 위해 설계되었습니다. 또한 사용자가 정확한 성조 기호를 입력해야 한다는 점에 의존합니다. 만약 성조 없이 입력한다면, 로봇은 멜로디를 알 수 없습니다.
궁극적으로 이 논문은 성조가 적혀 있는 언어의 경우, 노래를 배우기 위해 거대한 AI의 뇌가 필요한 것이 아니라, 좋은 규칙을 가진 똑똑한 사서가 필요하다는 것을 보여줍니다. 이 시스템은 규칙 기반 접근 방식이 요루바어의 복잡한 음악성을 다룰 수 있음을 입증하며, 새로운 "모자"와 "체크" 기호는 이름의 철자를 바꾸지 않고도 이 소리들을 표기할 수 있는 실용적이고 키보드 친화적인 방법을 제공합니다. 이는 향후 더 나은 목소리를 만드는 데 도움이 될 수 있는 견고하고 작동 가능한 토대입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.