← 최신 논문
⚡ electrical engineering

Integrating Human Linguistic Insights into AI: Theory-Driven Representation for Multilingual Text-to-Speech

이 논문은 이론 기반의 음운론적 표상인 자연적 미지정 어휘집(Featurally Underspecified Lexicon, FUL)을 수정된 FastSpeech 구조에 통합하는 것이 제한된 학습 데이터 환경에서도 모국어, 비모국어 및 코드 혼용 음성을 위한 확장 가능하고 해석 가능하며 고품질의 다국어 텍스트 음성 합성(TTS)을 가능하게 함을 입증한다.

원저자: Cong Zhang, Huinan Zeng, Huang Liu, Jiewen Zheng

게시일 2026-08-07
📖 4 분 읽기☕ 가벼운 읽기

원저자: Cong Zhang, Huinan Zeng, Huang Liu, Jiewen Zheng

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 지구상의 모든 언어를 말하는 법을 가르치려 한다고 상상해 보세요. 현재 가장 대중적인 방법은 거대하고 배고픈 괴물에게 수백만 시간의 인간 대화를 먹이는 것과 같습니다. 로봇은 그 데이터를 먹어 치우고, 소리를 암기하며, 결국 말을 배우게 됩니다. 영어 나 중국어처럼 화자가 많은 언어에는 놀라운 효과를 발휘하지만, 규모가 작은 언어들에게는 큰 문제입니다. 로봇이 먹을 수 있는 녹음 데이터가 충분하지 않기 때문입니다. 그리고 모든 언어마다 별도의 "괴물"을 만드는 것은 비용이 많이 들고 낭비적입니다.

하지만 인간은 다릅니다. 우리는 새로운 소리를 배우기 위해 수백만 시간이 필요하지 않습니다. 우리는 그저 기본적인 구성 요소를 이해하기만 하면 됩니다. 언어학자들은 수십 년 동안 이 구성 요소들을 연구해 왔으며, 이를 "음운론적 특징(phonological features)"이라고 부릅니다. 이것들을 특정 글자나 소리가 아니라, 소리를 정의하는 아주 작은 스위치라고 생각해보세요. 이 소리는 입술로 만들어지는가? (이것은 '순음' 스위치입니다). 공기가 자유롭게 흐르는가, 아니면 막혀 있는가? (이것은 '자음' 스위치입니다). 성대가 떨리고 있는가? (이것은 '유성음' 스위치입니다). 인간은 "cat"이라는 단어를 하나의 거대하고 깨뜨릴 수 없는 덩어리로 암기하는 대신, 입술, 공기 차단, 진동, 혀의 높이 등과 같은 이러한 스위치들로 분해합니다. 이 논문은 단순하고 대담한 질문을 던집니다. 만약 우리가 로봇에게 전체 단어나 소리가 아니라, 이 작은 스위치들을 사용하여 말하도록 가르친다면 어떻게 될까요? 로봇이 한 번도 들어본 적 없는 언어의 규칙만을 이해함으로써 그 언어를 말할 수 있게 될까요?

이 연구를 진행한 연구진은 이 아이디어를 테스트하기 위해 "특징적 미결정 어휘집(Featurally Underspecified Lexicon, FUL)"이라는 특정 스위치 세트를 사용하기로 했습니다. 그들은 영어, 중국어, 심지어 이 둘을 섞어서 말할 수 있는 음성 로봇을 매우 적은 데이터로 구축할 수 있는지 확인하고 싶었습니다. 그들은 세상에서 가장 크고 완벽한 로봇을 만들려고 노력한 것이 아니라, 이 "스위치 기반" 접근 방식이 실제로 작동할 수 있는지 확인하기 위한 개념 증명(proof-of-concept)을 구축했습니다.

그들이 수행한 작업과 발견한 결과는 다음과 같습니다. 그들은 표준 음성 로봇(FastSpeech라는 아키텍처 기반)을 가져와서, 기존의 입력 방식인 "p", "b", "t"와 같은 특정 소리 목록을 이 FUL 스위치 목록으로 교체했습니다. 그들은 로봇에게 표준 음성 기호들을 이 20개의 보편적인 스위치들로 변환하도록 가르쳤습니다. 그런 다음 두 가지 실험을 진행했습니다.

첫 번째 실험에서, 그들은 로봇에게 아주 적은 양의 데이터, 즉 2.62시간의 영어와 0.5~8시간 사이의 중국어 데이터를 주었습니다. 그리고 영어 화자는 중국어를 들어본 적이 없고, 중국어 화자는 영어를 들어본 적이 없음에도 불구하고 로봇에게 두 언어를 모두 말하게 했습니다. 결과는 엇갈렸지만 명확한 경향성을 보였습니다. 로봇에게 8시간의 중국어 데이터가 주어졌을 때, 로봇은 이해 가능한 수준의 중국어 음성을 생성할 수 있었습니다. 더욱 흥ло로운 점은, 영어를 사용하는 화자가 한 번도 학습하지 않은 언어인 중국어를 말하려고 할 때, 로봇이 비록 억양이 섞인 것처럼 들리기는 했지만 어느 정도 이해 가능한 소리를 낼 수 있었다는 것입니다. 로봇이 마법처럼 유창해진 것은 아니었지만, 이는 스위치가 한 번도 들어본 적 없는 소리에 대해 추측할 수 있게 해준다는 것을 보여주었습니다. 영어 화자가 중국어를 말할 때 로봇은 약간의 억양을 가진 듯한 소리를 낼 수 있었습니다. 로봇이 마법처럼 유창해진 것은 아니었지만, 이는 스위치가 한 번도 들어본 적 없는 소리에 대해 추측할 수 있게 해준다는 것을 보여주었습니다.

두 번째 실험에서, 그들은 로봇에게 훨씬 더 많은 양의 식사, 즉 영어와 중국어를 모두 포함한 12명의 화자로부터 얻은 100시간의 데이터를 주었습니다. 이번에는 결과가 훨씬 강력했습니다. 로봇은 두 언어 모두 높은 명료도로 말할 수 있었습니다. 심지어 중국어 학습 데이터가 전혀 없었던 중국어 화자조차도 충분히 이해될 정도로 영어를 잘 말할 수 있었습니다. 영어 화자 또한 이전보다 훨씬 더 나은 명료도로 중국어를 말할 수 있었습니다. 로봇은 단순히 흉내를 내는 것이 아니라, 공유된 스위치를 사용하여 새로운 소리를 만드는 방법을 터득하고 있었습니다. 예를 들어, 영어 로봇이 한 번도 들어본 적 없는 특정 중국어 소리를 내려 할 때, 로봇은 다른 소리들로부터 배운 "스위치"들을 사용하여 그 소리와 유사한 버전을 구성해 냄으로써 이해 가능한 수준의 소리를 만들어냈습니다.

하지만 이 논문은 이것이 무엇을 의미하지 않는지에 대해서도 주의 깊게 지적합니다. 로봇이 완벽한 인간 화자가 된 것은 아닙니다. 로봇은 언어의 "음악성", 특히 중국어의 성조(tone) 부분에서 어려움을 겪었습니다. 로봇이 성조(높낮이 변화)를 위한 스위치를 사용하도록 배우지 않았기 때문에, 영어 화자가 중국어를 말할 때 평탄하고 중립적인 톤으로 말하는 것처럼 들렸고, 이로 인해 일부 단어를 이해하기 어렵게 만들었습니다. 연구진은 스위치가 개별 소리(자음과 모음)에는 잘 작동하지만, 언어의 음악적인 부분에 대한 스위치를 어떻게 추가할 것인지 여전히 해결해야 할 과제가 남아 있다고 제안합니다.

그래서, 이 연구의 핵심적인 결론은 무엇일까요? 이 연구는 보편적인 언어적 스위치를 사용하는 것이 로봇에게 여러 언어를 가르치는 데 있어 실행 가능하고 데이터 효율적인 방법임을 시사합니다. 이는 로봇이 새로운 언어를 배우기 위해 수백만 시간의 데이터가 필요한 것이 아니라, 단지 게임의 규칙을 배우면 된다는 것을 증명합니다. 아직 완벽한 해결책은 아니지만(특히 성조와 같은 음악적 부분에 있어서), 이는 음성 기술이 방대한 양의 오디오를 수십 년간 녹음할 필요 없이 소규모 저자원 언어를 위해 구축될 수 있는 미래의 문을 열어줍니다. 이는 로봇이 단순히 역사를 암기하는 것이 아니라, 그 언어의 DNA를 이해함으로써 새로운 언어를 배울 수 있는 세상을 향한 한 걸음입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →