← 최신 논문
🤖 machine learning

ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis

본 논문은 오디오북에서 확장 가능한 파이프라인을 통해 구축된 공개 2,200 시간 분량의 다화자 페르시아어 음성 말뭉치인 ParsVoice 를 소개하며, 이는 개방형 페르시아어 TTS 자원을 크게 확장하고 XTTS 모델을 미세 조정할 때 고품질 합성 성능을 입증합니다.

원저자: Mohammad Javad Ranjbar Kalahroodi, Heshaam Faili, Azadeh Shakery

게시일 2026-05-27
📖 4 분 읽기☕ 가벼운 읽기

원저자: Mohammad Javad Ranjbar Kalahroodi, Heshaam Faili, Azadeh Shakery

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 페르시아어를 가르치고 싶다고 상상해 보세요. 단순히 사전만 주면 안 됩니다. 언어의 리듬, 감정, 그리고 독특한 소리를 학습할 수 있도록 실제 인간이 이야기를 읽어주는 수천 시간 분량의 목소리를 공급해 주어야 합니다.

오랫동안 페르시아어는 거대한 파티에 초대받았으나 식탁에 앉을 자리를 주지 못한 손님처럼 여겨졌습니다. 영어와 같은 언어들은 녹음된 음성의 방대한 도서관 (거대하고 잘 정리된 창고라고 생각하세요) 을 보유하고 있는 반면, 페르시아어는 매우 적은 양만을 가지고 있었습니다. 이로 인해 페르시아어 사용자를 위한 음성 비서나 이야기 로봇을 만드는 것이 어려웠습니다.

해결책: ParsVoice
이 논문의 저자들은 ParsVoice를 개발했는데, 이는 본질적으로 페르시아어 음성의 거대하고 고품질 도서관입니다. 이는 이 언어를 위해 만들어진史上 최대 규모의 공개 음성 컬렉션입니다.

그들이 어떻게 이를 달성했는지 간단한 단계로 나누어 설명합니다:

1. 원재료: 오디오북

스튜디오에서 배우들을 고용해 대본을 읽게 하는 것 (비싸고 느린 방법) 대신, 팀은 IranSeda라는 오디오북 공공 도서관으로 향했습니다. 이는 가공되지 않은 필름 릴의 산을 발견한 것과 같습니다. 그들은 3,800 권 이상의 책을 보유하고 있었지만, 한 가지 걸림돌이 있었습니다: 오디오와 완벽하게 일치하는 대본 (전사본) 이 없었습니다.

2. "스마트 커터" 파이프라인

10 시간 분량의 오디오북 파일을 로봇에 바로 공급할 수는 없습니다. 작은 완벽한 문장들로 잘게 잘라야 합니다. 팀은 이를 수행하기 위한 자동화된 "공장 라인"을 구축했습니다:

  • 대략적인 컷 (Rough Cut): 컴퓨터 프로그램을 사용하여 문장 사이의 침묵을 찾아 그 지점에서 오디오를 잘라냈습니다.
  • "끝났나요?" 확인: 때로는 컴퓨터가 문장 중간에 오디오를 자르기도 합니다 (영웅이 "사랑해"라고 말하기 직전에 영화를 멈추는 것처럼). 그들은 텍스트를 읽고 "이것은 완전한 생각인가?"라고 묻는 스마트 AI(ParsBERT 모델 기반) 를 사용했습니다. 답이 "아니오"라면 시스템은 자동으로 컷을 몇 분의 1 초 연장한 후 문장이 완성될 때까지 다시 확인했습니다.
  • "불필요한 부분 제거" 단계: 잘라낸 후에도 클립의 시작이나 끝에 아주 작은 침묵이나 기침 소리가 남아 있을 수 있습니다. 시스템은 "이진 탐색 (binary search)" (추측과 확인을 반복하는 영리한 방법) 을 사용하여 목소리가 깔끔하게 시작하고 멈추도록 침묵을 정확히 잘라냈습니다.
  • 품질 검사관: 모든 오디오북이 방음 스튜디오에서 녹음된 것은 아닙니다. 일부는 배경 음악이 있거나 마이크가 불량할 수 있습니다. 시스템은 엄격한 편집자처럼 행동하여 오디오 명료도와 텍스트 정확도를 기준으로 모든 클립에 점수를 매겼습니다. 클립이 너무 시끄럽거나 텍스트가 터무니없다면 폐기되었습니다.
  • 목소리 탐정: 하나의 오디오북에 여러 내레이터가 있을 수 있으므로, 시스템은 "목소리 지문" 도구를 사용하여 누가 말하는지에 따라 모든 클립을 그룹화했습니다. 이를 통해 1,815 명의 다른 화자를 자동으로 식별할 수 있었습니다.

3. 결과

최종 제품은 깔끔하고 완벽하게 잘린 페르시아어 문장의 2,200 시간 분량 도서관입니다.

  • 이전 최대 페르시아어 음성 컬렉션보다 25 배 더 큽니다.
  • 136 만 개의 개별 문장 클립을 포함합니다.
  • 1,815 개의 서로 다른 목소리를 포괄합니다.

4. 효과가 있었나요?

이 도서관이 실제로 유용한지 테스트하기 위해 팀은 이 새로운 데이터만을 사용하여 현대적인 AI 음성 모델 (XTTS 라고 함) 을 훈련시켰습니다. 그들은 먼저 페르시아어 글자의 소리 (음소) 를 가르치지 않고 텍스트와 오디오에서 직접 학습하도록 했습니다.

결과는 인상적이었습니다:

  • 자연스러움: 인간들은 로봇의 목소리가 매우 자연스럽다고 평가했습니다 (5 점 만점에 3.6 점).
  • 목소리 모방: 로봇이 이전에 들어본 적 없는 새로운 목소리를 모방하도록 요청했을 때, 매우 잘 수행했습니다 (5 점 만점에 4.0 점).
  • 명료성: 로봇은 다른 컴퓨터 프로그램이 완벽하게 이해할 수 있을 정도로 명확하게 말했습니다.

이것이 하지 않는 것 (한계점)

저자들은 이 도서관이 무엇이 아닌지에 대해 솔직합니다:

  • 대화를 위한 것이 아님: 데이터가 오디오북에서 왔기 때문에, 목소리는 이야기를 읽는 것처럼 들립니다 (격식 있고 일정함). 만약 로봇에게 커피숍에서 두 친구처럼 캐주얼하고 빠른 속도로 대화하라고 요청한다면, 다소 딱딱하게 들릴 수 있습니다.
  • 완벽하지 않음: 원래 책이 없었기 때문에 컴퓨터가 텍스트를 추측해야 했으므로 텍스트에 아주 작은 실수가 몇 가지 있지만, 대부분은 필터링되었습니다.
  • 성별 균형: 도서관에는 여성 목소리보다 남성 목소리가 더 많습니다. 단순히 사용한 오디오북에 남성 내레이터가 더 많았기 때문입니다.

요약하자면:
팀은 수천 시간 분량의 원시 페르시아어 오디오북을 깔끔하고 조직화되며 거대한 데이터셋으로 변환하는 거대하고 자동화된 공장을 구축했습니다. 이 데이터셋은 이제 누구나 더 나은 페르시아어 음성 기술을 구축하는 데 사용할 수 있으며, 마침내 이 언어가 첨단 음성 연구의 식탁에 앉을 수 있게 되었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →