← Últimos artigos
🤖 machine learning

ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis

O artigo apresenta o ParsVoice, um corpus de fala persa multivoz de 2.200 horas, disponível publicamente e construído por meio de um pipeline escalável a partir de audiolivros, que expande significativamente os recursos de TTS em persa de código aberto e demonstra desempenho de síntese de alta qualidade quando utilizado para ajustar finamente o modelo XTTS.

Autores originais: Mohammad Javad Ranjbar Kalahroodi, Heshaam Faili, Azadeh Shakery

Publicado 2026-05-27
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Mohammad Javad Ranjbar Kalahroodi, Heshaam Faili, Azadeh Shakery

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você quer ensinar um robô a falar persa. Você não pode apenas dar a ele um dicionário; precisa alimentá-lo com milhares de horas de vozes humanas reais lendo histórias, para que ele possa aprender o ritmo, a emoção e os sons únicos da língua.

Durante muito tempo, a língua persa foi como um convidado em uma festa enorme a quem não foi dada uma cadeira à mesa. Enquanto línguas como o inglês possuem enormes bibliotecas de fala gravada (pense nelas como armazéns massivos e bem organizados), o persa tinha muito pouco. Isso dificultava a criação de assistentes de voz ou robôs de contação de histórias bons para falantes de persa.

A Solução: ParsVoice
Os autores deste artigo construíram o ParsVoice, que é essencialmente uma biblioteca massiva e de alta qualidade de fala persa. É a maior coleção pública do seu tipo já feita para esta língua.

Veja como eles fizeram isso, dividido em etapas simples:

1. A Matéria-Prima: Audiolivros

Em vez de contratar atores para ler roteiros em um estúdio (o que é caro e lento), a equipe foi a uma biblioteca pública de audiolivros chamada IranSeda. Pense nisso como encontrar uma montanha de rolos de filme crus e sem cortes. Eles tinham mais de 3.800 livros, mas havia um problema: não possuíam os roteiros escritos (transcrições) que correspondiam perfeitamente ao áudio.

2. O Pipeline "Cortador Inteligente"

Você não pode simplesmente pegar um arquivo de audiolivro de 10 horas e alimentá-lo em um robô; ele precisa ser cortado em frases minúsculas e perfeitas. A equipe construiu uma "linha de fábrica" automatizada para fazer isso:

  • O Corte Bruto: Eles usaram um programa de computador para encontrar o silêncio entre as frases e cortar o áudio ali.
  • A Verificação "Você Terminou?": Às vezes, o computador corta o áudio no meio de uma frase (como parar um filme logo antes do herói dizer "Eu te amo"). Eles usaram uma IA inteligente (baseada em um modelo chamado ParsBERT) para ler o texto e perguntar: "Isso é um pensamento completo?". Se a resposta fosse "Não", o sistema estendia automaticamente o corte por uma fração de segundo e verificava novamente até que a frase estivesse inteira.
  • O Passo "Retire a Gordura": Mesmo após o corte, pode haver um pouquinho de silêncio ou uma tosse no início ou no final de um clipe. O sistema usou uma "busca binária" (uma maneira inteligente de chutar e verificar) para cortar exatamente a quantidade certa de silêncio para que a voz começasse e parasse limpa, sem cortar nenhuma palavra.
  • O Inspetor de Qualidade: Nem todos os audiolivros são gravados em um estúdio à prova de som. Alguns podem ter música de fundo ou microfones ruins. O sistema atuou como um editor rigoroso, pontuando cada clipe em clareza de áudio e precisão do texto. Se um clipe fosse muito ruidoso ou o texto fosse sem sentido, ele era descartado.
  • O Detetive de Voz: Como um audiolivro pode ter múltiplos narradores, o sistema usou uma ferramenta de "impressão digital de voz" para agrupar todos os clipes por quem estava falando. Isso permitiu identificar 1.815 falantes diferentes automaticamente.

3. O Resultado

O produto final é uma biblioteca de 2.200 horas de frases persas limpas e perfeitamente cortadas.

  • É 25 vezes maior que a maior coleção de fala persa anterior.
  • Contém 1,36 milhão de clipes individuais de frases.
  • Abrange 1.815 vozes diferentes.

4. Funcionou?

Para testar se essa biblioteca era realmente útil, a equipe ensinou um modelo moderno de voz de IA (chamado XTTS) usando apenas esses novos dados. Eles não ensinaram primeiro os sons das letras persas (fonemas); deixaram que ele aprendesse diretamente a partir do texto e do áudio.

Os resultados foram impressionantes:

  • Naturalidade: Humanos avaliaram a voz do robô como muito natural (3,6 de 5).
  • Correspondência de Voz: Quando pediram ao robô para imitar uma voz nova que ele nunca tinha ouvido antes, ele fez um ótimo trabalho (4,0 de 5).
  • Inteligibilidade: O robô falava com clareza suficiente para que outros programas de computador o compreendessem perfeitamente.

O que ele Não Faz (As Limitações)

Os autores são honestos sobre o que esta biblioteca não é:

  • Não é para conversar: Como os dados vêm de audiolivros, as vozes soam como se estivessem lendo uma história (formal e constante). Se você pedir ao robô para ter uma conversa casual e dinâmica como dois amigos em uma cafeteria, ele pode soar um pouco rígido.
  • Não é perfeito: Como tiveram que usar um computador para adivinhar o texto (porque não tinham os livros originais), há alguns pequenos erros no texto, embora tenham filtrado a maioria deles.
  • Equilíbrio de Gênero: A biblioteca tem mais vozes masculinas do que femininas, simplesmente porque os audiolivros que usaram tinham mais narradores homens.

Em Resumo:
A equipe construiu uma fábrica gigante e automatizada que transformou milhares de horas de audiolivros persas crus em um conjunto de dados limpo, organizado e massivo. Este conjunto de dados agora está disponível para qualquer pessoa usar para construir melhores tecnologias de voz em persa, dando finalmente à língua uma cadeira à mesa da pesquisa de fala de alta tecnologia.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →