← Últimos artigos
💬 NLP

FreyaTTS Technical Report

O Freya-TTS é um modelo de texto para fala compacto, livre de tokenizadores e prioritariamente em turco, que utiliza um Transformer de Difusão de correspondência de fluxo condicional não autorregressivo em um espaço latente contínuo para alcançar uma síntese conversacional de alta qualidade e em tempo real com eficiência e precisão superiores em comparação com sistemas de código aberto maiores.

Autores originais: Ahmet Erdem Pamuk, Ömer Yentür, Ahmet Tunga Bayrak, Yavuz Alp Sencer Öztürk, Mustafa Yavuz

Publicado 2026-07-13
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Ahmet Erdem Pamuk, Ömer Yentür, Ahmet Tunga Bayrak, Yavuz Alp Sencer Öztürk, Mustafa Yavuz

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você quer construir um robô que fale turco. A maioria das pessoas tenta construir esse robô ensinando-lhe um dicionário massivo de sons, decompondo cada palavra em pequenas peças pré-definidas (como blocos de Lego) e depois empilhando esses blocos um a um, da esquerda para a direita. É assim que muitos robôs de fala "estado da arte" atuais funcionam. Eles são enormes, levam uma eternidade para serem construídos e, se tropeçarem em uma frase longa, muitas vezes tropeçam nos próprios pés, confundindo números ou errando a ordem.

A equipe do FreyaTTS decidiu tentar uma abordagem completamente diferente, muito menor e mais inteligente. Eles não construíram um dicionário gigante ou um empilhador de blocos um por um. Em vez disso, construíram um "motor de imaginação" de 183,2 milhões de parâmetros que aprende a falar turco ouvindo áudio e adivinhando a frase inteira de uma vez, como um músico de jazz improvisando um solo completo em vez de ler uma partitura nota por nota.

Aqui está como o truque de mágica deles funciona, dividido em três partes simples:

1. O Projeto Congelado (O "AudioVAE2")

Pense na equipe do FreyaTTS como arquitetos que encontraram uma casa perfeita, pré-construída (chamada AudioVAE2), que já sabe transformar um esboço em uma bela onda sonora de 48 kHz. Esta casa é tão boa que a equipe decidiu nunca tocá-la. Eles a congelaram no lugar.

Como não precisaram perder tempo ensinando ao robô como fazer ondas sonoras, puderam usar 100% de sua capacidade cerebral para ensinar ao robô o que dizer. Eles não precisaram de um tradutor (um fonetizador) para transformar letras em sons, e não precisaram decompor palavras em pequenos tokens de som. Eles apenas alimentaram o robô com texto bruto em turco (92 símbolos, incluindo letras especiais como ç, ğ, ı, ö, ş, ü) e deixaram que ele descobrisse a pronúncia por conta própria. É como ensinar uma criança a falar conversando com ela, em vez de dar um livro didático de fonética.

2. A Magia de "Tudo de uma Vez" (Não Autoregressiva)

A maioria dos robôs de fala é como um digitador lento: ele digita uma letra, depois a próxima, depois a próxima. Se cometer um erro no início, a frase inteira fica distorcida. Isso é chamado de geração "autoregressiva".

O FreyaTTS é diferente. É como um pintor que vê toda a tela e pinta o quadro inteiro de uma só vez. Ele utiliza um Transformer de Difusão de correspondência de fluxo condicional para prever o padrão sonoro de toda a frase em paralelo.

  • A Analogia: Imagine que você está tentando adivinhar a voz de um amigo. Em vez de adivinhar uma palavra de cada vez (o que poderia levar você a adivinhar a palavra errada e arruinar a frase), o FreyaTTS adivinha o ritmo e o tom de toda a frase de uma só vez.
  • O Resultado: Ele evita a "acumulação de erros da esquerda para a direita". Se você pedir para ele dizer uma lista longa de números, ele não ficará confuso no meio do caminho. Ele prevê toda a duração e todo o padrão sonoro simultaneamente.

3. O "Bloqueio de Voz" (Para manter a consistência)

Quando treinaram este robô do zero, ele era um pouco camaleônico. Cada vez que você pedia para dizer "Olá", parecia uma pessoa diferente. Uma vez podia soar como um homem de voz grave, na próxima como uma criança de voz aguda. Isso acontecia porque o robô estava aprendendo com uma mistura de muitas vozes e não tinha uma identidade específica.

Para corrigir isso, a equipe realizou um "bloqueio de voz" em duas etapas:

  1. Estágio 1: Eles ensinaram o robô a imitar uma pessoa específica (um único talento de voz profissional). Isso colapsou a variação de tom do robô de um intervalo selvagem de 74,9 Hz para um constante 5,0 Hz. Agora, soa como a mesma pessoa todas as vezes.
  2. Estágio 2: Eles perceberam que o robô era ruim com frases curtas (como "Sim" ou "Não"). Então, deram a ele prática extra especificamente em frases de uma ou duas palavras.

Os Resultados: Pequeno, mas Poderoso

A equipe testou seu robô contra outros modelos de fala de código aberto famosos. Aqui está o que descobriram:

  • Tamanho: O FreyaTTS é minúsculo (183,2M de parâmetros) comparado a gigantes como o XTTS-v2 (470M) ou o F5-TTS (336M).
  • Precisão: Em um teste de 495 frases em turco, o FreyaTTS cometeu menos erros do que os modelos maiores. Ele alcançou uma Taxa de Erro de Palavra (WER) de 8,0% e uma Taxa de Erro de Caractere (CER) de 3,0%.
    • Nota: Os modelos maiores obtiveram 11,1% e 24,3%, respectivamente.
  • Velocidade: Como não precisa esperar uma palavra terminar antes de começar a próxima, ele é incrivelmente rápido. Em uma placa gráfica de consumo padrão, ele roda com um fator de tempo real de 0,11. Isso significa que pode gerar 10 segundos de áudio em apenas 1,1 segundo.
  • Potência de Laptop: É tão eficiente que pode rodar mais rápido que o tempo real em uma CPU de laptop (como um Apple M3), tornando-o perfeito para telefones ou dispositivos pequenos.

O Que Eles Dizem Explicitamente Que NÃO É

O artigo é muito claro sobre o que o FreyaTTS não é:

  • Não é um clonador "zero-shot" que pode imitar qualquer voz que você lhe dê através de um clipe. É um modelo de voz única. Você recebe a voz única para a qual ele foi treinado, e pronto.
  • Não é construído sobre uma base multilíngue massiva que tenta falar 50 idiomas ao mesmo tempo. É um modelo focado no turco, especializado para um único idioma.
  • Não utiliza um "fonetizador" (um sistema baseado em regras para converter letras em sons). Ele aprende os sons diretamente do áudio.
  • Não é perfeito ao ler números em sua forma escrita (como "1999"). O artigo observa que você ainda precisa expandir os números para sua forma falada (como "mil novecentos e noventa e nove") antes de alimentá-los ao modelo, porque o robô às vezes tem dificuldade com a duração de sequências longas de dígitos.

O Quão Certo Eles Estão?

A equipe está muito confiante nesses números porque eles não apenas adivinharam; eles mediram tudo.

  • Eles construíram um benchmark específico chamado Freya-TR-Eval com 495 frases.
  • Eles realizaram os testes 10.000 vezes usando um método de "bootstrap" para garantir que os resultados não fossem apenas sorte.
  • Eles compararam seu modelo contra as mesmas frases usando exatamente as mesmas regras de pontuação (reduzindo tudo para 8 kHz para que o campo de jogo fosse nivelado).
  • Eles até mediram a estabilidade do "bloqueio de voz", mostrando que a variação de tom caiu de 74,9 Hz para 5,0 Hz após as etapas de treinamento.

Em resumo, o FreyaTTS prova que você não precisa de um monstro bilionário e multilíngue para criar uma fala excelente em turco. Você pode construir um motor pequeno, especializado, que funciona em um laptop, soa consistente e fala turco melhor do que os gigantes.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →