← Últimos artigos
⚡ electrical engineering

Covo-Audio Technical Report

O artigo apresenta o Covo-Audio, um modelo de linguagem de áudio de 7 bilhões de parâmetros que processa e gera áudio de ponta a ponta, alcançando desempenho de ponta em diversas tarefas de interação vocal e propondo uma estratégia de desacoplamento entre inteligência e síntese de voz para reduzir custos de implantação.

Autores originais: Wenfu Wang, Chenxing Li, Liqiang Zhang, Yiyang Zhao, Yuxiang Zou, Hanzhao Li, Mingyu Cui, Hao Zhang, Kun Wei, Le Xu, Zikang Huang, Jiajun Xu, Jiliang Hu, Xiang He, Zeyu Xie, Jiawen Kang, Youjun Chen
Publicado 2026-03-17
📖 4 min de leitura☕ Leitura rápida

Autores originais: Wenfu Wang, Chenxing Li, Liqiang Zhang, Yiyang Zhao, Yuxiang Zou, Hanzhao Li, Mingyu Cui, Hao Zhang, Kun Wei, Le Xu, Zikang Huang, Jiajun Xu, Jiliang Hu, Xiang He, Zeyu Xie, Jiawen Kang, Youjun Chen, Meng Yu, Dong Yu, Rilin Chen, Linlin Di, Shulin Feng, Na Hu, Yang Liu, Bang Wang, Shan Yang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um assistente pessoal que não apenas entende o que você diz, mas também ouve o tom da sua voz, sente suas emoções e responde na hora, sem aquele atraso chato de "espera, vou processar isso". É isso que o Covo-Audio faz.

Este relatório técnico da Tencent descreve a criação de um "cérebro" digital de 7 bilhões de parâmetros (um tamanho que o torna ágil e eficiente) capaz de conversar diretamente com você em áudio, do início ao fim, sem precisar de tradutores ou intermediários.

Aqui está uma explicação simples, usando analogias do dia a dia:

1. O Problema: A "Fábrica de Encomendas" vs. O "Mestre de Cerimônias"

Antes do Covo-Audio, os sistemas de voz funcionavam como uma linha de montagem de fábrica:

  • Você falava \rightarrow Um robô escrevia o que você disse (ASR) \rightarrow Um cérebro de texto pensava na resposta (LLM) \rightarrow Outro robô transformava o texto em voz (TTS).
  • O problema: Nessa linha de montagem, informações se perdem (como um sussurro de emoção) e erros se acumulam. É como passar uma mensagem de "telefone sem fio" por três pessoas antes de chegar ao destino.

O Covo-Audio é diferente. Ele é como um Mestre de Cerimônias nato. Ele ouve você, entende o que você diz, sente como você está se sentindo e responde, tudo isso em um único instante, sem passar a mensagem por várias pessoas. Ele processa o som diretamente, como um humano faria.

2. A Grande Inovação: "Desacoplar a Voz da Inteligência"

Um dos maiores desafios de criar assistentes de voz é que, para ter uma voz bonita e natural, você precisava de horas de gravações de pessoas reais conversando, o que é caro e difícil.

O Covo-Audio usa uma técnica genial chamada Desacoplamento Inteligência-Voz.

  • A Analogia: Imagine que a "Inteligência" é o ator (que sabe o que dizer, como agir e pensar) e a "Voz" é o figurino (a roupa que ele usa).
  • Antigamente, para mudar o figurino, você precisava contratar um novo ator e ensiná-lo tudo de novo do zero.
  • Com o Covo-Audio, você pode pegar o mesmo ator genial (a inteligência treinada) e vesti-lo com figurinos diferentes (vozes de TTS sintéticas) sem perder a capacidade de atuação. Isso permite criar assistentes com vozes personalizadas e baratas, sem precisar de milhões de horas de gravação de conversas reais.

3. Conversando de Verdade: O "Full-Duplex" (Meia-Duplex vs. Duplex)

A maioria dos assistentes hoje funciona em meia-duplex: é como um "Walkie-Talkie". Você fala, aperta o botão, espera ele terminar de falar, e só então você pode responder. Se você tentar falar enquanto ele está falando, ele te ignora ou corta sua voz.

O Covo-Audio-Chat-FD (a versão Full-Duplex) funciona como uma conversa real no elevador:

  • Ele pode ouvir e falar ao mesmo tempo.
  • Se você interromper o assistente para dizer "Ei, espera!", ele entende, para de falar e ouve você.
  • Se você fizer uma pausa curta para pensar, ele sabe esperar, não acha que você acabou de falar.
  • Ele até consegue fazer aquele som de "hum-hum" ou "entendi" enquanto você está falando (backchanneling), mostrando que está prestando atenção.

4. O Que Ele Sabe Fazer?

O Covo-Audio foi treinado para ser um polímata (alguém que sabe de tudo um pouco):

  • Entendimento de Áudio: Ele não só entende palavras, mas também sabe se você está bravo, triste ou feliz, e até consegue identificar se a voz é de um homem ou mulher, ou quantas pessoas estão falando.
  • Raciocínio: Ele consegue resolver problemas complexos e contar histórias, não apenas repetir o que ouve.
  • Empatia: Ele foi treinado para responder de forma compassiva. Se você estiver triste, ele não dá uma resposta robótica; ele tenta confortar você.

5. Por que isso é importante?

Até agora, os modelos que faziam tudo isso (entender, raciocinar e falar) eram gigantes e pesados, difíceis de colocar em celulares ou dispositivos baratos. O Covo-Audio prova que é possível ter um modelo pequeno (7B), rápido e eficiente, que faz tudo isso com qualidade de nível profissional.

Em resumo: O Covo-Audio é como dar um "corpo" e uma "voz" instantânea a um cérebro de IA, permitindo que ele converse com você de forma natural, interrompível e empática, sem precisar de uma fábrica inteira por trás para processar cada palavra. E o melhor: eles liberaram o código para que todos possam usar e criar seus próprios assistentes.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →