← Últimos artigos
💬 NLP

VibeVoice-ASR-BitNet Technical Report

O VibeVoice-ASR-BitNet é um modelo de ASR comprimido e em tempo real otimizado para CPUs de borda por meio de quantização heterogênea (INT8 para o VAE e pesos ternários no estilo BitNet para o modelo de linguagem) e kernels SIMD customizados, alcançando uma inferência de 1,6 a 2,3 vezes mais rápida que o Whisper.cpp com perda mínima de precisão.

Autores originais: Songchen Xu, Ting Song, Shaohan Huang, Zhiliang Peng, Yan Xia, Yujie Tu, Xin Huang, Xun Wu, Wenhui Wang, Yaoyao Chang, Jianwei Yu, Li Dong, Furu Wei

Publicado 2026-07-28
📖 3 min de leitura☕ Leitura rápida

Autores originais: Songchen Xu, Ting Song, Shaohan Huang, Zhiliang Peng, Yan Xia, Yujie Tu, Xin Huang, Xun Wu, Wenhui Wang, Yaoyao Chang, Jianwei Yu, Li Dong, Furu Wei

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando encaixar uma biblioteca massiva e de alta definição dentro de uma mochila minúscula. Normalmente, se você quiser que os livros sejam legíveis e precisos, eles precisam ser grossos e pesados. Se você tentar encolhê-los demais, as páginas se transformam em rabiscos borrados, ou a mochila fica tão pesada que você não consegue carregá-la de jeito nenhum. Este é o dilema diário dos computadores tentando entender a fala humana. Durante anos, os melhores sistemas de "fala para texto" eram como bibliotecas gigantes e pesadas que só podiam viver em enormes e caros centros de dados (a nuvem). Eles eram incrivelmente inteligentes, mas exigiam um supercomputador para rodar, o que significava que sua voz precisava viajar pela internet para ser processada. Isso gerava preocupações com a privacidade e causava atrasos irritantes. Por outro lado, os sistemas pequenos e rápidos que podiam rodar no seu celular ou notebook eram frequentemente como o caderno de desenhos de uma criança: rápidos de folhear, mas não conseguiam entender frases complexas ou muitos idiomas diferentes. A grande questão para os cientistas tem sido: Podemos construir um sistema que seja tão inteligente quanto a biblioteca gigante, mas leve o suficiente para caber em uma mochila e rodar instantaneamente em um chip de computador comum?

Este artigo apresenta uma nova solução chamada VibeVoice-ASR-BitNet, que atua como um mestre organizador para essa biblioteca de fala. Os pesquisadores descobriram que nem todas as partes de um sistema de reconhecimento de fala são pesadas da mesma forma. Algumas partes são como os "ouvidos" que escutam as ondas sonoras, e outras são como o "cérebro" que entende o que aqueles sons significam. Em vez de usar uma única caixa de tamanho para tudo, eles usaram uma estratégia "heterogênea" inteligente — misturando dois tipos diferentes de compressão. Para os "ouvidos" (a parte que processa o áudio bruto), eles usaram uma compressão INT8 de pipeline completo, que é como imprimir as páginas em um papel ligeiramente mais fino, mas mantendo a tinta nítida. Para o "cérebro" (a parte que prevê a próxima palavra), eles usaram uma compressão estilo BitNet ternária ainda mais agressiva, encolhendo os pesos para apenas três valores possíveis: -1, 0 e +1. Pense nisso como substituir parágrafos complexos por um código simples de setas, pontos e traços.

Ao combinar esses dois métodos, a equipe conseguiu encolher o modelo inteiro de um volumoso 4,62 GB para um esbelto 1,58 GB — uma redução de 2,9x no tamanho. O resultado é um sistema que pode rodar em um processador de computador padrão (CPU) sem precisar de uma placa de vídeo poderosa. Em seus testes, este modelo comprimido conseguiu ouvir um clipe de fala de 20 segundos e digitá-lo mais rápido do que o áudio estava sendo reproduzido (um Fator de Tempo Real menor que 1), mesmo em computadores com pouquíssimas threads de processamento. Embora seja ligeiramente menos preciso que a versão massiva e não comprimida (apresentando um pequeno aumento de erros, tipicamente de 1 a 4%), ele é significativamente mais rápido e eficiente do que outros modelos similares, superando o popular sistema Whisper.cpp em velocidade de 1,6 a 2,3 vezes. Os autores observam que, embora este seja um grande passo à frente para rodar IA inteligente em dispositivos cotidianos, o sistema atualmente funciona melhor para áudio pré-gravado e ainda não foi testado para conversas ao vivo e em streaming.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →