← Últimos artículos
💬 NLP

VibeVoice-ASR-BitNet Technical Report

VibeVoice-ASR-BitNet es un modelo ASR comprimido y en tiempo real optimizado para CPUs de borde mediante cuantización heterogénea (INT8 para el VAE y pesos ternarios estilo BitNet para el modelo de lenguaje) y kernels SIMD personalizados, logrando una inferencia de 1.6–2.3x más rápida que Whisper.cpp con una pérdida de precisión mínima.

Autores originales: Songchen Xu, Ting Song, Shaohan Huang, Zhiliang Peng, Yan Xia, Yujie Tu, Xin Huang, Xun Wu, Wenhui Wang, Yaoyao Chang, Jianwei Yu, Li Dong, Furu Wei

Publicado 2026-07-28
📖 3 min de lectura☕ Lectura para el café

Autores originales: Songchen Xu, Ting Song, Shaohan Huang, Zhiliang Peng, Yan Xia, Yujie Tu, Xin Huang, Xun Wu, Wenhui Wang, Yaoyao Chang, Jianwei Yu, Li Dong, Furu Wei

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando meter una biblioteca masiva y de alta definición de libros en una mochila diminuta. Normalmente, si quieres que los libros sean legibles y precisos, deben ser gruesos y pesados. Si intentas encogerlos demasiado, las páginas se convierten en garabatos borrosos, o la mochila se vuelve tan pesada que no puedes cargarla en absoluto. Este es el lucha diaria de las computadoras para entender el habla humana. Durante años, los mejores sistemas de "voz a texto" eran como bibliotecas gigantes y pesadas que solo podían vivir en enormes y costosos centros de datos (la nube). Eran increíblemente inteligentes, pero requerían una supercomputadora para funcionar, lo que significaba que tu voz tenía que viajar a través de internet para ser procesada. Esto generaba preocupaciones de privacidad y causaba retrasos molestos. Por otro lado, los sistemas pequeños y rápidos que podían ejecutarse en tu teléfono o laptop eran a menudo como el cuaderno de bocetos de un niño: rápidos de hojear, pero no podían entender oraciones complejas o muchos idiomas diferentes. La gran pregunta para los científicos ha sido: ¿Podemos construir un sistema que sea tan inteligente como la biblioteca gigante pero lo suficientemente ligero como para caber en una mochila y ejecutarse instantáneamente en un chip de computadora regular?

Este artículo presenta una nueva solución llamada VibeVoice-ASR-BitNet, que actúa como un maestro empaquetador para esa biblioteca de voz. Los investigadores descubrieron que no todas las partes de un sistema de reconocimiento de voz son pesadas de la misma manera. Algunas partes son como los "oídos" que escuchan las ondas sonoras, y otras son como el "cerebro" que descifra qué palabras significan esos sonidos. En lugar de usar un solo tamaño de caja para todo, utilizaron una estrategia "heterogénea" ingeniosa: mezclando dos tipos diferentes de compresión. Para los "oídos" (la parte que procesa el audio bruto), utilizaron una compresión de INT8 de flujo completo, que es como imprimir las páginas en un papel ligeramente más delgado pero manteniendo la tinta nítida. Para el "cerebro" (la parte que predice la siguiente palabra), utilizaron una compresión de estilo BitNet ternaria aún más agresiva, reduciendo los pesos a solo tres valores posibles: -1, 0 y +1. Piensa en esto como reemplazar párrafos complejos con un código simple de flechas, puntos y guiones.

Al combinar estos dos métodos, el equipo logró reducir el modelo completo de unos voluminosos 4.62 GB a unos esbeltos 1.58 GB: una reducción de tamaño de 2.9x. El resultado es un sistema que puede ejecutarse en un procesador de computadora estándar (CPU) sin necesidad de una tarjeta gráfica potente. En sus pruebas, este modelo comprimido pudo escuchar un clip de voz de 20 segundos y transcribirlo más rápido de lo que se reproducía el audio (un Factor de Tiempo Real menor a 1), incluso en computadoras con muy pocos hilos de procesamiento. Aunque es ligeramente menos preciso que la versión masiva y no comprimida (mostrando un pequeño aumento en los errores, típicamente del 1 al 4%), es significativamente más rápido y eficiente que otros sistemas similares en tamaño, superando al popular sistema Whisper.cpp en velocidad de 1.6 a 2.3 veces. Los autores señalan que, si bien este es un gran paso adelante para ejecutar IA inteligente en dispositivos cotidianos, el sistema actualmente funciona mejor para audio pregrabado y aún no ha sido probado para conversaciones en vivo o de transmisión continua.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →