← 最新论文
💬 NLP

VibeVoice-ASR-BitNet Technical Report

VibeVoice-ASR-BitNet 是一款经过压缩的实时 ASR 模型,通过异构量化(针对 VAE 的 INT8 量化和针对语言模型的 BitNet 式三值权重)以及自定义 SIMD 内核针对边缘 CPU 进行了优化,在保持极小精度损失的同时,实现了比 Whisper.cpp 快 1.6–2.3 倍的推理速度。

原作者: Songchen Xu, Ting Song, Shaohan Huang, Zhiliang Peng, Yan Xia, Yujie Tu, Xin Huang, Xun Wu, Wenhui Wang, Yaoyao Chang, Jianwei Yu, Li Dong, Furu Wei

发布于 2026-07-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Songchen Xu, Ting Song, Shaohan Huang, Zhiliang Peng, Yan Xia, Yujie Tu, Xin Huang, Xun Wu, Wenhui Wang, Yaoyao Chang, Jianwei Yu, Li Dong, Furu Wei

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图将一座庞大、高清的图书库塞进一个极小的背包里。通常情况下,如果你希望这些书既可阅读又准确,它们必须是厚重且沉重的。如果你试图将它们缩减得太厉害,页面就会变成模糊的涂鸦,或者背包会变得太重,让你根本无法携带。这就是计算机试图理解人类语言时面临的日常挣扎。多年来,最好的“语音转文本”系统就像是巨大的、沉重的图书馆,只能存在于庞大且昂贵的数据中心(云端)。它们极其聪明,但需要超级计算机才能运行,这意味着你的声音必须通过互联网传输才能进行处理。这引发了隐私担忧,并造成了令人烦恼的延迟。另一方面,那些可以在你的手机或笔记本电脑上运行的小巧、快速的系统,往往就像是儿童的素描本:翻阅速度很快,却无法理解复杂的句子或多种不同的语言。科学家们面临的一个大问题是:我们能否构建一个既像巨型图书馆一样聪明,又轻巧到足以装进背包,并在普通的计算机芯片上即时运行的系统?

这篇论文介绍了一种名为 VibeVoice-ASR-BitNet 的新解决方案,它扮演着那个语音库“大师级打包员”的角色。研究人员发现,语音识别系统的各个部分并不以同样的方式显得沉重。有些部分像是听取声波的“耳朵”,而另一些部分则像是理解这些声音代表什么词汇的“大脑”。他们没有对所有部分使用统一尺寸的盒子,而是采用了一种聪明的“异构”策略——混合了两种不同类型的压缩。对于“耳朵”(处理原始音频的部分),他们使用了全流程的 INT8 压缩,这就像是将页面印在稍薄一点的纸上,但保持墨迹清晰。对于“大脑”(预测下一个单词的部分),他们使用了更激进的 BitNet 式三值 压缩,将权重缩减到仅有的三种可能值:-1、0 和 +1。你可以把它想象成用简单的箭头、点和横线代码取代了复杂的段落。

通过结合这两种方法,团队成功地将整个模型从笨重的 4.62 GB 缩减到了精悍的 1.58 GB——实现了 2.9 倍 的体积缩减。结果是,该系统可以在标准的计算机处理器(CPU)上运行,而不需要强大的图形卡。在测试中,这个压缩后的模型可以听取一段 20 秒的语音片段,并以比音频播放速度更快的速度将其打出(实时因子小于 1),即使是在处理线程非常少的计算机上也是如此。虽然它的准确度比庞大的、未压缩的版本略低(错误率通常增加了 1–4%),但它比其他类似规模的模型更快、更高效,其速度比流行的 Whisper.cpp 系统快了 1.6 到 2.3 倍。作者指出,虽然这是在日常设备上运行智能 AI 方面迈出的重要一步,但该系统目前最适合处理预录制的音频,尚未针对实时的流式对话进行测试。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →