VibeVoice-ASR-BitNet Technical Report
VibeVoice-ASR-BitNet 是一款经过压缩的实时 ASR 模型,通过异构量化(针对 VAE 的 INT8 量化和针对语言模型的 BitNet 式三值权重)以及自定义 SIMD 内核针对边缘 CPU 进行了优化,在保持极小精度损失的同时,实现了比 Whisper.cpp 快 1.6–2.3 倍的推理速度。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图将一座庞大、高清的图书库塞进一个极小的背包里。通常情况下,如果你希望这些书既可阅读又准确,它们必须是厚重且沉重的。如果你试图将它们缩减得太厉害,页面就会变成模糊的涂鸦,或者背包会变得太重,让你根本无法携带。这就是计算机试图理解人类语言时面临的日常挣扎。多年来,最好的“语音转文本”系统就像是巨大的、沉重的图书馆,只能存在于庞大且昂贵的数据中心(云端)。它们极其聪明,但需要超级计算机才能运行,这意味着你的声音必须通过互联网传输才能进行处理。这引发了隐私担忧,并造成了令人烦恼的延迟。另一方面,那些可以在你的手机或笔记本电脑上运行的小巧、快速的系统,往往就像是儿童的素描本:翻阅速度很快,却无法理解复杂的句子或多种不同的语言。科学家们面临的一个大问题是:我们能否构建一个既像巨型图书馆一样聪明,又轻巧到足以装进背包,并在普通的计算机芯片上即时运行的系统?
这篇论文介绍了一种名为 VibeVoice-ASR-BitNet 的新解决方案,它扮演着那个语音库“大师级打包员”的角色。研究人员发现,语音识别系统的各个部分并不以同样的方式显得沉重。有些部分像是听取声波的“耳朵”,而另一些部分则像是理解这些声音代表什么词汇的“大脑”。他们没有对所有部分使用统一尺寸的盒子,而是采用了一种聪明的“异构”策略——混合了两种不同类型的压缩。对于“耳朵”(处理原始音频的部分),他们使用了全流程的 INT8 压缩,这就像是将页面印在稍薄一点的纸上,但保持墨迹清晰。对于“大脑”(预测下一个单词的部分),他们使用了更激进的 BitNet 式三值 压缩,将权重缩减到仅有的三种可能值:-1、0 和 +1。你可以把它想象成用简单的箭头、点和横线代码取代了复杂的段落。
通过结合这两种方法,团队成功地将整个模型从笨重的 4.62 GB 缩减到了精悍的 1.58 GB——实现了 2.9 倍 的体积缩减。结果是,该系统可以在标准的计算机处理器(CPU)上运行,而不需要强大的图形卡。在测试中,这个压缩后的模型可以听取一段 20 秒的语音片段,并以比音频播放速度更快的速度将其打出(实时因子小于 1),即使是在处理线程非常少的计算机上也是如此。虽然它的准确度比庞大的、未压缩的版本略低(错误率通常增加了 1–4%),但它比其他类似规模的模型更快、更高效,其速度比流行的 Whisper.cpp 系统快了 1.6 到 2.3 倍。作者指出,虽然这是在日常设备上运行智能 AI 方面迈出的重要一步,但该系统目前最适合处理预录制的音频,尚未针对实时的流式对话进行测试。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。