← Nieuwste papers
💬 NLP

VibeVoice-ASR-BitNet Technical Report

VibeVoice-ASR-BitNet is een gecomprimeerd, real-time ASR-model dat is geoptimaliseerd voor edge-CPU's via heterogene kwantisatie (INT8 voor de VAE en BitNet-stijl ternaire gewichten voor het taalmodel) en aangepaste SIMD-kernels, waarmee het 1,6–2,3x snellere inferentie bereikt dan Whisper.cpp met minimaal nauwkeurigheidsverlies.

Oorspronkelijke auteurs: Songchen Xu, Ting Song, Shaohan Huang, Zhiliang Peng, Yan Xia, Yujie Tu, Xin Huang, Xun Wu, Wenhui Wang, Yaoyao Chang, Jianwei Yu, Li Dong, Furu Wei

Gepubliceerd 2026-07-28
📖 3 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Songchen Xu, Ting Song, Shaohan Huang, Zhiliang Peng, Yan Xia, Yujie Tu, Xin Huang, Xun Wu, Wenhui Wang, Yaoyao Chang, Jianwei Yu, Li Dong, Furu Wei

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert een enorme, high-definition bibliotheek met boeken in een piepkleine rugzak te passen. Normaal gesproken moeten de boeken dik en zwaar zijn als je wilt dat ze leesbaar en nauwkeurig zijn. Als je ze te veel krimpt, veranderen de pagina's in wazige krabbels, of wordt de rugzak zo zwaar dat je hem niet kunt dragen. Dit is de dagelijkse strijd voor computers die menselijke spraak proberen te begrijpen. Jarenlang waren de beste "spraak-naar-tekst"-systemen als gigantische, zware bibliotheken die alleen in enorme, dure datacenters (de cloud) konden leven. Ze waren ongelooflijk slim, maar vereisten een supercomputer om te draaien, wat betekende dat je stem via het internet moest worden verzonden om verwerkt te worden. Dit riep zorgen op over de privacy en veroorzaakte vervelende vertragingen. Aan de andere kant waren de kleine, snelle systemen die op je telefoon of laptop konden draaien vaak als een schetsboek van een kind: snel door te bladeren, maar ze konden geen complexe zinnen of veel verschillende talen begrijpen. De grote vraag voor wetenschappers is geweest: Kunnen we een systeem bous dat net zo slim is als de gigantische bibliotheek, maar licht genoeg is om in een rugzak te passen en direct te draaien op een gewone computerchip?

Dit artikel introduceert een nieuwe oplossing genaamd VibeVoice-ASR-BitNet, die fungeert als een meesterverpakker voor die spraakbibliotheek. De onderzoekers ontdekten dat niet alle onderdelen van een spraakherkenningssysteem op dezelfde manier zwaar zijn. Sommige onderdelen zijn als de "oren" die naar geluidsgolven luisteren, en andere zijn als het "brein" dat uitzoekt welke woorden die geluiden betekenen. In plaats van één maat doos voor alles te gebruiken, gebruikten ze een slimme "heterogene" strategie—het mengen van twee verschillende soorten compressie. Voor de "oren" (het deel dat ruwe audio verwerkt), gebruikten ze een volledige-pipeline INT8-compressie, wat is alsof je de pagina's op iets dunner papier print maar de inkt scherp houdt. Voor het "brein" (het deel dat het volgende woord voorspelt), gebruikten ze een nog agressievere BitNet-stijl ternaire compressie, waarbij de gewichten werden gekrompen tot slechts drie mogelijke waarden: -1, 0 en +1. Denk hierbij aan het vervangen van complexe paragrafen door een eenvoudige code van pijlen, stippen en streepjes.

Door deze twee methoden te combineren, slaagde het team erin om het hele model van een lomp 4,62 GB te verkleinen naar een slanke 1,58 GB—een reductie van 2,9x. Het resultaat is een systeem dat op een standaard computerprocessor (CPU) kan draaien zonder dat er een krachtige grafische kaart nodig is. In hun tests kon dit gecomprimeerde model een fragment van 20 seconden spraak beluisteren en uittypen sneller dan de audio werd afgespeeld (een Real-Time Factor van minder dan 1), zelfs op computers met zeer weinig verwerkingsthreads. Hoewel het iets minder nauwkeurig is dan de enorme, ongecomprimeerde versie (met een kleine toename in fouten, doorgaans 1–4%), is het aanzienlijk sneller en efficiënter dan andere vergelijkbare modellen, waarbij het het populaire Whisper.cpp-systeem met 1,6 tot 2,3 keer verslaat. De auteurs merken op dat hoewel dit een grote stap voorwaarts is voor het draaien van slimme AI op alledaagse apparaten, het systeem momenteel het beste werkt voor vooraf opgenomen audio en nog niet is getest voor live, stromende gesprekken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →