← Neueste Arbeiten
💬 NLP

VibeVoice-ASR-BitNet Technical Report

VibeVoice-ASR-BitNet ist ein komprimiertes Echtzeit-ASR-Modell, das durch heterogene Quantisierung (INT8 für den VAE und BitNet-ähnliche ternäre Gewichte für das Sprachmodell) sowie benutzerdefinierte SIMD-Kernel für Edge-CPUs optimiert wurde und eine 1,6- bis 2,3-mal schnellere Inferenz als Whisper.cpp bei minimalem Genauigkeitsverlust erreicht.

Ursprüngliche Autoren: Songchen Xu, Ting Song, Shaohan Huang, Zhiliang Peng, Yan Xia, Yujie Tu, Xin Huang, Xun Wu, Wenhui Wang, Yaoyao Chang, Jianwei Yu, Li Dong, Furu Wei

Veröffentlicht 2026-07-28
📖 3 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Songchen Xu, Ting Song, Shaohan Huang, Zhiliang Peng, Yan Xia, Yujie Tu, Xin Huang, Xun Wu, Wenhui Wang, Yaoyao Chang, Jianwei Yu, Li Dong, Furu Wei

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie versuchen, eine riesige, hochauflösende Bibliothek von Büchern in einen winzigen Rucksack zu passen. Normalerweise müssen die Bücher dick und schwer sein, wenn sie lesbar und genau sein sollen. Wenn man versucht, sie zu stark zu schrumpfen, verwandeln sich die Seiten in verschwommene Kritzeleien, oder der Rucksack wird so schwer, dass man ihn gar nicht erst tragen kann. Dies ist der tägliche Kampf von Computern, die menschliche Sprache verstehen wollen. Jahrelang waren die besten „Speech-to-Text“-Systeme wie riesige, schwere Bibliotheken, die nur in massiven, teuren Rechenzentren (der Cloud) existieren konnten. Sie waren unglaublich intelligent, erforderten aber einen Supercomputer zum Ausführen, was bedeutete, dass Ihre Stimme über das Internet übertragen werden musste, um verarbeitet zu werden. Dies warf Bedenken hinsichtlich des Datenschutzes auf und verursachte störende Verzögerungen. Auf der anderen Seite waren die kleinen, schnellen Systeme, die auf Ihrem Telefon oder Laptop laufen konnten, oft wie das Skizzenbuch eines Kindes: schnell durchzublättern, aber sie konnten keine komplexen Sätze oder viele verschiedene Sprachen verstehen. Die große Frage für Wissenschaftler lautete: Können wir ein System bauen, das so intelligent wie die riesige Bibliothek ist, aber leicht genug, um in einen Rucksack zu passen und sofort auf einem gewöhnlichen Computerchip zu laufen?

Dieses Paper stellt eine neue Lösung namens VibeVoice-ASR-BitNet vor, die wie ein Meisterpacker für diese Sprachbibliothek fungiert. Die Forscher fanden heraus, dass nicht alle Teile eines Spracherkennungssystems auf die gleiche Weise schwer sind. Einige Teile sind wie die „Ohren“, die auf Schallwellen hören, und andere sind wie das „Gehirn“, das herausfindet, welche Wörter diese Klänge bedeuten. Anstatt für alles eine einzige Boxgröße zu verwenden, nutzten sie eine clevere „heterogene“ Strategie – eine Mischung aus zwei verschiedenen Arten der Kompression. Für die „Ohren“ (den Teil, der die rohen Audiodaten verarbeitet) verwendeten sie eine Full-Pipeline-INT8-Kompression, was so ist, als würde man die Seiten auf etwas dünnerem Papier drucken, aber die Tinte scharf halten. Für das „Gehirn“ (den Teil, der das nächste Wort vorhersagt) verwendeten sie eine noch aggressivere BitNet-artige ternäre Kompression, die die Gewichte auf nur drei mögliche Werte schrumpfte: -1, 0 und +1. Stellen Sie sich das wie das Ersetzen komplexer Absätze durch einen einfachen Code aus Pfeilen, Punkten und Strichen vor.

Durch die Kombination dieser beiden Methoden gelang es dem Team, das gesamte Modell von einem sperrigen 4,62 GB auf schlanke 1,58 GB zu schrumpfen – eine Reduktion der Größe um das 2,9-fache. Das Ergebnis ist ein System, das auf einem Standard-Prozessor (CPU) laufen kann, ohne eine leistungsstarke Grafikkarte zu benötigen. In ihren Tests konnte dieses komprimierte Modell einen 20-sekündigen Audioclip anhören und ihn schneller transkribieren, als die Audioaufnahme lief (ein Real-Time-Faktor von weniger als 1), selbst auf Computern mit sehr wenigen Prozessoren-Threads. Obwohl es etwas weniger genau ist als die massive, unkomprimierte Version (was typischerweise einen geringfügigen Anstieg der Fehler um 1–4 % zeigt), ist es signifikant schneller und effizienter als andere ähnliche Modelle und übertrifft das populäre Whisper.cpp-System in der Geschwindigkeit um das 1,6- bis 2,3-fache. Die Autoren merken an, dass dies zwar ein großer Schritt nach vorn für das Ausführen smarter KI auf Alltagsgeräten ist, das System derzeit jedoch am besten für voraufgenommene Audioaufnahmen funktioniert und noch nicht für Live-Streaming-Gespräche getestet wurde.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →