← नवीनतम पेपर
💬 NLP

VibeVoice-ASR-BitNet Technical Report

VibeVoice-ASR-BitNet एक संकुचित, रियल-टाइम ASR मॉडल है जो हेटेरोजेनियस क्वांटाइजेशन (VAE के लिए INT8 और लैंग्वेज मॉडल के लिए BitNet-शैली के टेनरी वेट्स) और कस्टम SIMD कर्नेल्स के माध्यम से एज CPUs के लिए अनुकूलित है, जो न्यूनतम सटीकता हानि के साथ Whisper.cpp की तुलना में 1.6–2.3x तेज़ इन्फरेंस प्राप्त करता है।

मूल लेखक: Songchen Xu, Ting Song, Shaohan Huang, Zhiliang Peng, Yan Xia, Yujie Tu, Xin Huang, Xun Wu, Wenhui Wang, Yaoyao Chang, Jianwei Yu, Li Dong, Furu Wei

प्रकाशित 2026-07-28
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Songchen Xu, Ting Song, Shaohan Huang, Zhiliang Peng, Yan Xia, Yujie Tu, Xin Huang, Xun Wu, Wenhui Wang, Yaoyao Chang, Jianwei Yu, Li Dong, Furu Wei

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप किताबों के एक विशाल, हाई-डेफिनिशन पुस्तकालय को एक छोटे से बैकपैक में फिट करने की कोशिश कर रहे हैं। आमतौर पर, यदि आप चाहते हैं कि किताबें पठनीय और सटीक रहें, तो उन्हें मोटा और भारी होना पड़ता है। यदि आप उन्हें बहुत अधिक सिकोड़ने की कोशिश करते हैं, तो पन्ने धुंधली लकीरों में बदल जाते हैं, या बैकपैक इतना भारी हो जाता है कि आप उसे उठा ही नहीं पाते। यह कंप्यूटरों के लिए मानवीय भाषा को समझने का दैनिक संघर्ष है। वर्षों तक, सबसे अच्छे "स्पीच-टू-टेक्स्ट" सिस्टम उस विशाल, भारी पुस्तकालय की तरह थे जो केवल बड़े, महंगे डेटा सेंटरों (क्लाउड) में रह सकते थे। वे अविश्वसनीय रूप से स्मार्ट थे लेकिन उन्हें चलाने के लिए एक सुपरकंप्यूटर की आवश्यकता थी, जिसका अर्थ था कि आपकी आवाज़ को प्रोसेस होने के लिए इंटरनेट के माध्यम से यात्रा करनी पड़ती थी। इससे गोपनीयता संबंधी चिंताएं पैदा हुईं और परेशान करने वाली देरी भी हुई। दूसरी ओर, जो छोटे, तेज़ सिस्टम आपके फोन या लैपटॉप पर चल सकते थे, वे अक्सर एक बच्चे की स्केचबुक की तरह थे: पन्ने पलटने में तेज़, लेकिन वे जटिल वाक्यों या कई अलग-अलग भाषाओं को नहीं समझ सकते थे। वैज्ञानिकों के लिए बड़ा सवाल यह रहा है कि: क्या हम एक ऐसा सिस्टम बना सकते हैं जो उस विशाल पुस्तकालय जितना स्मार्ट हो लेकिन इतना हल्का हो कि एक बैकपैक में समा सके और एक सामान्य कंप्यूटर चिप पर तुरंत चल सके?

यह शोध पत्र एक नया समाधान पेश करता है जिसे VibeVoice-ASR-BitNet कहा जाता है, जो उस स्पीच लाइब्रेरी के लिए एक मास्टर पैकर की तरह काम करता है। शोधकर्ताओं ने पाया कि स्पीच-रिकग्निशन सिस्टम के सभी हिस्से एक ही तरह से भारी नहीं होते हैं। कुछ हिस्से "कानों" की तरह होते हैं जो ध्वनि तरंगों को सुनते हैं, और अन्य "मस्तिष्क" की तरह होते हैं जो यह समझते हैं कि उन ध्वनियों का अर्थ क्या है। हर चीज़ के लिए एक ही आकार के बॉक्स का उपयोग करने के बजाय, उन्होंने एक चतुर "विषम" (heterogeneous) रणनीति का उपयोग किया—दो अलग-अलग प्रकार के संपीड़न (compression) का मिश्रण। "कानों" के लिए (वह हिस्सा जो कच्चे ऑडियो को प्रोसेस करता है), उन्होंने एक फुल-पाइपलाइन INT8 संपीड़न का उपयोग किया, जो कि पृष्ठों को थोड़ा पतला कागज पर प्रिंट करने जैसा है लेकिन स्याही को तीक्ष्ण बनाए रखता है। "मस्तिष्क" के लिए (वह हिस्सा जो अगले शब्द की भविष्यवाणी करता है), उन्होंने और भी आक्रामक BitNet-शैली की त्रिक (ternary) संपीड़न तकनीक का उपयोग किया, जिससे वजन (weights) को घटाकर केवल तीन संभावित मानों में बदल दिया गया: -1, 0, और +1। इसे जटिल अनुच्छेदों को तीर, बिंदु और डैश के एक सरल कोड से बदलने के रूप में सोचें।

इन दोनों विधियों को संयोजित करके, टीम पूरे मॉडल को एक भारी 4.62 GB से घटाकर एक सुव्यवस्थित 1.58 GB बनाने में सफल रही—जो कि आकार में 2.9 गुना की कमी है। परिणाम यह है कि यह सिस्टम बिना किसी शक्तिशाली ग्राफिक्स कार्ड के एक मानक कंप्यूटर प्रोसेसर (CPU) पर चल सकता है। अपने परीक्षणों में, यह संपीड़ित मॉडल स्पीच के 20 सेकंड के क्लिप को सुनने और उसे ऑडियो बजने की गति से भी तेज़ टाइप कर सकता था (एक रियल-टाइम फैक्टर जो 1 से कम है), यहाँ तक कि बहुत कम प्रोसेसिंग थ्रेड्स वाले कंप्यूटरों पर भी। हालांकि यह विशाल, अनकंप्रेस्ड संस्करण की तुलना में थोड़ा कम सटीक है (त्रुटियों में आमतौर पर 1-4% की मामूली वृद्धि दिखाता है), यह समान आकार के अन्य मॉडलों की तुलना में काफी तेज़ और अधिक कुशल है, जो लोकप्रिय Whisper.cpp सिस्टम से गति में 1.6 से 2.3 गुना बेहतर है। लेखक उल्लेख करते हैं कि हालांकि यह रोजमर्रा के उपकरणों पर स्मार्ट AI चलाने की दिशा में एक बड़ा कदम है, वर्तमान में यह सिस्टम पहले से रिकॉर्ड किए गए ऑडियो के लिए सबसे अच्छा काम करता है और अभी तक लाइव, स्ट्रीमिंग बातचीत के लिए परीक्षण नहीं किया गया है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →