Qwen3-ASR Technical Report
यह रिपोर्ट Qwen3-ASR परिवार को प्रस्तुत करती है, जिसमें दो उच्च-प्रदर्शन वाले, ऑल-इन-वन स्पीच रिकग्निशन मॉडल (0.6B और 1.7B पैरामीटर्स) और एक नवीन नॉन-ऑटोरेग्रेसिव फोर्स्ड अलाइनमेंट मॉडल शामिल है, जो सामूहिक रूप से 52 भाषाओं में अत्याधुनिक सटीकता और दक्षता प्राप्त करते हैं और जिन्हें अपाचे 2.0 लाइसेंस के तहत जारी किया गया है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि स्पीच टेक्नोलॉजी (भाषण तकनीक) की दुनिया एक हलचल भरे शहर की तरह है। वर्षों से, "पुलिस" (पारंपरिक स्पीच रिकग्निशन सिस्टम) स्पष्ट, लिखित संकेतों को एक शांत कमरे में पढ़ने में बहुत अच्छी थी। लेकिन यदि आप एक भीड़ भरे बाजार में चिल्लाए, गाना गाया, या भारी लहजे (accent) में बोले, तो वे अक्सर भ्रमित हो जाते थे या हार मान लेते थे।
Qwen3-ASR टीम ने अभी-अभी "सुपर-कॉप्स" और एक "टाइम-कीपर" पेश किया है जो खेल को पूरी तरह से बदल देते हैं। यहाँ बताया गया है कि उन्होंने क्या बनाया है, जिसे सरल भाषा में समझाया गया है:
1. दो सुपर-कॉप्स: Qwen3-ASR-1.7B और Qwen3-ASR-0.6B
इन दोनों मॉडल्स को जासूसों की एक जोड़ी के रूप में सोचें जिनके पास अलग-अलग ताकतें हैं, और दोनों को एक "सुपर-मेंटर" (एक फाउंडेशन मॉडल जिसे Qwen3-Omni कहा जाता है) द्वारा प्रशिक्षित किया गया है जो दुनिया को गहराई से समझता है।
- बड़ा जासूस (Qwen3-ASR-1.7B): यह एक भारी भरकम खिलाड़ी है। यह एक अनुभवी दिग्गज की तरह है जिसने सब कुछ सुना है। यह एक शोर वाले कारखाने में बातचीत को सुन सकता है, एक पूरे बैंड के बजने के बीच एक गाने को समझ सकता है, या यह पता लगा सकता है कि कोई व्यक्ति क्या कह रहा है, भले ही वह किसी दुर्लभ बोली में बोल रहा हो। यह इतना अच्छा है कि यह बड़ी टेक कंपनियों द्वारा संचालित सबसे महंगे, बंद-दरवाजे वाले (closed-door) सेवाओं को टक्कर देता है।
- तेज-तर्रार जासूस (QाQwen3-ASR-0.6B): यह हल्का, फुर्तीला साथी है। यह छोटा और तेज़ है। कल्पना कीजिए कि एक जासूस मैराथन दौड़ते हुए भी पहेली सुलझा सकता है। इसे अविश्वसनीय रूप से कुशल बनाने के लिए डिज़ाइन किया गया है। पेपर का दावा है कि यह एक साथ कई कार्यों को चलाते समय केवल 1 सेकंड में 2,000 सेकंड का भाषण सुन सकता है। यह आपके फोन या एक छोटे डिवाइस के अंदर डालने के लिए एकदम सही है क्योंकि इसे काम करने के लिए एक विशाल कंप्यूटर की आवश्यकता नहीं है।
ये विशेष क्यों हैं?
- "यूनिवर्सल ट्रांसलेटर" वाली टोपी: ये केवल अंग्रेजी या मंदारिन नहीं बोलते; ये 52 भाषाओं और बोलियों को समझते हैं। चाहे आप मानक चीनी बोल रहे हों, सिचुआनीज़ जैसी कोई विशिष्ट क्षेत्रीय बोली, या वियतनामी जैसी भाषा बोल रहे हों, वे तुरंत अपनी टोपी बदल सकते हैं।
- "नॉइज़-कैंसलिंग" कान: उन्हें अराजकता को अनदेखा करने के लिए प्रशिक्षित किया गया था। यदि आप एक गाने के साथ गा रहे हैं जबकि पीछे ढोल बज रहा है, या यदि एक बच्चा व्यस्त सड़क पर चिल्ला रहा है, तो भी ये मॉडल शब्दों को स्पष्ट रूप से सुन सकते हैं।
- "लैंग्वेज आईडी" बैज: शब्दों को लिखने से पहले ही, वे जानते हैं कि आप वास्तव में कौन सी भाषा बोल रहे हैं। वे समान ध्वनि वाली भाषाओं (जैसे मलय और इंडोनेशियाई) के बीच अंतर उच्च सटीकता के साथ कर सकते हैं।
2. टाइम-कीपर: Qwen3-ForcedAligner-0.6B
पुराने दिनों में, यदि आप किसी रिकॉर्डिंग में ठीक से जानना चाहते थे कि एक शब्द कब शुरू हुआ और कब समाप्त हुआ (जैसे सबटाइटल्स बनाने के लिए), तो आपको एक धीमे, बोझिल मशीन का उपयोग करना पड़ता था जो अक्सर गलतियाँ करती थी।
टीम ने Qwen3-ForcedAligner नामक एक नया टूल पेश किया है।
- उपमा: कल्पना कीजिए कि आपके पास एक ट्रांसक्रिप्ट (शब्द) है और एक रिकॉर्डिंग (ध्वनि) है। पुराने उपकरण शब्दों को ध्वनि से मिलाने के लिए अनुमान लगाने जैसे थे। यह नया मॉडल एक सुपर-फास्ट, नॉन-ऑटोरेग्रेसिव टाइम-कीपर की तरह है।
- यह कैसे काम करता है: एक बार में एक शब्द का अनुमान लगाने के बजाय (जो धीमा है), यह पूरे वाक्य को देखता है और तुरंत हर एक शब्द या वर्ण (character) को एक टाइमस्टैम्प असाइन करता है।
- परिणाम: यह अविश्वसनीय रूप से सटीक और तेज़ है। यह 11 भाषाओं को संभाल सकता है और तब भी काम करता है जब वक्ता वाक्य के बीच में भाषा बदल देता है। यह इतना तेज़ है कि यह एक घंटे के ऑडियो को कुछ ही मिनटों में प्रोसेस कर सकता है।
3. उन्होंने कैसे सीखा (प्रशिक्षण)
आप सोच रहे होंगे, "वे इतने स्मार्ट कैसे हुए?"
- आधार (Foundation): उन्होंने एक ऐसे मॉडल से शुरुआत की जो पहले से ही ऑडियो, विजन और टेक्स्ट को समझता था (Qwen3-Omni)।
- अभ्यास: उन्होंने 4 करोड़ घंटों के रिकॉर्ड किए गए भाषण (मुख्य रूप से चीनी और अंग्रेजी) के एक विशाल पुस्तकालय पर अभ्यास किया।
- "रियल वर्ल्ड" ड्रिल: उन्होंने केवल एक शांत स्टूडियो में अभ्यास नहीं किया। उनका परीक्षण किया गया:
- बुजुर्ग और बच्चे: अलग-अलग आवाज की पिच।
- टंग ट्विस्टर: तेज़, कठिन भाषण।
- गायन: धुनें जो शब्दों को खींचती हैं।
- बैकग्राउंड नॉइज़: तेज़ संगीत और भीड़।
- "रीइन्फोर्समेंट" सबक: अंत में, उन्होंने एक विशेष प्रशिक्षण पद्धति (Reinforcement Learning) का उपयोग किया जहाँ उन्हें उनकी सबसे कठिन गलतियों पर सुधारा गया, जिससे वे वास्तविक जीवन की अराजकता में बहुत अधिक मजबूत बन गए।
4. परिणाम: यह क्यों मायने रखता है
पेपर इन नए मॉडल्स की तुलना उनके सबसे अच्छे प्रतिस्पर्धियों (दोनों मुफ्त ओपन-सोर्स और सशुल्क व्यावसायिक सेवाओं) से करता है।
- सटीकता: बड़ा मॉडल (1.7B) अक्सर सबसे सटीक ओपन-सोर्स मॉडल है, जो महंगी सशुल्क सेवाओं को मात देता है या उनके बराबर होता है।
- गति: छोटा मॉडल (0.6B) सबसे तेज़ है, जो गति और बुद्धिमत्ता के बीच सबसे अच्छा संतुलन प्रदान करता है।
- बहुमुखी प्रतिभा: वे पहले हैं जो उच्च गुणवत्ता वाले स्पीच रिकग्निशन, लैंग्वेज आइडेंटिफिकेशन और सिंगिंग रिकग्निशन को एक पैकेज में मिलाते हैं जो दर्जनों भाषाओं में काम करता है।
संक्षेप में: Qwen3-ASR परिवार एक ऐसा टूलकिट है जो कंप्यूटर को मानव भाषण को उतनी ही अच्छी तरह समझने में मदद करता है जितना कि एक इंसान, यहाँ तक कि शोर-शराबे, अव्यवस्था या संगीत वाली स्थितियों में भी, और यह ऐसा कई अलग-अलग भाषाओं में करता है। उन्होंने इन उपकरणों को सभी के लिए मुफ्त उपलब्ध कराया है, इस उम्मीद के साथ कि यह शोधकर्ताओं और डेवलपर्स को भविष्य की बेहतर वॉयस टेक्नोलॉजी बनाने में मदद करेगा।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।