← नवीनतम पेपर
⚡ electrical engineering

Qwen3-ASR Technical Report

यह रिपोर्ट Qwen3-ASR परिवार को प्रस्तुत करती है, जिसमें दो उच्च-प्रदर्शन वाले, ऑल-इन-वन स्पीच रिकग्निशन मॉडल (0.6B और 1.7B पैरामीटर्स) और एक नवीन नॉन-ऑटोरेग्रेसिव फोर्स्ड अलाइनमेंट मॉडल शामिल है, जो सामूहिक रूप से 52 भाषाओं में अत्याधुनिक सटीकता और दक्षता प्राप्त करते हैं और जिन्हें अपाचे 2.0 लाइसेंस के तहत जारी किया गया है।

मूल लेखक: Xian Shi, Xiong Wang, Zhifang Guo, Yongqi Wang, Pei Zhang, Xinyu Zhang, Zishan Guo, Hongkun Hao, Yu Xi, Baosong Yang, Jin Xu, Jingren Zhou, Junyang Lin

प्रकाशित 2026-02-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xian Shi, Xiong Wang, Zhifang Guo, Yongqi Wang, Pei Zhang, Xinyu Zhang, Zishan Guo, Hongkun Hao, Yu Xi, Baosong Yang, Jin Xu, Jingren Zhou, Junyang Lin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि स्पीच टेक्नोलॉजी (भाषण तकनीक) की दुनिया एक हलचल भरे शहर की तरह है। वर्षों से, "पुलिस" (पारंपरिक स्पीच रिकग्निशन सिस्टम) स्पष्ट, लिखित संकेतों को एक शांत कमरे में पढ़ने में बहुत अच्छी थी। लेकिन यदि आप एक भीड़ भरे बाजार में चिल्लाए, गाना गाया, या भारी लहजे (accent) में बोले, तो वे अक्सर भ्रमित हो जाते थे या हार मान लेते थे।

Qwen3-ASR टीम ने अभी-अभी "सुपर-कॉप्स" और एक "टाइम-कीपर" पेश किया है जो खेल को पूरी तरह से बदल देते हैं। यहाँ बताया गया है कि उन्होंने क्या बनाया है, जिसे सरल भाषा में समझाया गया है:

1. दो सुपर-कॉप्स: Qwen3-ASR-1.7B और Qwen3-ASR-0.6B

इन दोनों मॉडल्स को जासूसों की एक जोड़ी के रूप में सोचें जिनके पास अलग-अलग ताकतें हैं, और दोनों को एक "सुपर-मेंटर" (एक फाउंडेशन मॉडल जिसे Qwen3-Omni कहा जाता है) द्वारा प्रशिक्षित किया गया है जो दुनिया को गहराई से समझता है।

  • बड़ा जासूस (Qwen3-ASR-1.7B): यह एक भारी भरकम खिलाड़ी है। यह एक अनुभवी दिग्गज की तरह है जिसने सब कुछ सुना है। यह एक शोर वाले कारखाने में बातचीत को सुन सकता है, एक पूरे बैंड के बजने के बीच एक गाने को समझ सकता है, या यह पता लगा सकता है कि कोई व्यक्ति क्या कह रहा है, भले ही वह किसी दुर्लभ बोली में बोल रहा हो। यह इतना अच्छा है कि यह बड़ी टेक कंपनियों द्वारा संचालित सबसे महंगे, बंद-दरवाजे वाले (closed-door) सेवाओं को टक्कर देता है।
  • तेज-तर्रार जासूस (QाQwen3-ASR-0.6B): यह हल्का, फुर्तीला साथी है। यह छोटा और तेज़ है। कल्पना कीजिए कि एक जासूस मैराथन दौड़ते हुए भी पहेली सुलझा सकता है। इसे अविश्वसनीय रूप से कुशल बनाने के लिए डिज़ाइन किया गया है। पेपर का दावा है कि यह एक साथ कई कार्यों को चलाते समय केवल 1 सेकंड में 2,000 सेकंड का भाषण सुन सकता है। यह आपके फोन या एक छोटे डिवाइस के अंदर डालने के लिए एकदम सही है क्योंकि इसे काम करने के लिए एक विशाल कंप्यूटर की आवश्यकता नहीं है।

ये विशेष क्यों हैं?

  • "यूनिवर्सल ट्रांसलेटर" वाली टोपी: ये केवल अंग्रेजी या मंदारिन नहीं बोलते; ये 52 भाषाओं और बोलियों को समझते हैं। चाहे आप मानक चीनी बोल रहे हों, सिचुआनीज़ जैसी कोई विशिष्ट क्षेत्रीय बोली, या वियतनामी जैसी भाषा बोल रहे हों, वे तुरंत अपनी टोपी बदल सकते हैं।
  • "नॉइज़-कैंसलिंग" कान: उन्हें अराजकता को अनदेखा करने के लिए प्रशिक्षित किया गया था। यदि आप एक गाने के साथ गा रहे हैं जबकि पीछे ढोल बज रहा है, या यदि एक बच्चा व्यस्त सड़क पर चिल्ला रहा है, तो भी ये मॉडल शब्दों को स्पष्ट रूप से सुन सकते हैं।
  • "लैंग्वेज आईडी" बैज: शब्दों को लिखने से पहले ही, वे जानते हैं कि आप वास्तव में कौन सी भाषा बोल रहे हैं। वे समान ध्वनि वाली भाषाओं (जैसे मलय और इंडोनेशियाई) के बीच अंतर उच्च सटीकता के साथ कर सकते हैं।

2. टाइम-कीपर: Qwen3-ForcedAligner-0.6B

पुराने दिनों में, यदि आप किसी रिकॉर्डिंग में ठीक से जानना चाहते थे कि एक शब्द कब शुरू हुआ और कब समाप्त हुआ (जैसे सबटाइटल्स बनाने के लिए), तो आपको एक धीमे, बोझिल मशीन का उपयोग करना पड़ता था जो अक्सर गलतियाँ करती थी।

टीम ने Qwen3-ForcedAligner नामक एक नया टूल पेश किया है।

  • उपमा: कल्पना कीजिए कि आपके पास एक ट्रांसक्रिप्ट (शब्द) है और एक रिकॉर्डिंग (ध्वनि) है। पुराने उपकरण शब्दों को ध्वनि से मिलाने के लिए अनुमान लगाने जैसे थे। यह नया मॉडल एक सुपर-फास्ट, नॉन-ऑटोरेग्रेसिव टाइम-कीपर की तरह है।
  • यह कैसे काम करता है: एक बार में एक शब्द का अनुमान लगाने के बजाय (जो धीमा है), यह पूरे वाक्य को देखता है और तुरंत हर एक शब्द या वर्ण (character) को एक टाइमस्टैम्प असाइन करता है।
  • परिणाम: यह अविश्वसनीय रूप से सटीक और तेज़ है। यह 11 भाषाओं को संभाल सकता है और तब भी काम करता है जब वक्ता वाक्य के बीच में भाषा बदल देता है। यह इतना तेज़ है कि यह एक घंटे के ऑडियो को कुछ ही मिनटों में प्रोसेस कर सकता है।

3. उन्होंने कैसे सीखा (प्रशिक्षण)

आप सोच रहे होंगे, "वे इतने स्मार्ट कैसे हुए?"

  • आधार (Foundation): उन्होंने एक ऐसे मॉडल से शुरुआत की जो पहले से ही ऑडियो, विजन और टेक्स्ट को समझता था (Qwen3-Omni)।
  • अभ्यास: उन्होंने 4 करोड़ घंटों के रिकॉर्ड किए गए भाषण (मुख्य रूप से चीनी और अंग्रेजी) के एक विशाल पुस्तकालय पर अभ्यास किया।
  • "रियल वर्ल्ड" ड्रिल: उन्होंने केवल एक शांत स्टूडियो में अभ्यास नहीं किया। उनका परीक्षण किया गया:
    • बुजुर्ग और बच्चे: अलग-अलग आवाज की पिच।
    • टंग ट्विस्टर: तेज़, कठिन भाषण।
    • गायन: धुनें जो शब्दों को खींचती हैं।
    • बैकग्राउंड नॉइज़: तेज़ संगीत और भीड़।
  • "रीइन्फोर्समेंट" सबक: अंत में, उन्होंने एक विशेष प्रशिक्षण पद्धति (Reinforcement Learning) का उपयोग किया जहाँ उन्हें उनकी सबसे कठिन गलतियों पर सुधारा गया, जिससे वे वास्तविक जीवन की अराजकता में बहुत अधिक मजबूत बन गए।

4. परिणाम: यह क्यों मायने रखता है

पेपर इन नए मॉडल्स की तुलना उनके सबसे अच्छे प्रतिस्पर्धियों (दोनों मुफ्त ओपन-सोर्स और सशुल्क व्यावसायिक सेवाओं) से करता है।

  • सटीकता: बड़ा मॉडल (1.7B) अक्सर सबसे सटीक ओपन-सोर्स मॉडल है, जो महंगी सशुल्क सेवाओं को मात देता है या उनके बराबर होता है।
  • गति: छोटा मॉडल (0.6B) सबसे तेज़ है, जो गति और बुद्धिमत्ता के बीच सबसे अच्छा संतुलन प्रदान करता है।
  • बहुमुखी प्रतिभा: वे पहले हैं जो उच्च गुणवत्ता वाले स्पीच रिकग्निशन, लैंग्वेज आइडेंटिफिकेशन और सिंगिंग रिकग्निशन को एक पैकेज में मिलाते हैं जो दर्जनों भाषाओं में काम करता है।

संक्षेप में: Qwen3-ASR परिवार एक ऐसा टूलकिट है जो कंप्यूटर को मानव भाषण को उतनी ही अच्छी तरह समझने में मदद करता है जितना कि एक इंसान, यहाँ तक कि शोर-शराबे, अव्यवस्था या संगीत वाली स्थितियों में भी, और यह ऐसा कई अलग-अलग भाषाओं में करता है। उन्होंने इन उपकरणों को सभी के लिए मुफ्त उपलब्ध कराया है, इस उम्मीद के साथ कि यह शोधकर्ताओं और डेवलपर्स को भविष्य की बेहतर वॉयस टेक्नोलॉजी बनाने में मदद करेगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →