← नवीनतम पेपर
💬 NLP

Qwen3.5-Omni Technical Report

Qwen3.5-Omni एक अत्याधुनिक, सैकड़ों-अरब-पैरामीटर वाला ओम्नीमोडल मॉडल है जिसमें हाइब्रिड अटेंशन MoE आर्किटेक्चर और ARIA अलाइनमेंट मैकेनिज्म है, जो बहुभाषी ऑडियो-विजुअल समझ, लॉन्ग-कॉन्टेक्स्ट रीजनिंग और उभरती हुई "ऑडियो-विजुअल वाइब कोडिंग" क्षमताओं में उत्कृष्ट प्रदर्शन प्राप्त करता है।

मूल लेखक: Qwen Team

प्रकाशित 2026-04-20
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Qwen Team

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मिलिए Qwen3.5-Omni से: परम "सुपर-लिसनर" (Super-Listener) AI

कल्पना कीजिए एक ऐसे AI की जो न केवल आपके टेक्स्ट को पढ़ सकता है या आपकी तस्वीरों को देख सकता है, बल्कि वह आपको सुन भी सकता है, आपको देख सकता है, एक पूरी फिल्म के संदर्भ (context) को समझ सकता है, और आपसे सही लहजे, उच्चारण और भावना के साथ वापस बात कर सकता है। यही है Qwen3.5-Omni

पिछले AI मॉडल्स को एक बहुत ही बुद्धिमान लाइब्रेरियन के रूप में सोचें जो किताबें (टेक्स्ट) पढ़ सकता है और चित्रों (इमेज) को देख सकता है, लेकिन अगर आप फुसफुसाकर कोई सवाल पूछते हैं, तो वे सुन नहीं सकते, और यदि आप उनसे किसी वीडियो का वर्णन करने के लिए कहते हैं, तो वे केवल शीर्षक के आधार पर अनुमान लगा सकते हैं।

Qwen3.5-Omni अलग है। यह एक सुपर-इंटेलिजेंट, बहुमुखी मानव सहायक की तरह है जो आपके साथ एक कमरे में बैठ सकता है, 400 सेकंड का वीडियो देख सकता है, 10 घंटे का पॉडकास्ट सुन सकता है, चुटकुलों, बैकग्राउंड शोर और वक्ता की भावनाओं को समझ सकता है, और फिर तुरंत आपको जवाब दे सकता है—या तो टाइप करके या एक ऐसी आवाज़ में बोलकर जो बिल्कुल एक असली इंसान जैसी लगती है।

यहाँ कुछ रोज़मर्रा के उदाहरणों का उपयोग करते हुए बताया गया है कि यह मॉडल क्या विशेष बनाता है:

1. "दिमाग और मुँह" की टीम (सोचने वाला और बोलने वाला)

यह मॉडल दो भागों वाले सिस्टम पर बना है जिसे Thinker (सोचने वाला) और Talker (बोलने वाला) कहा जाता है।

  • The Thinker दिमाग है। यह वीडियो देखता है, ऑडियो सुनता है, टेक्स्ट पढ़ता है, और यह तय करता है कि क्या कहना है। यह एक फिल्म स्टूडियो में निर्देशक की तरह है जो स्क्रिप्ट और सीन का विश्लेषण कर रहा है।
  • The Talker वॉयस एक्टर है। वह निर्देशक के निर्देशों को लेता है और तुरंत वास्तविक भाषण (speech) उत्पन्न करता है।
  • जादू: पुराने मॉडल्स में, निर्देशक एक नोट लिखता था, उसे वॉयस एक्टर को सौंप देता था, और फिर वह बोलता था। इससे देरी (delay) होती थी। Qwen3.5-Omni में, निर्देशक और वॉयस एक्टर आपस में वास्तविक समय (real-time) में बात कर रहे होते हैं। जैसे ही निर्देशक के पास कोई विचार आता है, वॉयस एक्टर बोलना शुरू कर देता है, जिससे एक सहज, लो-लेटेंसी (low-latency) बातचीत बनती है।

2. "सुपर-लॉन्ग मेमोरी" (256k कॉन्टेक्स्ट)

कल्पना कीजिए कि आप बिना नोट्स लिए 10 घंटे की ऑडियोबुक या 400 सेकंड की फिल्म के हर विवरण को याद रखने की कोशिश कर रहे हैं। अधिकांश AI बीच तक पहुँचते-पहुँचते शुरुआत भूल जाते हैं।

  • Qwen3.5-Omni के पास 256k का "कॉन्टेक्स्ट विंडो" है। इसे एक ऐसी याद के रूप में सोचें जो एक साथ 10 घंटे के पॉडकास्ट या एक पूरी फिल्म का ट्रांसक्रिप्ट अपने दिमाग में रख सकती है।
  • यह क्यों महत्वपूर्ण है: आप पूछ सकते हैं, "इस वीडियो के पहले 5 मिनट में दिखने वाले पात्र का नाम क्या था?" और यह इसे पूरी तरह से याद रखेगा, भले ही वीडियो एक घंटे लंबा हो।

3. "परफेक्ट सिंक" तकनीक (ARIA)

AI के लिए सबसे कठिन चीजों में से एक स्वाभाविक रूप से बोलना है। कभी-कभी वे बहुत तेज़ बोलते हैं, शब्द छोड़ देते हैं, या रोबोटिक लगते हैं क्योंकि उनका "टेक्स्ट ब्रेन" और "स्पीच माउथ" एक ही पेज पर नहीं होते।

  • यह पेपर एक नई ट्रिक पेश करता है जिसे ARIA (Adaptive Rate Interleave Alignment) कहा जाता है।
  • उदाहरण: कल्पना कीजिए कि एक ड्रमर (टेक्स्ट) और एक सिंगर (स्पीच) एक साथ बजाने की कोशिश कर रहे हैं। यदि ड्रमर तेज़ हो जाता है लेकिन सिंगर धीमा रहता है, तो संगीत अव्यवस्थित लगता है। ARIA एक कंडक्टर की तरह काम करता है जो लगातार लय (tempo) को एडजस्ट करता है, यह सुनिश्चित करता है कि शब्द और ध्वनियाँ पूरी तरह से मेल खाएं, चाहे बातचीत कितनी भी तेज़ या धीमी क्यों न हो। यह AI को अविश्वसनीय रूप से स्वाभाविक बनाता है, जिसमें सही ठहराव और भावनाएं होती हैं।

4. "गिरगिट जैसी आवाज़" (Zero-Shot Voice Cloning)

आपको AI को अपनी आवाज़ जैसा बनाने के लिए घंटों अपनी आवाज़ रिकॉर्ड करने की ज़रूरत नहीं है।

  • जादू: आप AI को अपनी आवाज़ (या किसी दोस्त की आवाज़) का 10 सेकंड का क्लिप दे सकते हैं, और यह तुरंत उस आवाज़ की सटीक नकल कर सकता है।
  • उदाहरण: यह एक मास्टर एक्टर की तरह है जो किसी सेलिब्रिटी की एक छोटी सी रिकॉर्डिंग सुनकर तुरंत उसी आवाज़, लहजे और उच्चारण में मोनोलॉग (monologue) करना शुरू कर सकता है। यह 29 से अधिक भाषाओं और विभिन्न बोलियों (जैसे बीजिंग मंदारिन से सिचुआनेज़ में बदलना) में काम करता है।

5. "वाइब कोडर" (Audio-Visual Vibe Coding)

यह एक बिल्कुल नई सुपरपावर है जिसे पेपर में Audio-Visual Vibe Coding कहा गया है।

  • परिदृश्य: कल्पना कीजिए कि आप एक बिखरे हुए कमरे का वीडियो देख रहे हैं। आप AI से कहते हैं, "हे, मेरे द्वारा दिखाए जा रहे वीडियो के आधार पर इन फाइलों को व्यवस्थित करने के लिए एक पायथन स्क्रिप्ट लिखें।"
  • परिणाम: AI वीडियो देखता है, आपके निर्देश सुनता है, दृश्य अराजकता (visual chaos) को समझता है, और उस काम को ठीक करने के लिए कोड लिखता है। यह केवल वीडियो के बारे में बात नहीं करता; यह काम करने के लिए वीडियो का उपयोग करता है। यह एक ऐसे रोबोट की तरह है जो आपको काम करते हुए देख सकता है और फिर उस कार्य को ऑटोमेट करने के लिए सॉफ्टवेयर लिख सकता है।

6. "यूनिवर्सल ट्रांसलेटर"

यह मॉडल सुनने के लिए 113 भाषाओं और बोलियों को समझता और बोलता है, और 36 भाषाओं (साथ ही कई बोलियाँ) को धाराप्रवाह बोल सकता है।

  • उदाहरण: यह एक संयुक्त राष्ट्र (UN) के दुभाषिए की तरह है जिसने दुनिया के हर देश में जीवन बिताया है। चाहे आप अंग्रेजी, स्पेनिश बोलें, या कोई विशिष्ट चीनी बोली जैसे कि होकिन (Hokkien), यह आपको समझता है और सही सांस्कृतिक बारीकियों के साथ आपकी मातृभाषा में उत्तर देता है।

यह क्यों मायने रखता है?

इससे पहले, यदि आप चाहते थे कि कोई AI वीडियो देखे, गाना सुने और उस पर आपसे बात करे, तो आपको तीन अलग-अलग टूल्स को आपस में जोड़ना पड़ता था। वे धीमे थे, बोझिल थे, और अक्सर एक-दूसरे को गलत समझ लेते थे।

Qwen3.5-Omni पहला मॉडल है जो यह सब नेटिवली (नैटिवली) एक बार में करता है। यह केवल एक चैटबॉट नहीं है; यह एक रियल-टाइम, मल्टी-सेंसरी साथी है जो यह कर सकता है:

  • एक फिल्म देख सकता है और आपके देखते समय ही कथानक (plot) समझा सकता है।
  • 10 घंटे का लेक्चर सुन सकता है और मुख्य बिंदुओं का सारांश दे सकता है।
  • अपनी आवाज़ बदलकर रोबोट, बच्चा या आपकी दादी जैसा बन सकता है।
  • जो वह आपकी स्क्रीन पर देख रहा है, उसके आधार पर कोड लिख सकता है।

संक्षेप में, Qwen3.5-Omni उस AI के सबसे करीब है जो दुनिया के साथ वैसे ही इंटरैक्ट करता है जैसे इंसान करते हैं: एक ही समय में देखकर, सुनकर, सोचकर और बोलकर।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →