Nemotron 3 Nano Omni: Efficient and Open Multimodal Intelligence
नेमोट्रोन 3 नैनो ओम्नी (Nemotron 3 Nano Omni) एक नया ओपन-सोर्स मल्टीमॉडल मॉडल है जो मूल रूप से ऑडियो, टेक्स्ट, इमेज और वीडियो इनपुट का समर्थन करता है, जो 30B-A3B बैकबोन और टोकन-रिडक्शन तकनीकों के माध्यम से बेहतर सटीकता, एजेंटिक क्षमताएं और कुशल इन्फरेंस प्रदान करता है, जिसके चेकपॉइंट्स और कोड को आगे के अनुसंधान के समर्थन के लिए जारी किया गया है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि एक सुपर-स्मार्ट असिस्टेंट है जिसने अपना पूरा जीवन किताबें पढ़ने और तस्वीरें देखने में बिताया है। वह टेक्स्ट और इमेज के मामले में बहुत बुद्धिमान है, लेकिन यदि आप उससे बात करने की कोशिश करेंगे या उसे आवाज़ के साथ कोई वीडियो दिखाएंगे, तो वह भ्रमित हो जाएगा।
Nemotron 3 Nano Omni NVIDIA का इस असिस्टेंट का नया संस्करण है। यह उस असिस्टेंट को कान और एक वीडियो कैमरा देने जैसा है, साथ ही उसे जानकारी को बहुत तेज़ी से और कुशलता से प्रोसेस करना सिखाने जैसा भी है।
यहाँ एक सरल विवरण दिया गया है कि यह नया मॉडल क्या बनाता है, जिसमें रोजमर्रा के उपमाओं (analogies) का उपयोग किया गया है:
1. "ऑल-इन-वन" अपग्रेड
इससे पहले, यह असिस्टेंट (Nemotron Nano V2) केवल टेक्स्ट पढ़ सकता था और स्थिर तस्वीरें देख सकता था। नया Nemotron 3 Nano Omni "ओम्नी-मोडल" (omni-modal) है, जो एक फैंसी तरीका है यह कहने का कि यह सब कुछ एक साथ संभाल सकता है: टेक्स्ट, इमेज, वीडियो और ऑडियो।
- उपमा: पुराने मॉडल को एक ऐसे लाइब्रेरियन के रूप में सोचें जो केवल किताबें पढ़ सकता है। नया मॉडल एक ऐसा लाइब्रेरियन है जो किताबें पढ़ सकता है, फिल्में देख सकता है, पॉडकास्ट सुन सकता है, और फिर आपको बता सकता है कि वे सभी चीजें आपस में कैसे जुड़ी हैं।
2. "दिमाग" और "इंद्रियां"
यह मॉडल एक बहुत ही कुशल दिमाग पर बना है जिसे Nemotron 3 Nano 30B-A3B कहा जाता है। यह दिमाग एक "मिक्सचर ऑफ एक्सपर्ट्स" (Mixture of Experts - MoE) है, जो विशेषज्ञों की एक टीम की तरह है जहाँ किसी विशिष्ट समस्या को हल करने के लिए केवल सही विशेषज्ञ ही जागते हैं, जिससे ऊर्जा की बचत होती है।
- इंद्रियां: नए इनपुट को संभालने के लिए, उन्होंने दो नए "सेंसर" जोड़े हैं:
- विज़न (दृष्टि): एक हाई-टेक कैमरा सिस्टम (C-RADIOv4-H) जो इमेज और वीडियो को देखता है।
- हियरिंग (श्रवण): एक परिष्कृत कान (Parakeet-TDT) जो स्पीच, संगीत और पर्यावरणीय ध्वनियों को समझता है।
3. देखने और सुनने के स्मार्ट तरीके
पेपर इस बात पर प्रकाश डालता है कि मॉडल तीन चतुर तरकीबों का उपयोग करता है ताकि बहुत अधिक डेटा से वह अभिभूत (overwhelmed) न हो जाए:
- डायनेमिक रेजोल्यूशन (एक लचीला लेंस): हर फोटो को एक छोटे, निश्चित वर्ग में सिकोड़ने के बजाय (जिससे विवरण खो जाते हैं), मॉडल कैमरे के ज़ूम इन या ज़ूम आउट करने की तरह अपने दृश्य को एडजस्ट करता है ताकि चित्र का प्राकृतिक आकार बना रहे।
- वीडियो कंप्रेशन (टाइम-लैप्स): वीडियो देखते समय, मॉडल हर एक फ्रेम को नहीं देखता यदि वे समान हैं। यह "3D कनवल्शन" (3D Convolution) ट्रिक का उपयोग करके फ्रेम के जोड़ों को मर्ज करता है, जिससे प्रभावी रूप से प्रोसेस किए जाने वाले "फ्रेम्स" की संख्या आधी हो जाती है।
- ऑडियो चंक्स (साउंड बाइट): ऑडियो को एक विशाल शोर के ब्लॉक के रूप में सुनने के बजाय, यह ऑडियो को 30-सेकंड के क्लिप में तोड़ देता है, जिससे बातचीत के प्रवाह को समझना आसान हो जाता है।
4. "ट्रेनिंग कैंप" (इसने कैसे सीखा)
आप केवल एक कैमरा प्लग करके यह उम्मीद नहीं कर सकते कि मॉडल तुरंत फिल्में समझना शुरू कर देगा। टीम ने एक चरणबद्ध प्रशिक्षण रेसिपी (staged training recipe) का उपयोग किया, जैसे एक छात्र स्कूल में प्रगति करता है:
- चरण 0-1: सबसे पहले, उन्होंने मॉडल को चित्रों और टेक्स्ट को एक साथ समझना सिखाया।
- चरण 2-3: इसके बाद, उन्होंने इसे ऑडियो सुनना और बोलना सिखाया।
- चरण 4-6: अंत में, उन्होंने इन सबको एक साथ जोड़ दिया। उन्होंने इसे भारी मात्रा में डेटा (466 बिलियन से अधिक "टोकन" या शब्द) खिलाया जिसमें लंबे दस्तावेज़, घंटों के वीडियो और जटिल बातचीत शामिल थी।
- "रीइन्फोर्समेंट लर्निंग" चरण: प्रारंभिक प्रशिक्षण के बाद, उन्होंने "कोशिश करो, असफल हो जाओ, सफल हो जाओ" का खेल खेला। उन्होंने मॉडल को समस्याएँ दीं, जांचा कि क्या उसने सही उत्तर दिया, और तार्किक रूप से सोचने के लिए उसे पुरस्कृत किया। यह एक कोच द्वारा एथलीट के गेम वीडियो की समीक्षा करने के समान है ताकि उसकी रणनीति में सुधार किया जा सके।
5. गति और दक्षता
पेपर का सबसे बड़ा दावा यह है कि यह मॉडल अविश्वसनीय रूप से तेज़ है।
- उपमा: यदि समान आकार के अन्य मॉडल ट्रैफिक में फंसे स्पोर्ट्स कार की तरह हैं, तो Nemotron 3 Nano Omni एक हाई-स्पीड ट्रेन है। यह अनावश्यक चरणों को छोड़ने के लिए विशेष तकनीकों का उपयोग करता है, जिससे यह अपने प्रतिस्पर्धियों की तुलना में लंबे वीडियो और विशाल दस्तावेजों को बहुत तेज़ी से प्रोसेस कर सकता है।
- परिणाम: NVIDIA के नवीनतम चिप्स (B200) पर, यह समान मॉडलों की तुलना में कम मेमोरी का उपयोग करते हुए 3 से 9 गुना तेज़ी से टेक्स्ट आउटपुट दे सकता है।
6. यह वास्तव में क्या कर सकता है (पेपर के आधार पर)
पेपर में इस मॉडल का परीक्षण विशिष्ट चुनौतियों पर किया गया, और इसने बहुत अच्छा प्रदर्शन किया:
- दस्तावेज़ पढ़ना: यह जटिल चार्ट, टेबल और लंबी रिपोर्ट (जैसे वित्तीय कागजात) को पिछले संस्करणों की तुलना में बेहतर समझ सकता है।
- वीडियो को समझना: यह ध्वनि के साथ एक लंबा वीडियो देख सकता है और क्या हुआ, क्यों हुआ, और घटनाओं के क्रम के बारे में उत्तर दे सकता है।
- कंप्यूटर कंट्रोल: यह कंप्यूटर स्क्रीन (GUI) को देख सकता है और किसी कार्य को पूरा करने के लिए (जैसे उड़ान बुक करना या फॉर्म भरना) कौन से बटन क्लिक करने हैं, यह पता लगा सकता है।
- वॉयस इंटरेक्शन: यह बातचीत कर सकता है, लहजे (accents) को समझ सकता है, और जो उसने सुना है उसके आधार पर प्रश्नों के उत्तर दे सकता है।
7. सबके लिए खुला
अंत में, पेपर घोषणा करता है कि NVIDIA "ब्लूप्रिंट" और "प्रशिक्षण सामग्री" साझा कर रहा है। वे मॉडल को विभिन्न आकारों (स्टैंडर्ड, कंप्रेस्ड और अल्ट्रा-कंप्रेस्ड) में रिलीज़ कर रहे हैं और यहाँ तक कि उस डेटा और कोड को भी साझा कर रहे हैं जिसका उपयोग उन्होंने इसे बनाने के लिए किया था। यह पूरी दुनिया को रेसिपी और सामग्री देने जैसा है ताकि अन्य वैज्ञानिक अपने स्वयं के संस्करण बना सकें या उनमें सुधार कर सकें।
संक्षेप में: Nemotron 3 Nano Omni एक तेज़, स्मार्ट, बहु-संवेदी (multi-sensory) असिस्टेंट है जो एक साथ पढ़ सकता है, देख सकता है और सुन सकता है, जिसे बिना थके लंबे और जटिल कार्यों को संभालने के लिए डिज़ाइन किया गया है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।