← नवीनतम पेपर
🤖 machine learning

Nemotron 3 Nano Omni: Efficient and Open Multimodal Intelligence

नेमोट्रोन 3 नैनो ओम्नी (Nemotron 3 Nano Omni) एक नया ओपन-सोर्स मल्टीमॉडल मॉडल है जो मूल रूप से ऑडियो, टेक्स्ट, इमेज और वीडियो इनपुट का समर्थन करता है, जो 30B-A3B बैकबोन और टोकन-रिडक्शन तकनीकों के माध्यम से बेहतर सटीकता, एजेंटिक क्षमताएं और कुशल इन्फरेंस प्रदान करता है, जिसके चेकपॉइंट्स और कोड को आगे के अनुसंधान के समर्थन के लिए जारी किया गया है।

मूल लेखक: NVIDIA, :, Amala Sanjay Deshmukh, Kateryna Chumachenko, Tuomas Rintamaki, Matthieu Le, Tyler Poon, Danial Mohseni Taheri, Ilia Karmanov, Guilin Liu, Jarno Seppanen, Arushi Goel, Mike Ranzinger, Greg
प्रकाशित 2026-04-29
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: NVIDIA, :, Amala Sanjay Deshmukh, Kateryna Chumachenko, Tuomas Rintamaki, Matthieu Le, Tyler Poon, Danial Mohseni Taheri, Ilia Karmanov, Guilin Liu, Jarno Seppanen, Arushi Goel, Mike Ranzinger, Greg Heinrich, Guo Chen, Lukas Voegtle, Philipp Fischer, Timo Roman, Karan Sapra, Collin McCarthy, Shaokun Zhang, Fuxiao Liu, Hanrong Ye, Yi Dong, Mingjie Liu, Yifan Peng, Piotr Zelasko, Zhehuai Chen, Nithin Rao Koluguri, Nune Tadevosyan, Lilit Grigoryan, Ehsan Hosseini Asl, Pritam Biswas, Leili Tavabi, Yuanhang Su, Zhiding Yu, Peter Jin, Alexandre Milesi, Netanel Haber, Yao Xu, Sarah Amiraslani, Nabin Mulepati, Eric Tramel, Jaehun Jung, Ximing Lu, Brandon Cui, Jin Xu, Zhiqi Li, Shihao Wang, Yuanguo Kuang, Shaokun Zhang, Huck Yang, Boyi Li, Hongxu Yin, Song Han, Pavlo Molchanov, Adi Renduchintala, Charles Wang, David Mosallanezhad, Soumye Singhal, Luis Vega, Katherine Cheung, Sreyan Ghosh, Yian Zhang, Alexander Bukharin, Venkat Srinivasan, Johnny Greco, Andre Manoel, Maarten Van Segbroeck, Suseella Panguliri, Rohit Watve, Divyanshu Kakwani, Shubham Pachori, Jeffrey Glick, Radha Sri-Tharan, Aileen Zaman, Khanh Nguyen, Shi Chen, Jiaheng Fang, Qing Miao, Wenfei Zhou, Yu Wang, Zaid Pervaiz Bhat, Varun Praveen, Arihant Jain, Ramanathan Arunachalam, Tomasz Kornuta, Ashton Sharabiani, Amy Shen, Wei Huang, Yi-Fu Wu, Ali Roshan Ghias, Huiying Li, Brian Yu, Nima Tajbakhsh, Chen Cui, Wenwen Gao, Li Ding, Terry Kong, Manoj Kilaru, Anahita Bhiwandiwalla, Marek Wawrzos, Daniel Korzekwa, Pablo Ribalta, Grzegorz Chlebus, Besmira Nushi, Ewa Dobrowolska, Maciej Jakub Mikulski, Kunal Dhawan, Steve Huang, Jagadeesh Balam, Yongqiang Wang, Nikolay Karpov, Valentin Mendelev, George Zelenfroynd, Meline Mkrtchyan, Qing Miao, Omri Almog, Bhavesh Pawar, Rameshwar Shivbhakta, Sudeep Sabnis, Ashrton Sharabiani, Negar Habibi, Geethapriya Venkataramani, Pamela Peng, Prerit Rodney, Serge Panev, Richard Mazzarese, Nicky Liu, Michael Fukuyama, Andrii Skliar, Roger Waleffe, Duncan Riach, Yunheng Zou, Jian Hu, Hao Zhang, Binfeng Xu, Yuhao Yang, Zuhair Ahmed, Alexandre Milesi, Carlo del Mundo, Chad Voegele, Zhiyu Cheng, Nave Assaf, Andrii Skliar, Daniel Afrimi, Natan Bagrov, Ran Zilberstein, Ofri Masad, Eugene Khvedchenia, Natan Bagrov, Borys Tymchenko, Tomer Asida, Daniel Afrimi, Parth Mannan, Victor Cui, Michael Evans, Katherine Luna, Jie Lou, Pinky Xu, Guyue Huang, Negar Habibi, Michael Boone, Pradeep Thalasta, Adeola Adesoba, Dina Yared, Christopher Parisien, Leon Derczynski, Shaona Ghosh, Wes Feely, Micah Schaffer, Radha Sri-Tharan, Jeffrey Glick, Barnaby Simkin, George Zelenfroynd, Tomasz Grzegorzek, Rishabh Garg, Aastha Jhunjhunwala, Sergei Kolchenko, Farzan Memarian, Haran Kumar, Shiv Kumar, Isabel Hulseman, Anjali Shah, Kari Briski, Padmavathy Subramanian, Joey Conway, Udi Karpas, Jane Polak Scowcroft, Annie Surla, Shilpa Ammireddy, Ellie Evans, Jesse Oliver, Tom Balough, Chia-Chih Chen, Sandip Bhaskar, Alejandra Rico, Bardiya Sadeghi, Seph Mard, Katherine Cheung, Meredith Price, Laya Sleiman, Saori Kaji, Wesley Helmholz, Wendy Quan, Michael Lightstone, Jonathan Cohen, Jian Zhang, Oleksii Kuchaiev, Boris Ginsburg, Jan Kautz, Eileen Long, Mohammad Shoeybi, Mostofa Patwary, Oluwatobi Olabiyi, Andrew Tao, Bryan Catanzaro, Udi Karpas

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक सुपर-स्मार्ट असिस्टेंट है जिसने अपना पूरा जीवन किताबें पढ़ने और तस्वीरें देखने में बिताया है। वह टेक्स्ट और इमेज के मामले में बहुत बुद्धिमान है, लेकिन यदि आप उससे बात करने की कोशिश करेंगे या उसे आवाज़ के साथ कोई वीडियो दिखाएंगे, तो वह भ्रमित हो जाएगा।

Nemotron 3 Nano Omni NVIDIA का इस असिस्टेंट का नया संस्करण है। यह उस असिस्टेंट को कान और एक वीडियो कैमरा देने जैसा है, साथ ही उसे जानकारी को बहुत तेज़ी से और कुशलता से प्रोसेस करना सिखाने जैसा भी है।

यहाँ एक सरल विवरण दिया गया है कि यह नया मॉडल क्या बनाता है, जिसमें रोजमर्रा के उपमाओं (analogies) का उपयोग किया गया है:

1. "ऑल-इन-वन" अपग्रेड

इससे पहले, यह असिस्टेंट (Nemotron Nano V2) केवल टेक्स्ट पढ़ सकता था और स्थिर तस्वीरें देख सकता था। नया Nemotron 3 Nano Omni "ओम्नी-मोडल" (omni-modal) है, जो एक फैंसी तरीका है यह कहने का कि यह सब कुछ एक साथ संभाल सकता है: टेक्स्ट, इमेज, वीडियो और ऑडियो

  • उपमा: पुराने मॉडल को एक ऐसे लाइब्रेरियन के रूप में सोचें जो केवल किताबें पढ़ सकता है। नया मॉडल एक ऐसा लाइब्रेरियन है जो किताबें पढ़ सकता है, फिल्में देख सकता है, पॉडकास्ट सुन सकता है, और फिर आपको बता सकता है कि वे सभी चीजें आपस में कैसे जुड़ी हैं।

2. "दिमाग" और "इंद्रियां"

यह मॉडल एक बहुत ही कुशल दिमाग पर बना है जिसे Nemotron 3 Nano 30B-A3B कहा जाता है। यह दिमाग एक "मिक्सचर ऑफ एक्सपर्ट्स" (Mixture of Experts - MoE) है, जो विशेषज्ञों की एक टीम की तरह है जहाँ किसी विशिष्ट समस्या को हल करने के लिए केवल सही विशेषज्ञ ही जागते हैं, जिससे ऊर्जा की बचत होती है।

  • इंद्रियां: नए इनपुट को संभालने के लिए, उन्होंने दो नए "सेंसर" जोड़े हैं:
    • विज़न (दृष्टि): एक हाई-टेक कैमरा सिस्टम (C-RADIOv4-H) जो इमेज और वीडियो को देखता है।
    • हियरिंग (श्रवण): एक परिष्कृत कान (Parakeet-TDT) जो स्पीच, संगीत और पर्यावरणीय ध्वनियों को समझता है।

3. देखने और सुनने के स्मार्ट तरीके

पेपर इस बात पर प्रकाश डालता है कि मॉडल तीन चतुर तरकीबों का उपयोग करता है ताकि बहुत अधिक डेटा से वह अभिभूत (overwhelmed) न हो जाए:

  • डायनेमिक रेजोल्यूशन (एक लचीला लेंस): हर फोटो को एक छोटे, निश्चित वर्ग में सिकोड़ने के बजाय (जिससे विवरण खो जाते हैं), मॉडल कैमरे के ज़ूम इन या ज़ूम आउट करने की तरह अपने दृश्य को एडजस्ट करता है ताकि चित्र का प्राकृतिक आकार बना रहे।
  • वीडियो कंप्रेशन (टाइम-लैप्स): वीडियो देखते समय, मॉडल हर एक फ्रेम को नहीं देखता यदि वे समान हैं। यह "3D कनवल्शन" (3D Convolution) ट्रिक का उपयोग करके फ्रेम के जोड़ों को मर्ज करता है, जिससे प्रभावी रूप से प्रोसेस किए जाने वाले "फ्रेम्स" की संख्या आधी हो जाती है।
  • ऑडियो चंक्स (साउंड बाइट): ऑडियो को एक विशाल शोर के ब्लॉक के रूप में सुनने के बजाय, यह ऑडियो को 30-सेकंड के क्लिप में तोड़ देता है, जिससे बातचीत के प्रवाह को समझना आसान हो जाता है।

4. "ट्रेनिंग कैंप" (इसने कैसे सीखा)

आप केवल एक कैमरा प्लग करके यह उम्मीद नहीं कर सकते कि मॉडल तुरंत फिल्में समझना शुरू कर देगा। टीम ने एक चरणबद्ध प्रशिक्षण रेसिपी (staged training recipe) का उपयोग किया, जैसे एक छात्र स्कूल में प्रगति करता है:

  • चरण 0-1: सबसे पहले, उन्होंने मॉडल को चित्रों और टेक्स्ट को एक साथ समझना सिखाया।
  • चरण 2-3: इसके बाद, उन्होंने इसे ऑडियो सुनना और बोलना सिखाया।
  • चरण 4-6: अंत में, उन्होंने इन सबको एक साथ जोड़ दिया। उन्होंने इसे भारी मात्रा में डेटा (466 बिलियन से अधिक "टोकन" या शब्द) खिलाया जिसमें लंबे दस्तावेज़, घंटों के वीडियो और जटिल बातचीत शामिल थी।
  • "रीइन्फोर्समेंट लर्निंग" चरण: प्रारंभिक प्रशिक्षण के बाद, उन्होंने "कोशिश करो, असफल हो जाओ, सफल हो जाओ" का खेल खेला। उन्होंने मॉडल को समस्याएँ दीं, जांचा कि क्या उसने सही उत्तर दिया, और तार्किक रूप से सोचने के लिए उसे पुरस्कृत किया। यह एक कोच द्वारा एथलीट के गेम वीडियो की समीक्षा करने के समान है ताकि उसकी रणनीति में सुधार किया जा सके।

5. गति और दक्षता

पेपर का सबसे बड़ा दावा यह है कि यह मॉडल अविश्वसनीय रूप से तेज़ है।

  • उपमा: यदि समान आकार के अन्य मॉडल ट्रैफिक में फंसे स्पोर्ट्स कार की तरह हैं, तो Nemotron 3 Nano Omni एक हाई-स्पीड ट्रेन है। यह अनावश्यक चरणों को छोड़ने के लिए विशेष तकनीकों का उपयोग करता है, जिससे यह अपने प्रतिस्पर्धियों की तुलना में लंबे वीडियो और विशाल दस्तावेजों को बहुत तेज़ी से प्रोसेस कर सकता है।
  • परिणाम: NVIDIA के नवीनतम चिप्स (B200) पर, यह समान मॉडलों की तुलना में कम मेमोरी का उपयोग करते हुए 3 से 9 गुना तेज़ी से टेक्स्ट आउटपुट दे सकता है।

6. यह वास्तव में क्या कर सकता है (पेपर के आधार पर)

पेपर में इस मॉडल का परीक्षण विशिष्ट चुनौतियों पर किया गया, और इसने बहुत अच्छा प्रदर्शन किया:

  • दस्तावेज़ पढ़ना: यह जटिल चार्ट, टेबल और लंबी रिपोर्ट (जैसे वित्तीय कागजात) को पिछले संस्करणों की तुलना में बेहतर समझ सकता है।
  • वीडियो को समझना: यह ध्वनि के साथ एक लंबा वीडियो देख सकता है और क्या हुआ, क्यों हुआ, और घटनाओं के क्रम के बारे में उत्तर दे सकता है।
  • कंप्यूटर कंट्रोल: यह कंप्यूटर स्क्रीन (GUI) को देख सकता है और किसी कार्य को पूरा करने के लिए (जैसे उड़ान बुक करना या फॉर्म भरना) कौन से बटन क्लिक करने हैं, यह पता लगा सकता है।
  • वॉयस इंटरेक्शन: यह बातचीत कर सकता है, लहजे (accents) को समझ सकता है, और जो उसने सुना है उसके आधार पर प्रश्नों के उत्तर दे सकता है।

7. सबके लिए खुला

अंत में, पेपर घोषणा करता है कि NVIDIA "ब्लूप्रिंट" और "प्रशिक्षण सामग्री" साझा कर रहा है। वे मॉडल को विभिन्न आकारों (स्टैंडर्ड, कंप्रेस्ड और अल्ट्रा-कंप्रेस्ड) में रिलीज़ कर रहे हैं और यहाँ तक कि उस डेटा और कोड को भी साझा कर रहे हैं जिसका उपयोग उन्होंने इसे बनाने के लिए किया था। यह पूरी दुनिया को रेसिपी और सामग्री देने जैसा है ताकि अन्य वैज्ञानिक अपने स्वयं के संस्करण बना सकें या उनमें सुधार कर सकें।

संक्षेप में: Nemotron 3 Nano Omni एक तेज़, स्मार्ट, बहु-संवेदी (multi-sensory) असिस्टेंट है जो एक साथ पढ़ सकता है, देख सकता है और सुन सकता है, जिसे बिना थके लंबे और जटिल कार्यों को संभालने के लिए डिज़ाइन किया गया है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →