← नवीनतम पेपर
💻 computer science

InternVL-U: Democratizing Unified Multimodal Models for Understanding, Reasoning, Generation and Editing

यह शोध पत्र InternVL-U को प्रस्तुत करता है, जो एक हल्का 4B-पैरामीटर वाला एकीकृत मल्टीमॉडल मॉडल है जो एक मॉड्यूलर आर्किटेक्चर और एक रीजनिंग-केंद्रित डेटा सिंथेसिस पाइपलाइन का उपयोग करके उन्नत समझ, तर्क, सृजन और संपादन क्षमताओं का लोकतंत्रीकरण करता है, और एक बेहतर प्रदर्शन-दक्षता संतुलन प्राप्त करता है जो BAGEL जैसे काफी बड़े बेसलाइन से भी बेहतर प्रदर्शन करता है।

मूल लेखक: Changyao Tian, Danni Yang, Guanzhou Chen, Erfei Cui, Zhaokai Wang, Yuchen Duan, Penghao Yin, Sitao Chen, Ganlin Yang, Mingxin Liu, Zirun Zhu, Ziqian Fan, Leyao Gu, Haomin Wang, Qi Wei, Jinhui Yin, Xue
प्रकाशित 2026-03-11
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Changyao Tian, Danni Yang, Guanzhou Chen, Erfei Cui, Zhaokai Wang, Yuchen Duan, Penghao Yin, Sitao Chen, Ganlin Yang, Mingxin Liu, Zirun Zhu, Ziqian Fan, Leyao Gu, Haomin Wang, Qi Wei, Jinhui Yin, Xue Yang, Zhihang Zhong, Qi Qin, Yi Xin, Bin Fu, Yihao Liu, Jiaye Ge, Qipeng Guo, Gen Luo, Hongsheng Li, Yu Qiao, Kai Chen, Hongjie Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक शानदार आर्ट डायरेक्टर (जो दुनिया को समझता है, पहेलियाँ सुलझाता है और जटिल निर्देशों को पढ़ता है) और एक प्रतिभाशाली पेंटर (जो शून्य से सुंदर चित्र बना सकता है) है।

लंबे समय तक, ये दोनों अलग-अलग कार्यालयों में काम करते थे। आर्ट डायरेक्टर किसी दृश्य का सटीक वर्णन तो कर सकता था लेकिन उसे पेंट नहीं कर सकता था। पेंटर कुछ भी पेंट कर सकता था लेकिन वह यह नहीं समझ पाता था कि वह क्यों पेंट कर रहा है या जटिल तर्क (logic) का पालन कैसे किया जाए।

InternVL-U वह प्रोजेक्ट है जो अंततः उन्हें एक साझा स्टूडियो में लाता है जहाँ वे सहजता से मिलकर काम करते हैं। और सबसे अच्छी बात यह है कि वे यह सब एक आश्चर्यजनक रूप से छोटी टीम (केवल 4 बिलियन "ब्रेन सेल्स") के साथ करते हैं, फिर भी वे अपने से तीन गुना बड़ी टीमों से बेहतर प्रदर्शन करते हैं।

यहाँ इसका सरल विवरण दिया गया है कि उन्होंने इसे कैसे किया:

1. "स्विस आर्मी नाइफ" आर्किटेक्चर

आर्ट डायरेक्टर और पेंटर को मिलाने के पिछले अधिकांश प्रयास एक हथौड़े को पेचकस की तरह काम करने के लिए मजबूर करने जैसे थे। या तो वे पूरी टीम से सब कुछ एक ही तरीके से करवाने की कोशिश करते थे (जिससे वे धीमे और अनाड़ी हो जाते थे) या बस दो अलग-अलग टीमों को आपस में जोड़ देते थे (जिससे संचार अव्यवस्थित हो जाता था)।

InternVL-U एक स्मार्ट डिज़ाइन का उपयोग करता है:

  • दिमाग (द बैकबोन): यह हिस्सा आर्ट डायरेक्टर है। यह आपके टेक्स्ट को पढ़ता है, तर्क को समझता है, और पता लगाता है कि क्या करने की आवश्यकता है। यह तर्क लगाने में माहिर है लेकिन पेंटिंग करने में कमजोर है।
  • हाथ (द जनरेशन हेड): यह दिमाग से जुड़ा एक विशेष पेंटर है। यह दिमाग की तरह "सोचने" की कोशिश नहीं करता; यह केवल इस पर ध्यान केंद्रित करता है कि पिक्सेल एकदम सही दिखें।
  • सीक्रेट सॉस: वे एक "डिकपल्ड" (decoupled) दृष्टिकोण का उपयोग करते हैं। दिमाग किसी छवि को समझने के लिए उसे देखता है (जैसे नक्शा पढ़ना), जबकि हाथ किसी छवि को पुनर्निर्मित करने के लिए उसे देखते हैं (जैसे नक्शा बनाना)। वे दिमाग को पेंटर का काम करने के लिए मजबूर नहीं करते, जिससे पूरा सिस्टम तेज़ और कुशल बना रहता है।

2. "रीजनिंग शेफ" (चेन-ऑफ-थॉट)

कल्पना कीजिए कि आपने एक शेफ से पूछा: "मेरे लिए एक केक बनाओ।"

  • पुराने मॉडल्स: वे शायद एक केक बना देंगे, लेकिन वह जला हुआ, गलत स्वाद वाला, या फ्रॉस्टिंग के बिना हो सकता था क्योंकि उन्होंने विवरणों पर ध्यान नहीं दिया।
  • InternVL-U: व्हिस्क उठाने से पहले, यह सोचता है: "ठीक है, यूजर एक केक चाहता है। पहले, मुझे स्पंज बेक करने की जरूरत है। फिर, मुझे चॉकलेट फ्रॉस्टिंग मिलानी होगी। अंत में, मुझे लाल आइसिंग में 'हैप्पी बर्थडे' लिखना होगा।"

इसे चेन-ऑफ-थॉट (CoT) कहा जाता है। मॉडल इमेज बनाने से पहले आपके अस्पष्ट अनुरोध को स्टेप-बाय-स्टेप रेसिपी में तोड़ देता है। यही कारण है कि यह इसमें बहुत अच्छा है:

  • इमेज में टेक्स्ट लिखना: यह केवल अक्षर नहीं लिखता; यह स्पेसिंग, फोंट और व्याकरण को समझता है।
  • विज्ञान और गणित: यदि आप इसे भौतिकी (physics) का आरेख बनाने के लिए कहते हैं, तो यह पहले बलों (forces) की गणना करता है, फिर सही ढंग से तीर (arrows) बनाता है।
  • लॉजिक पजल्स: यदि आप इसे इमेज में सुडोकू पहेली को ठीक करने के लिए कहते हैं, तो यह नंबर भरने से पहले गणित को हल करता है।

3. "सुपर-स्कूल" ट्रेनिंग

इस टीम को काम करने के योग्य बनाने के लिए, शोधकर्ताओं ने उन्हें केवल बिल्लियों और कुत्तों की रैंडम तस्वीरें नहीं दिखाईं। उन्होंने एक विशेष प्रशिक्षण पाठ्यक्रम (curriculum) बनाया:

  • "टेक्स्ट" क्लास: उन्होंने साइन बोर्ड, मेनू और ब्लैकबोर्ड पर शब्द लिखने का अभ्यास किया जब तक कि वे इसमें परफेक्ट नहीं हो गए।
  • "साइंस" क्लास: उन्होंने रासायनिक अणुओं (molecules), ज्यामितीय आकृतियों और कंप्यूटर कोड डायग्राम को सटीक रूप से बनाना सीखा।
  • "मीम" क्लास: उन्होंने हास्य, व्यंग्य और चित्रों में मज़ेदार कैप्शन जोड़ने के तरीके को समझना सीखा।
  • "लॉजिक" क्लास: उन्होंने सख्त नियमों के आधार पर इमेज को एडिट करने का अभ्यास किया (जैसे, "इस ऑब्जेक्ट को 90 डिग्री घुमाएं लेकिन बैकग्राउंड को बिल्कुल वैसा ही रखें")।

4. परिणाम: बड़ी शक्ति, छोटा आकार

InternVL-U के बारे में सबसे प्रभावशाली बात इसकी क्षमता (efficiency) है।

  • प्रतिद्वंद्वी: अन्य कई "यूनिफाइड" मॉडल्स विशाल क्रूज जहाजों की तरह हैं। वे बहुत बड़े (14B+ पैरामीटर्स) हैं, चलाने में महंगे हैं, और कभी-कभी सरल निर्देशों का पालन करने में संघर्ष करते हैं।
  • InternVL-U: यह एक हाई-स्पीड स्पीडबोट की तरह है। यह बहुत छोटा (4B पैरामीटर्स) है लेकिन उन विशाल जहाजों की तुलना में तेज़, चलाने में सस्ता और वास्तव में निर्देशों का पालन करने में बेहतर है।

संक्षेप में:
InternVL-U एक हल्का, स्मार्ट AI है जो केवल यह "अनुमान" नहीं लगाता कि एक इमेज कैसी दिखनी चाहिए। यह अनुरोध के बारे में सोचता है, चरणों की योजना बनाता है, और फिर एक वैज्ञानिक की सटीकता और एक कलाकार की रचनात्मकता के साथ निर्माण को निष्पादित करता है। यह साबित करता है कि जीनियस होने के लिए आपको एक विशाल मस्तिष्क की आवश्यकता नहीं है; आपको बस सोचने के सही तरीके की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →