InternVL-U: Democratizing Unified Multimodal Models for Understanding, Reasoning, Generation and Editing
यह शोध पत्र InternVL-U को प्रस्तुत करता है, जो एक हल्का 4B-पैरामीटर वाला एकीकृत मल्टीमॉडल मॉडल है जो एक मॉड्यूलर आर्किटेक्चर और एक रीजनिंग-केंद्रित डेटा सिंथेसिस पाइपलाइन का उपयोग करके उन्नत समझ, तर्क, सृजन और संपादन क्षमताओं का लोकतंत्रीकरण करता है, और एक बेहतर प्रदर्शन-दक्षता संतुलन प्राप्त करता है जो BAGEL जैसे काफी बड़े बेसलाइन से भी बेहतर प्रदर्शन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक शानदार आर्ट डायरेक्टर (जो दुनिया को समझता है, पहेलियाँ सुलझाता है और जटिल निर्देशों को पढ़ता है) और एक प्रतिभाशाली पेंटर (जो शून्य से सुंदर चित्र बना सकता है) है।
लंबे समय तक, ये दोनों अलग-अलग कार्यालयों में काम करते थे। आर्ट डायरेक्टर किसी दृश्य का सटीक वर्णन तो कर सकता था लेकिन उसे पेंट नहीं कर सकता था। पेंटर कुछ भी पेंट कर सकता था लेकिन वह यह नहीं समझ पाता था कि वह क्यों पेंट कर रहा है या जटिल तर्क (logic) का पालन कैसे किया जाए।
InternVL-U वह प्रोजेक्ट है जो अंततः उन्हें एक साझा स्टूडियो में लाता है जहाँ वे सहजता से मिलकर काम करते हैं। और सबसे अच्छी बात यह है कि वे यह सब एक आश्चर्यजनक रूप से छोटी टीम (केवल 4 बिलियन "ब्रेन सेल्स") के साथ करते हैं, फिर भी वे अपने से तीन गुना बड़ी टीमों से बेहतर प्रदर्शन करते हैं।
यहाँ इसका सरल विवरण दिया गया है कि उन्होंने इसे कैसे किया:
1. "स्विस आर्मी नाइफ" आर्किटेक्चर
आर्ट डायरेक्टर और पेंटर को मिलाने के पिछले अधिकांश प्रयास एक हथौड़े को पेचकस की तरह काम करने के लिए मजबूर करने जैसे थे। या तो वे पूरी टीम से सब कुछ एक ही तरीके से करवाने की कोशिश करते थे (जिससे वे धीमे और अनाड़ी हो जाते थे) या बस दो अलग-अलग टीमों को आपस में जोड़ देते थे (जिससे संचार अव्यवस्थित हो जाता था)।
InternVL-U एक स्मार्ट डिज़ाइन का उपयोग करता है:
- दिमाग (द बैकबोन): यह हिस्सा आर्ट डायरेक्टर है। यह आपके टेक्स्ट को पढ़ता है, तर्क को समझता है, और पता लगाता है कि क्या करने की आवश्यकता है। यह तर्क लगाने में माहिर है लेकिन पेंटिंग करने में कमजोर है।
- हाथ (द जनरेशन हेड): यह दिमाग से जुड़ा एक विशेष पेंटर है। यह दिमाग की तरह "सोचने" की कोशिश नहीं करता; यह केवल इस पर ध्यान केंद्रित करता है कि पिक्सेल एकदम सही दिखें।
- सीक्रेट सॉस: वे एक "डिकपल्ड" (decoupled) दृष्टिकोण का उपयोग करते हैं। दिमाग किसी छवि को समझने के लिए उसे देखता है (जैसे नक्शा पढ़ना), जबकि हाथ किसी छवि को पुनर्निर्मित करने के लिए उसे देखते हैं (जैसे नक्शा बनाना)। वे दिमाग को पेंटर का काम करने के लिए मजबूर नहीं करते, जिससे पूरा सिस्टम तेज़ और कुशल बना रहता है।
2. "रीजनिंग शेफ" (चेन-ऑफ-थॉट)
कल्पना कीजिए कि आपने एक शेफ से पूछा: "मेरे लिए एक केक बनाओ।"
- पुराने मॉडल्स: वे शायद एक केक बना देंगे, लेकिन वह जला हुआ, गलत स्वाद वाला, या फ्रॉस्टिंग के बिना हो सकता था क्योंकि उन्होंने विवरणों पर ध्यान नहीं दिया।
- InternVL-U: व्हिस्क उठाने से पहले, यह सोचता है: "ठीक है, यूजर एक केक चाहता है। पहले, मुझे स्पंज बेक करने की जरूरत है। फिर, मुझे चॉकलेट फ्रॉस्टिंग मिलानी होगी। अंत में, मुझे लाल आइसिंग में 'हैप्पी बर्थडे' लिखना होगा।"
इसे चेन-ऑफ-थॉट (CoT) कहा जाता है। मॉडल इमेज बनाने से पहले आपके अस्पष्ट अनुरोध को स्टेप-बाय-स्टेप रेसिपी में तोड़ देता है। यही कारण है कि यह इसमें बहुत अच्छा है:
- इमेज में टेक्स्ट लिखना: यह केवल अक्षर नहीं लिखता; यह स्पेसिंग, फोंट और व्याकरण को समझता है।
- विज्ञान और गणित: यदि आप इसे भौतिकी (physics) का आरेख बनाने के लिए कहते हैं, तो यह पहले बलों (forces) की गणना करता है, फिर सही ढंग से तीर (arrows) बनाता है।
- लॉजिक पजल्स: यदि आप इसे इमेज में सुडोकू पहेली को ठीक करने के लिए कहते हैं, तो यह नंबर भरने से पहले गणित को हल करता है।
3. "सुपर-स्कूल" ट्रेनिंग
इस टीम को काम करने के योग्य बनाने के लिए, शोधकर्ताओं ने उन्हें केवल बिल्लियों और कुत्तों की रैंडम तस्वीरें नहीं दिखाईं। उन्होंने एक विशेष प्रशिक्षण पाठ्यक्रम (curriculum) बनाया:
- "टेक्स्ट" क्लास: उन्होंने साइन बोर्ड, मेनू और ब्लैकबोर्ड पर शब्द लिखने का अभ्यास किया जब तक कि वे इसमें परफेक्ट नहीं हो गए।
- "साइंस" क्लास: उन्होंने रासायनिक अणुओं (molecules), ज्यामितीय आकृतियों और कंप्यूटर कोड डायग्राम को सटीक रूप से बनाना सीखा।
- "मीम" क्लास: उन्होंने हास्य, व्यंग्य और चित्रों में मज़ेदार कैप्शन जोड़ने के तरीके को समझना सीखा।
- "लॉजिक" क्लास: उन्होंने सख्त नियमों के आधार पर इमेज को एडिट करने का अभ्यास किया (जैसे, "इस ऑब्जेक्ट को 90 डिग्री घुमाएं लेकिन बैकग्राउंड को बिल्कुल वैसा ही रखें")।
4. परिणाम: बड़ी शक्ति, छोटा आकार
InternVL-U के बारे में सबसे प्रभावशाली बात इसकी क्षमता (efficiency) है।
- प्रतिद्वंद्वी: अन्य कई "यूनिफाइड" मॉडल्स विशाल क्रूज जहाजों की तरह हैं। वे बहुत बड़े (14B+ पैरामीटर्स) हैं, चलाने में महंगे हैं, और कभी-कभी सरल निर्देशों का पालन करने में संघर्ष करते हैं।
- InternVL-U: यह एक हाई-स्पीड स्पीडबोट की तरह है। यह बहुत छोटा (4B पैरामीटर्स) है लेकिन उन विशाल जहाजों की तुलना में तेज़, चलाने में सस्ता और वास्तव में निर्देशों का पालन करने में बेहतर है।
संक्षेप में:
InternVL-U एक हल्का, स्मार्ट AI है जो केवल यह "अनुमान" नहीं लगाता कि एक इमेज कैसी दिखनी चाहिए। यह अनुरोध के बारे में सोचता है, चरणों की योजना बनाता है, और फिर एक वैज्ञानिक की सटीकता और एक कलाकार की रचनात्मकता के साथ निर्माण को निष्पादित करता है। यह साबित करता है कि जीनियस होने के लिए आपको एक विशाल मस्तिष्क की आवश्यकता नहीं है; आपको बस सोचने के सही तरीके की आवश्यकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।