← नवीनतम पेपर
💻 computer science

Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction

यह शोध पत्र GAS प्रस्तुत करता है, जो एक ऐसा प्रशिक्षण ढांचा है जो 'नेक्स्ट एम्बेडिंग प्रेडिक्शन' को सहायक पर्यवेक्षण के रूप में उपयोग करके एक विलगित जनरेशन शाखा (decoupled generation branch) के माध्यम से मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स में शून्य-अनुमान-ओवरहेड (zero-inference-overhead) दृश्य समझ को बढ़ाता है, ताकि अंतिम अनुमान वास्तुकला से समझौता किए बिना साझा दृश्य निरूपणों को परिष्कृत किया जा सके।

मूल लेखक: Zhongbin Guo, Jiahao Xie, Dongling Xiao, Qianle Wang, Ruiqi Lu, Xiaomin He, Wanxuan Sun, Cheng Yang

प्रकाशित 2026-08-13
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhongbin Guo, Jiahao Xie, Dongling Xiao, Qianle Wang, Ruiqi Lu, Xiaomin He, Wanxuan Sun, Cheng Yang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक प्रतिभाशाली छात्र को एक जटिल पेंटिंग समझना सिखा रहे हैं। पारंपरिक रूप से, आप उन्हें कलाकृति दिखाएंगे और उनसे उसका वर्णन लिखने के लिए कहेंगे। वे पेंटिंग के बारे में बात करना सीख जाते हैं, लेकिन उन्हें कभी वास्तव में उसे बनाने (draw करने) की आवश्यकता नहीं पड़ती। आज के अधिकांश "मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स" (MLLMs) इसी तरह काम करते हैं: वे छवियों का वर्णन करने, उनके बारें में प्रश्न पूछने और उनके आधार पर पहेलियाँ सुलझाने में शानदार होते हैं। हालाँकि, क्योंकि उन्हें केवल छवि के बारे में बोलने के लिए प्रशिक्षित किया गया है, वे कभी-कभी सूक्ष्म, सटीक विवरणों को चूक जाते हैं—जैसे कि कोई विशिष्ट वस्तु ठीक कहाँ है, या भीड़ में कितने आइटम छिपे हुए हैं। वे "सार" तो समझ लेते हैं, लेकिन बारीक विवरणों में लड़खड़ा सकते हैं।

अब, एक अलग दृष्टिकोण की कल्पना करें: क्या होगा यदि उन्हें बेहतर समझने में मदद करने के लिए, आप उनसे पेंटिंग को पुनर्निर्मित करने के लिए भी कहें? यह बहुत अधिक अतिरिक्त काम लगता है, और आपको चिंता हो सकती है कि चित्र बनाने की कोशिश उन्हें वर्णन करने से विचलित कर देगी। लेकिन क्या होगा यदि आप चित्र बनाने की प्रक्रिया का उपयोग विशुद्ध रूप से एक गुप्त प्रशिक्षण अभ्यास के रूप में करें? आप उन्हें हर पिक्सेल और स्थानिक संबंध (spatial relationship) पर ध्यान देने के लिए मजबूर कर सकते हैं ताकि चित्र सही बने, लेकिन फिर, जब प्रशिक्षण समाप्त हो जाए, तो आप ड्राइंग के औजारों को पूरी तरह से फेंक सकते हैं। छात्र के पास छवि को समझने की एक सुपर-पावर्ड क्षमता होगी, क्योंकि उन्होंने ड्राइंग के अभ्यास से सीखा है, लेकिन उन्हें फिर कभी चित्र बनाने की आवश्यकता नहीं होगी। यह GAS (जेनरेशन एज़ ऑक्जिलरी सुपरविजन) नामक एक नई विधि के पीछे का मूल विचार है।

समस्या: बात करना बनाम देखना

वर्तमान AI मॉडल उन कला समीक्षकों की तरह हैं जिन्होंने कभी ब्रश नहीं पकड़ा है। उन्हें किसी छवि के बारे में वाक्य में अगले शब्द की भविष्यवाणी करने के लिए प्रशिक्षित किया जाता है। हालांकि यह उन्हें बेहतरीन वार्ताकार बनाता है, लेकिन यह उनकी दृष्टि में एक अंतर छोड़ देता है। उनके पास सटीक आकार, सीमाएँ या स्थानिक संबंधों जैसे दृश्य विवरणों के लिए सीधा "मसल्स मेमोरी" (muscle memory) नहीं होता है। शोध पत्र का तर्क है कि केवल उन्हें बात करने के लिए प्रशिक्षित करके, हम एक विशाल दृश्य शिक्षण (visual learning) के भंडार को खो देते हैं। उन्हें दोनों कार्य (बात करना और बनाना) करने वाले मॉडल बनाने के पिछले प्रयास अक्सर विफल रहे क्योंकि "बनाने" वाला हिस्सा बहुत भारी था, जिससे मॉडल धीमा हो गया, या क्योंकि जिस तरह से वे चित्र बना रहे थे (विभिन्न प्रकार के डिजिटल "पिक्सल्स" का उपयोग करके), वह उनके सोचने के तरीके से मेल नहीं खाता था, जिससे सुधार के बजाय भ्रम पैदा हुआ।

समाधान: "घोस्ट" ड्राइंग क्लास

GAS के पीछे के शोधकर्ताओं ने एक चतुर तरकीब निकाली। उन्होंने एक विशेष प्रशिक्षण ढांचा बनाया जहाँ AI अपने सामान्य काम के साथ-साथ "चित्र बनाने" (या अधिक सटीक रूप से, छवि के डिजिटल प्रतिनिधित्व के अगले हिस्से की भविष्यवाणी करने) के बारे में सीखता है।

यहाँ उन्होंने इसे एक दो मंजिला घर के रूपक का उपयोग करके किया है:

  1. साझा नींव (द ट्रंक): दोनों "समझने" वाला AI और "बनाने" वाला AI एक ही निचली मंजिलों को साझा करते हैं। यहीं पर कच्ची दृश्य जानकारी को संसाधित किया जाता है।
  2. विभाजन (द MoT आर्किटेक्चर): जैसे-जैसे जानकारी सीढ़ियों से ऊपर जाती है, घर विभाजित हो जाता है। एक पथ "समझने" वाले कमरे की ओर जाता है (जहाँ AI प्रश्नों के उत्तर देता है), और एक समानांतर पथ "बनाने" वाले कमरे की ओर जाता है।
  3. गुप्त हथियार (NEP): ड्राइंग रूम में, AI किसी गैलरी के लिए सुंदर चित्र बनाने की कोशिश नहीं कर रहा है। इसके बजाय, यह नेक्स्ट एम्बेडिंग प्रेडिक्शन (NEP) नामक एक तकनीक का उपयोग करता है। इसे ऐसे समझें कि AI प्राप्त निर्देशों के आधार पर छवि को बनाने वाले अगले "डिजिटल लेगो ब्लॉक" का अनुमान लगाने की कोशिश कर रहा है। वह एक कलाकार बनने की कोशिश नहीं कर रहा है; वह दृश्य डेटा के एक सटीक वास्तुकार (architect) बनने की कोशिश कर रहा है।
  4. जादुई हस्तांतरण (The Magic Transfer): इन सटीक दृश्य ब्लॉकों की भविष्यवाणी करने की कोशिश करने से साझा नींव (निचली मंजिलें) अविश्वसनीय रूप से विस्तृत और तीक्ष्ण (sharp) हो जाती है। यह पहले की तुलना में दृश्य जानकारी को बहुत बेहतर तरीके से बनाए रखना सीख जाता है।
  5. जीरो-ओवरहेड ट्विस्ट: यह सबसे अच्छा हिस्सा है। एक बार प्रशिक्षण समाप्त हो जाने के बाद, पूरा "बनाने" वाला कमरा ध्वस्त कर दिया जाता है। AI ने सीखी हुई सुपर-शार्प नींव को रखता है, लेकिन उसके पास अब चित्र बनाने के लिए अतिरिक्त कमरा या उपकरण नहीं होते हैं। जब आप बाद में उससे कोई प्रश्न पूछते हैं, तो वह पहले की तरह ही तेज़ उत्तर देता है, लेकिन उसकी दृष्टि बहुत बेहतर होती है। शोध पत्र पुष्टि करता है कि इसमें शून्य इन्फरेंस ओवरहेड (zero inference overhead) है—इसका मतलब है कि यह AI को धीमा या भारी नहीं बनाता है।

उन्होंने क्या पाया

टीम ने 2 बिलियन और 4 बिलियन पैरामीटर्स वाले मॉडल्स पर परीक्षण किया। उन्होंने केवल अनुमान नहीं लगाया; उन्होंने यह देखने के लिए व्यापक प्रयोग किए कि क्या यह "ड्राइंग अभ्यास" उनके "समझने" के कौशल में मदद करता है।

  • विवरणों में बेहतर: GAS के साथ प्रशिक्षित मॉडल्स को उन कार्यों में काफी बेहतर पाया गया जिनमें सटीक दृष्टि की आवश्यकता होती है, जैसे वस्तुओं की गिनती करना, स्थानिक संबंधों को समझना (जैसे, "क्या लैंप टीवी से करीब है?") और जटिल आरेख (diagrams) को समझना। उदाहरण के लिए, एक काउंटिंग टेस्ट पर, 2B मॉडल 87.7 से बढ़कर 90.1 हो गया, और 4B मॉडल ने 90.8 हासिल किया।
  • यह किसी भी चरण में काम करता है: उन्होंने इसे नए AI मॉडल्स, पहले से प्री-ट्रेंड मॉडल्स और पहले से फाइन-ट्यून किए गए मॉडल्स पर आजमाया। हर मामले में, "ड्राइंग अभ्यास" ने मदद की। यह बिल्कुल नए मॉडल्स के लिए सबसे अधिक सहायक था, लेकिन पहले से ही मजबूत और स्मार्ट मॉडल्स को भी इससे बढ़ावा मिला।
  • सभी तरह की ड्राइंग समान नहीं है: उन्होंने पाया कि ड्राइंग टास्क का प्रकार मायने रखता है। केवल AI को "बिल्ली बनाने" के लिए कहना बहुत अधिक मदद नहीं करता है। लेकिन उसे जटिल निर्देशों के आधार पर चित्र बनाने के लिए कहना—जैसे "छवि के इस विशिष्ट भाग को सेगमेंट करें" या "तार्किक कारण के आधार पर इस वस्तु को संपादित करें"—ने AI को गहराई से सोचने के लिए मजबूर किया। ये "संज्ञानात्मक" (cognitive) ड्राइंग कार्य ही थे जिन्होंने उनकी समझ को वास्तव में सुपरचार्ज किया।
  • "घोस्ट" ब्रांच महत्वपूर्ण है: उन्होंने सिद्ध किया कि यदि वे ड्राइंग पथ को समझने वाले पथ से अलग नहीं करते (अपने विशेष "मिक्सचर-ऑफ-ट्रांसफॉर्मर्स" डिज़ाइन का उपयोग करके), तो AI वास्तव में समझने में बदतर हो जाता। ड्राइंग कार्य AI को भ्रमित कर देता। सीखने की प्रक्रिया को बिना सोचने की प्रक्रिया को बाधित किए, नींव में "सोखने" देने के लिए यह अलगाव (separation) अत्यंत महत्वपूर्ण था।

यह क्यों मायने रखता है

शोध पत्र सुझाव देता है कि हमें बेहतर दृष्टि प्राप्त करने के लिए विशाल, धीमे AI सिस्टम बनाने की आवश्यकता नहीं है जो बोल और बना दोनों सकें। इसके बजाय, हम जेनरेशन (उत्पादन) की प्रक्रिया को एक गुप्त प्रशिक्षण उपकरण के रूप में उपयोग कर सकते हैं। AI को प्रशिक्षण के दौरान विशिष्ट, संरचित तरीके से दृश्य विवरणों की भविष्यवाणी करने के लिए मजबूर करके, हमें एक ऐसा मॉडल मिलता है जिसकी आँखें बहुत अधिक तीक्ष्ण होती हैं, लेकिन वह पहले की तरह ही तेज़ चलता है।

शोधकर्ताओं ने पाया कि यह दृष्टिकोण विभिन्न मॉडल आकारों और प्रशिक्षण चरणों में काम करता है, जो बताता है कि यह दृश्य बुद्धिमत्ता को बढ़ाने का एक विश्वसनीय तरीका है। उन्होंने यह भी दिखाया कि AI ने केवल टेक्स्ट के साथ तर्क करने की अपनी क्षमता नहीं खोई; वास्तव में, इसमें थोड़ा सुधार भी हुआ। शोध पत्र निष्कर्ष निकालता है कि जेनरेशन-गाइडेड ट्रेनिंग मल्टीमॉडल समझ को मजबूत करने के लिए एक व्यावहारिक, कुशल मार्ग है, जो इस समस्या का समाधान करता है कि AI को बिना "धीमा" किए बेहतर कैसे देखा जाए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →