← नवीनतम पेपर
💻 computer science

REGLUE Your Latents with Global and Local Semantics for Entangled Diffusion

REGLUE एक एकीकृत लेटेंट डिफ्यूजन फ्रेमवर्क है जो एक ही SiT बैकबोन के भीतर VAE लेटेंट्स को ग्लोबल और लोकली कंप्रेस्ड विजन फाउंडेशन मॉडल सेमेंटिक्स के साथ उलझाकर (entangling) इमेज सिंथेसिस को बढ़ाता है, जिससे मौजूदा बेसलाइन्स की तुलना में बेहतर सैंपल क्वालिटी और तेज़ कन्वर्जेंस प्राप्त होता है।

मूल लेखक: Giorgos Petsangourakis, Christos Sgouropoulos, Bill Psomas, Theodoros Giannakopoulos, Giorgos Sfikas, Ioannis Kakogeorgiou

प्रकाशित 2026-07-21
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Giorgos Petsangourakis, Christos Sgouropoulos, Bill Psomas, Theodoros Giannakopoulos, Giorgos Sfikas, Ioannis Kakogeorgiou

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को मास्टरपीस पेंट करना सिखाने की कोशिश कर रहे हैं। आप नहीं चाहते कि वह केवल एक फोटो को पिक्सेल-दर-पिक्सेल कॉपी करे; आप चाहते हैं कि वह यह समझे कि वह क्या पेंट कर रहा है। यह लेटेंट डिफ्यूजन मॉडल्स (Latent Diffusion Models) की दुनिया है, जो AI इमेज जनरेशन के वर्तमान सुपरस्टार्स हैं। इन मॉडल्स को ऐसे कलाकारों के रूप में सोचें जो एक ऐसे कैनवास से शुरुआत करते हैं जो स्टैटिक नॉइज़ (जैसे टीवी पर दिखने वाला बर्फ जैसा शोर) से ढका होता है और धीरे-धीरे, कदम-दर-कदम, इसे तब तक साफ करते हैं जब तक कि एक स्पष्ट तस्वीर उभर न आए। आमतौर पर, वे उन छवियों को फिर से बनाने (reconstruct) की कोशिश करके सीखते हैं जिन्हें उन्होंने पहले देखा है। लेकिन इसमें एक पेच है: यह "पुनर्निर्माण" (reconstruction) विधि एक शेफ को केवल अंतिम व्यंजन दिखाकर सिखाने जैसा है। शेफ अंततः स्वाद तो सीख जाता है, लेकिन रेसिपी समझने में उसे बहुत समय लगता है, और शुरुआती प्रयास थोड़े धुंधले हो सकते हैं।

चीजों को तेज करने के लिए, वैज्ञानिकों ने "विशेषज्ञ सलाहकारों" (expert consultants)—पूर्व-प्रशिक्षित विज़न फाउंडेशन मॉडल्स (VFMs)—को शामिल करना शुरू कर दिया है। ये उन सुपर-स्मार्ट आर्ट क्रिटिक्स की तरह हैं जिन्होंने लाखों पेंटिंग्स का अध्ययन किया है और तुरंत बता सकते हैं कि किसी चित्र में कुत्ता है, पेड़ है, या कोई विशिष्ट मूड है। कंप्यूटर विज्ञान के इस कोने में बड़ा सवाल यह है: हम अपने पेंटिंग करने वाले रोबोट को इन विशेषज्ञों की बात सुनने के लिए कैसे तैयार करें बिना उसे भ्रमित किए? कुछ शोधकर्ताओं ने रोबोट को केवल विशेषज्ञ का अंतिम निर्णय दिखाने की कोशिश की, जबकि अन्यों ने उसे कैनवास के हर छोटे हिस्से पर विशेषज्ञ के नोट्स खिलाने की कोशिश की। यह पेपर उस उलझे हुए मध्य मार्ग को संबोधित करता है, और यह पूछता है कि रोबोट के अपने स्केचिंग कौशल को विशेषज्ञ की विस्तृत, पैच-दर-पैच सलाह के साथ सबसे अच्छी तरह कैसे जोड़ा जाए।


समस्या: रोबोट धीमा है और विशेषज्ञ बहुत ज्यादा बोल रहा है

मिलिए REGLUE (रिप्रेजेंटेशन एंटैंगलमेंट विद ग्लोबल-लोकल यूनिफाइड एनकोडिंग) से। REGLUE के आने से पहले, AI कलाकार उन विशेषज्ञ सलाहकारों का उपयोग करने के दो मुख्य तरीके जानते थे। एक तरीका यह था कि केवल विशेषज्ञ के "बड़ी तस्वीर" वाले सारांश को सुनना (जैसे यह कहना कि "यह एक बिल्ली है")। दूसरा तरीका यह था कि विशेषज्ञ के हर एक छोटे वर्ग के नोट्स को सुनने की कोशिश करना (जैसे "यह पिक्सेल फर है, वह आंख है")।

समस्या क्या है? "बड़ी तस्वीर" वाला सारांश बारीक विवरणों में मदद करने के लिए बहुत अस्पष्ट है, और "छोटे वर्ग" वाले नोट्स अक्सर बहुत अव्यवस्थित और विशाल होते हैं जो रोबोट के दिमाग में फिट नहीं हो पाते। इन नोट्स को सरल बनाने के एक पिछले प्रयास एक हाई-डेफिनिशन मूवी को एक बेसिक ट्रांसलेटर का उपयोग करके टेक्स्ट मैसेज में सिकोड़ने की कोशिश करने जैसा था (लीनियर कंप्रेशन); आप बारीकियों को खो देते हैं, और रोबोट भ्रमित हो जाता है।

REGLUE समाधान: एक स्मार्ट ट्रांसलेटर और एक टीम हडल

इस पेपर के लेखक इस कला कक्षा को चलाने का एक नया तरीका प्रस्तावित करते हैं। वे एक लाइटवेट सिमेंटिक कंप्रेसर (lightweight semantic compressor) पेश करते हैं। कल्पना कीजिए कि यह एक सुपर-स्मार्ट, छोटा ट्रांसलेटर है जो विशेषज्ञ और रोबोट के बीच बैठता है। विशेषज्ञ के जटिल, बहु-स्तरीय अवलोकनों को केवल पूरे चित्र का सारांश बनाने या कच्चे नोट्स डालने के बजाय, यह ट्रांसलेटर उन्हें एक संक्षिप्त, व्यवस्थित "चीट शीट" में बदल देता है जिसे रोबोट वास्तव में उपयोग कर सके।

यहाँ REGLUE व्यवहार में कैसे काम करता है:

  1. टीम हडल (The Team Huddle): रोबोट केवल अपने स्केच (इमेज लेटेंट) या विशेषज्ञ के नोट्स को अलग-अलग नहीं देखता है। REGLUE उन्हें हाथ मिलाने के लिए मजबूर करता है। यह रोबोट के स्केच, विशेषज्ञ के "बड़ी तस्वीर" वाले सारांश (ग्लोबल टोकन), और विशेषज्ञ के विस्तृत "पैच-लेवल" नोट्स (लोकल सिमेंटिक्स) को लेता है और उन सभी को सूचना के एक एकल प्रवाह में मिला देता है।
  2. नॉन-लीनियर जादू (The Non-Linear Magic): मुख्य नवाचार यह है कि ट्रांसलेटर (कंप्रेसर) डेटा को सिकोड़ने के लिए केवल साधारण गणित का उपयोग नहीं करता है। यह एक नॉन-लीनियर दृष्टिकोण का उपयोग करता है, जो एक ऐसे शेफ की तरह है जो सामग्रियों को केवल काटने के बजाय उन्हें पूरी तरह से मिलाने का तरीका जानता है। यह विशेषज्ञ के ज्ञान की समृद्ध, जटिल बारीकियों को सुरक्षित रखता है और उन्हें इतना छोटा बना देता है कि वे फिट हो सकें।
  3. डबल चेक (The Double Check): यह सुनिश्चित करने के लिए कि रोबлоट वास्तव में सुन रहा है, सिस्टम एक "होमवर्क चेक" (एक बाहरी अलाइनमेंट लॉस) भी जोड़ता है। प्रशिक्षण के कुछ बिंदुओं पर, रोबोट को विशेषज्ञ के नोट्स को समझने की पुष्टि करनी होती है, जिसमें उसे अपने आंतरिक विचारों को विशेषज्ञ के मूल विचारों के साथ मिलाना होता है।

उन्होंने क्या पाया: गति और स्पष्टता

शोधकर्ताओं ने ImageNet (256×256 छवियों का एक विशाल संग्रह) पर SiT-B/2 नामक मॉडल का उपयोग करके इस नई पद्धति का परीक्षण किया। परिणाम काफी प्रभावशाली थे।

  • तेजी से सीखना: REGLUE द्वारा प्रशिक्षित रोबोट अन्य मॉडलों की तुलना में बहुत तेजी से सीखा। प्रशिक्षण के मात्र 300,000 स्टेप्स में, REGLUE ने 14.5 का क्वालिटी स्कोर (FID) प्राप्त किया। उस स्कोर को हराने के लिए, पिछले सर्वश्रेष्ठ तरीके (REG) को 400,000 स्टेप्स की आवश्यकता थी। REGLUE ने 400,000 स्टेप्स पर 12.9 का और भी बेहतर स्कोर हासिल किया, जबकि मानक रोबोट (SiT-B/2) बहुत खराब 33.0 पर अटका हुआ था।
  • सीक्रेट सॉस (The Secret Sauce): यह पेपर इस विचार को स्पष्ट रूप से खारिज करता है कि केवल अधिक डेटा जोड़ने से मदद मिलती है। उन्होंने दिखाया कि यदि आप एक साधारण, लीनियर ट्रांसलेटर (जैसे कि ReDi नामक पिछले तरीके में उपयोग किया गया था) का उपयोग करते हैं, तो परिणाम औसत (FID 21.4) होते हैं। यह नॉन-लीनियर कंप्रेशन ही है जो शक्ति को अनलॉक करता है। इसके बिना, रोबोट अभिभूत हो जाता है।
  • लोकल बनाम ग्लोबल: उन्होंने पाया कि "पैच-लेवल" (लोकल) विवरण सबसे महत्वपूर्ण हैं। एक रोबोट जो केवल "बड़ी तस्वीर" (ग्लोबल) के सारांश को सुनता था, उसका प्रदर्शन खराब रहा (FID 25.7)। लेकिन जब रोबोट को विस्तृत पैच नोट्स मिले, तो प्रदर्शन में उछाल आया।
  • परफेक्ट कॉम्बो: सबसे अच्छे परिणाम सब कुछ मिलाने से आए: विस्तृत लोकल नोट्स, बड़ी तस्वीर का सारांश और होमवर्क चेक। DINOv3-B नामक एक शक्तिशाली विशेषज्ञ मॉडल का उपयोग करके, REGLUE ने 12.3 का शानदार FID प्राप्त किया, और मानक DINOv2-B के साथ, इसने 12.9 हासिल किया।

यह क्यों मायने रखता है

यह पेपर सुझाव देता है कि AI आर्ट का भविष्य केवल बड़े रोबोट बनाने या उन्हें अधिक डेटा खिलाने के बारे में नहीं है। यह इस बारे में है कि हम रोबोट को उस ज्ञान से कैसे जोड़ते हैं जो उसके पास पहले से मौजूद है। एक स्मार्ट, नॉन-लीनियर ट्रांसलेटर का उपयोग करके विशेषज्ञ की सलाह को व्यवस्थित करने और रोबोट को बड़ी तस्वीर और सूक्ष्म विवरण दोनों से एक साथ सीखने के लिए मजबूर करके, REGLUE अधिक स्पष्ट, सुसंगत और कम समय में सीखी गई छवियां बनाता है।

लेखक सावधानी से नोट करते हैं कि यह कोई जादू नहीं है; यह एक विशिष्ट इंजीनियरिंग विकल्प है। उन्होंने साबित किया कि सही कंप्रेशन के बिना केवल अधिक फीचर्स को जोड़ने से वास्तव में चीजें खराब हो जाती हैं। लेकिन अपनी "एंटैंगलमेंट" रणनीति के साथ, वे छवि की गुणवत्ता और प्रशिक्षण की गति में महत्वपूर्ण सुधार निकालने में सफल रहे, जो यह सुझाव देता है कि इन AI दिमागों के अंदर सूचना को हम कैसे व्यवस्थित करते है, यह उनके दिमागों के आकार जितना ही महत्वपूर्ण है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →