← नवीनतम पेपर
🤖 machine learning

Heterogeneous Decentralized Diffusion Models

यह शोधपत्र हेट्रोजेनियस डिसेंट्रलाइज्ड डिफ्यूजन मॉडल्स के लिए एक कुशल फ्रेमवर्क पेश करता है जो विशेषज्ञों को मिश्रित उद्देश्यों (DDPM और फ्लो मैचिंग) के साथ और कम संसाधन आवश्यकताओं के साथ प्रशिक्षण लेने में सक्षम बनाता है, जिससे पूर्व दृष्टिकोणों की तुलना में कंप्यूट में 16 गुना कमी और डेटा में 14 गुना कमी आती है और साथ ही साथ इमेज क्वालिटी और विविधता में सुधार होता है।

मूल लेखक: Zhiying Jiang, Raihan Seraj, Marcos Villagra, Bidhan Roy

प्रकाशित 2026-03-10
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhiying Jiang, Raihan Seraj, Marcos Villagra, Bidhan Roy

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप दुनिया की सबसे यथार्थवादी, कलात्मक पेंटिंग बनाना चाहते हैं। पारंपरिक रूप से, ऐसा करने के लिए आपको एक विशाल, बेहद महंगे आर्ट स्टूडियो की आवश्यकता होगी जहाँ सैकड़ों सर्वश्रेष्ठ चित्रकार एक ही कैनवास पर, पूरी तरह से तालमेल में, एक ही नियम का पालन करते हुए काम कर रहे हों। केवल सबसे अमीर गैलरी ही इसे वहन कर सकती है।

यह शोध पत्र पेंटिंग करने का एक नया तरीका पेश करता है: "नेबरहुड आर्ट कलेक्टिव" (पड़ोस का कला समूह)।

एक विशाल स्टूडियो के बजाय, एक ऐसे पड़ोस की कल्पना करें जहाँ 8 अलग-अलग कलाकार अपने अलग-अलग गैरेज में काम करते हैं। वे पेंटिंग करते समय एक-दूसरे से बात नहीं करते। वे अपने ब्रश साझा नहीं करते। उन्हें इस पर भी सहमत होने की आवश्यकता नहीं है कि पेंटिंग कैसे करनी है। कुछ वॉटरकलर का उपयोग कर सकते हैं, कुछ ऑयल पेंट का, और अन्य चारकोल का।

यह "हेटरोजीनियस डिसेंट्रलाइज्ड डिफ्यूजन" (विषम विकेंद्रीकृत प्रसार) फ्रेमवर्क कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ समझाया गया है:

1. समस्या: "सब-या-कुछ-नहीं" वाला स्टूडियो

आमतौर पर, इमेज जेनरेट करने के लिए AI को प्रशिक्षित करने के लिए (जैसे कि "एक प्यारी बिल्ली" की तस्वीर बनाना) सुपरकंप्यूटरों के एक विशाल क्लस्टर की आवश्यकता होती है जो एक साथ मिलकर काम करते हैं। यह केक बनाने जैसा है जहाँ 1,000 शेफ को एक ही कटोरे को ठीक उसी समय चलाना होगा। यदि एक शेफ भी रुक जाता है, तो पूरा काम विफल हो जाएगा। यह महंगा है और इससे भागीदारी सीमित हो जाती है।

2. समाधान: स्वतंत्र गैरेज कलाकार

लेखकों ने एक ऐसा सिस्टम बनाया है जहाँ आप 8 अलग-अलग AI "विशेषज्ञों" को पूरी तरह से अलग रहकर प्रशिक्षित कर सकते हैं।

  • कोई सिंकिंग नहीं: उन्हें एक-दूसरे से बात करने की आवश्यकता नहीं है। आप उन्हें अलग-अलग कंप्यूटरों पर, अलग-अलग स्थानों पर, अलग-अलग समय पर प्रशिक्षित कर सकते हैं।
  • अलग शैलियाँ (विषमता/Heterogeneity): यही बड़ी सफलता है। पिछले सिस्टम में, सभी 8 विशेषज्ञों को बिल्कुल एक ही गणित (एक ही "नुस्खा") का उपयोग करना पड़ता था। यहाँ, कुछ विशेषज्ञ DDPM (एक ऐसी विधि जो बिल्ली की मूंछों जैसे बारीक विवरणों को बनाए रखने में बेहतरीन है) का उपयोग कर सकते हैं, जबकि अन्य Flow Matching (एक ऐसी विधि जो नदी के प्रवाह जैसी सुचारू गति के लिए बेहतरीन है) का उपयोग कर सकते हैं।
  • जादुई ट्रिक: भले ही उन्होंने अलग-अलग नुस्खे सीखे हों, सिस्टम के पास एक "यूनिवर्सल ट्रांसलेटर" (सार्वभौमिक अनुवादक) है जो अंत में उन्हें बिना कुछ दोबारा सीखे एक साथ काम करने की अनुमति देता है।

3. "यूनिवर्सल ट्रांसलेटर" (इन्फरेंस टाइम)

आप एक वॉटरकलर पेंटिंग को ऑयल पेंटिंग के साथ कैसे मिलाते हैं?

  • रूपांतरण: जब इमेज जेनरेट करने का समय आता है, तो सिस्टम DDPM विशेषज्ञ से "नॉइज़ प्रेडिक्शन" (शोर का अनुमान) लेता है और गणितीय रूप से उसे उस "वेलोसिटी प्रेडिक्शन" (वेग का अनुमान) में बदल देता है जिसका उपयोग Flow Matching विशेषज्ञ करता है।
  • रूपक: कल्पना कीजिए कि एक विशेषज्ञ फ्रेंच बोलता है और दूसरा स्पेनिश। उन्हें एक नई भाषा सीखने के लिए मजबूर करने के बजाय, आप उस समय एक रियल-टाइम ट्रांसलेटर ऐप का उपयोग करते हैं जब उन्हें सहयोग करने की आवश्यकता होती है। वे बिना कभी एक साथ अध्ययन किए, तुरंत अपने कौशल को मिला सकते हैं।

4. "स्मार्ट मैनेजर" (द राउटर)

चूंकि आपके पास 8 अलग-अलग विशेषज्ञ हैं, तो आपको कैसे पता चलेगा कि जब आप "समुद्र के ऊपर सूर्यास्त" के लिए पूछें तो किसकी बात सुननी है?

  • एक छोटा "राउटर" AI ट्रैफिक पुलिस की तरह काम करता है। यह आपकी रिक्वेस्ट और इमेज बनने के वर्तमान चरण को देखता है।
  • यह कहता है, "ठीक है, आकाश के लिए, चलिए विशेषज्ञ #3 (Flow Matching वाले) की बात सुनते हैं। चट्टानों के लिए, विशेषज्ञ #1 (DDPM वाले) की बात करते हैं।"
  • यह अंतिम इमेज बनाने के लिए उनके इनपुट को पूरी तरह से मिला देता है।

5. यह गेम-चेंजर क्यों है

  • सस्ता: पुराने तरीके में सुपरकंप्यूटर के 1,176 दिनों के समय की आवश्यकता थी। यह नया तरीका इसे मात्र 72 दिनों में कर देता है। यह लागत में 16 गुना कमी है। यह ट्रकों के बेड़े के बजाय एक साइकिल की आवश्यकता होने जैसा है।
  • छोटा डेटा: पहले उन्हें 158 मिलियन छवियों की आवश्यकता थी; अब उन्हें केवल 11 मिलियन की आवश्यकता है।
  • बेहतर गुणवत्ता: आश्चर्यजनक रूप से, अलग-अलग "नुस्खों" (DDPM + Flow Matching) को मिलाने से तस्वीरें केवल एक नुस्खा उपयोग करने की तुलना में वास्तव में बेहतर और अधिक विविध बनीं। DDPM विशेषज्ञों ने विवरणों को तीक्ष्ण रखा, जबकि Flow Matching विशेषज्ञों ने रंगों को सुचारू रखा।
  • सुलभ: आपको सुपरकंप्यूटर की आवश्यकता नहीं है। आप इसे एक सिंगल कंज्यूमर ग्राफिक्स कार्ड (जैसे कि गेमर्स इस्तेमाल करते हैं) पर चला सकते हैं।

निचोड़

यह शोध पत्र AI आर्ट के लोकतंत्रीकरण के बारे में है। यह साबित करता है कि विश्व स्तरीय चित्र बनाने के लिए आपको एक विशाल, केंद्रीकृत फैक्ट्री की आवश्यकता नहीं है। इसके बजाय, आप स्वतंत्र कलाकारों के एक विकेंद्रीकृत समुदाय को रख सकते हैं, जो अपने पसंदीदा उपकरणों और तरीकों का उपयोग करते हैं, जो अंत में कुछ सुंदर, विविध और उच्च गुणवत्ता वाली चीज़ बनाने के लिए एक साथ आ सकते हैं।

यह "मोनोलिथिक फैक्ट्री" मॉडल को "जीवंत मार्केट स्क्वायर" मॉडल में बदल देता है, जहाँ प्रशिक्षण में विविधता वास्तव में बेहतर परिणाम देती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →