← नवीनतम पेपर
⚡ electrical engineering

ART for Diffusion Sampling: Continuous-Time Control and Actor-Critic Learning

यह शोध पत्र एडेप्टिव रीपैरामीटराइज्ड टाइम (ART) और इसके रीइन्फोर्समेंट लर्निंग-आधारित सॉल्वर ART-RL का प्रस्ताव करता है, जो एक निरंतर-समय नियंत्रण ढांचा (continuous-time control framework) है जो डिफ्यूजन सैंपलिंग के लिए इष्टतम, एडेप्टिव टाइमस्टेप शेड्यूल्स को सीखता है ताकि अंतर्निहित मॉडल को संशोधित किए बिना विभिन्न बजटों और पाइपलाइनों में सैंपल गुणवत्ता और सामान्यीकरण (generalization) में महत्वपूर्ण सुधार किया जा सके।

मूल लेखक: Yilie Huang, Wenpin Tang, Xun Yu Zhou

प्रकाशित 2026-07-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yilie Huang, Wenpin Tang, Xun Yu Zhou

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक उत्कृष्ट कृति (मास्टरपीस) बनाने की कोशिश कर रहे हैं, लेकिन आपके पास केवल सीमित समय और ब्रश के निश्चित स्ट्रोक्स (चोट) हैं। यह बिल्कुल वही चुनौती है जिसका सामना डिफ्यूजन मॉडल्स (Diffusion Models) को करना पड़ता है, जो DALL·E और Stable Diffusion जैसे टूल्स के पीछे की AI तकनीक है। ये मॉडल रैंडम स्टैटिक (शोर/नॉइज़) से भरे एक कैनवास से शुरू होते हैं और धीरे-धीरे इसे स्टेप-दर-स्टेप "डी-नॉइज़" करते हैं जब तक कि एक स्पष्ट छवि उभर न आए।

समस्या यह है: आप अपने सीमित ब्रश स्ट्रोक्स को कैसे खर्च करते हैं?

वर्तमान में, अधिकांश AI कलाकार एक "यूनिफॉर्म" (समान) रणनीति का उपयोग करते हैं: वे शुरुआत से अंत तक छोटे, समान आकार के कदम उठाते हैं, जैसे कि एक मेट्रोनोम एक स्थिर गति से टिक-टिक करता है। अन्य "हैंड-क्राफ्टेड" (हाथ से बनाए गए) शेड्यूल्स का उपयोग करते हैं, जो पहले से लिखे गए व्यंजनों (रेसिपी) की तरह हैं जो कहते हैं, "शुरुआत में बड़े कदम उठाएं और अंत में बहुत छोटे कदम।" लेकिन ये रेसिपी केवल अनुमान हैं। कभी-कभी वे पेंटिंग के आसान हिस्सों पर समय बर्बाद करते हैं और जटिल विवरणों (डिटेल्स) में जल्दबाजी करते हैं, जिससे छवि धुंधली या विकृत हो जाती है।

यह पेपर एक नई विधि पेश करता है जिसे ART (Adaptive Reparameterized Time) कहा जाता है। ART को एक नए ब्रश के रूप में नहीं, बल्कि AI के ऑर्केस्ट्रा के लिए एक स्मार्ट कंडक्टर (सुचालक) के रूप में सोचें।

मुख्य विचार: "स्पीड डायल" (गति नियंत्रण)

कल्पना कीजिए कि AI की पेंटिंग प्रक्रिया बिंदु A (शोर) से बिंदु B (अंतिम छवि) तक जाने वाली एक कार यात्रा है।

  • पुराना तरीका: ड्राइवर को एक निरंतर गति से गाड़ी चलाने के लिए कहा जाता है, या एक निश्चित मानचित्र का पालन करने के लिए कहा जाता है जो एक अनुमान के आधार पर कहता है "यहाँ धीमे हो जाओ, वहाँ तेज हो जाओ"।
  • ART का तरीका: ड्राइवर के पास एक स्पीड डायल (कंट्रोल नॉब) है। AI इस नॉब को वास्तविक समय (रियल-टाइम) में घुमाना सीखता है।
    • जब सड़क चिकनी होती है (छवि का अनुमान लगाना आसान होता है), तो AI तेज हो जाता है, समय बचाने के लिए बड़े, तेज़ कदम उठाता है।
    • जब सड़क ऊबड़-खाबड़ या कठिन होती है (विवरणों का अनुमान लगाना कठिन होता है), तो AI धीमा हो जाता है, सटीकता सुनिश्चित करने के लिए छोटे, सावधानीपूर्ण कदम उठाता है।

लक्ष्य ठीक उसी मात्रा में "ईंधन" (कंप्यूटेशनल पावर) का उपयोग करना है जहाँ इसकी सबसे अधिक आवश्यकता है।

यह कैसे काम करता है: "जुआरी" वाला तरीका (The Gambler's Trick)

इस "स्पीड डायल" समस्या को गणितीय रूप से हल करना अविश्वत रूप से कठिन है क्योंकि AI को एक साथ लाखों निर्णय लेने होते हैं। इसे हल करने के लिए, लेखक एक चतुर तकनीक का उपयोग करते हैं जिसे ART-RL कहा जाता है।

इसे इस तरह सोचें: हर एक क्षण के लिए एकदम सही गति की गणना करने की कोशिश करने के बजाय (जो बहुत कठिन है), AI एक जुआरी की तरह कार्य करता है।

  1. यह गति के बारे में एक अनुमान लगाता है।
  2. यह उस अनुमान में थोड़ा सा "शोर" या रैंडमनेस जोड़ता है (जैसे कि यह तय करने के लिए पासा फेंकना कि उसे थोड़ा तेज होना चाहिए या धीमा)।
  3. यह इसे आज़माता है और देखता है कि परिणामी छवि कितनी अच्छी है।
  4. यदि छवि अच्छी है, तो यह उस गति को याद रखता है। यदि यह खराब है, तो यह उस गति से बचने के लिए सीखता है।

इस "ट्रायल एंड एरर" (प्रयास और त्रुटि) की प्रक्रिया को लाखों बार दोहराकर, AI सही लय (रिदम) सीख जाता है। एक बार जब इसने लय सीख ली, तो यह जुआ खेलना बंद कर देता है और बस उस पूर्ण, सुचारू पथ का अनुसरण करता है जिसे इसने खोजा है।

परिणाम: बेहतर तस्वीरें, समान प्रयास

लेखकों ने विभिन्न कार्यों पर, सरल गणित समस्याओं से लेकर चेहरे और जानवरों की जटिल छवियां उत्पन्न करने तक, इस "स्मार्ट कंडक्टर" का परीक्षण किया।

  • "एक-आयामी" (One-Dimensional) परीक्षण: उन्होंने इसका परीक्षण एक सरल गणितीय समस्या पर किया जहाँ उन्हें उत्तर पूरी तरह से पता था। पुराने तरीके (Uniform, EDM, DPM) उन ड्राइवरों की तरह थे जिन्हें नहीं पता था कि कब ब्रेक लगाना है, और अक्सर लक्ष्य चूक जाते थे। ART ने सही ब्रेकिंग पैटर्न सीखा और हर बार सही उत्तर प्राप्त किया।
  • छवि परीक्षण: छवियों (जैसे बिल्ली, चेहरा या कार) को उत्पन्न करते समय, ART ने मानक तरीकों की तुलना में लगातार अधिक स्पष्ट और शार्प तस्वीरें बनाईं, भले ही उन्होंने कंप्यूटर स्टेप्स की बिल्कुल समान संख्या का उपयोग किया हो।
  • "यूनिवर्सल" उपहार: सबसे आश्चर्यजनक निष्कर्ष यह है कि ART ने जो "लय" एक डेटासेट (जैसे CIFAR-10, खिलौना छवियों का एक छोटा सेट) के लिए सीखी, वह बिना किसी पुन: प्रशिक्षण (retraining) के पूरी तरह से अलग डेटासेट्स (जैसे उच्च-रिज़ॉल्यूशन वाले मानव चेहरे या जानवर) पर भी पूरी तरह से काम करती है। यह एक पार्किंग लॉट में कार चलाना सीखने और फिर बिना किसी अतिरिक्त अभ्यास के सीधे एक रेस ट्रैक पर रेस कार चलाने में सक्षम होने जैसा है।

यह क्यों महत्वपूर्ण है

वर्तमान में, यदि आप बेहतर AI चित्र चाहते हैं, तो आपको आमतौर पर अधिक प्रतीक्षा करनी होती है (अधिक स्टेप्स) या अधिक शक्तिशाली कंप्यूटर का उपयोग करना होता है। ART आपको उतने ही समय और कंप्यूटिंग पावर के साथ बेहतर गुणवत्ता प्राप्त करने की अनुमति देता है।

यह AI चलाने के "अनुमान" को एक सीखी हुई कुशलता में बदल देता है। AI अपना स्वयं का शेड्यूल खुद तय करता है, यह सुनिश्चित करता है कि कंप्यूटिंग पावर का हर एक सेकंड ठीक वहीं खर्च किया जाए जहाँ इसकी सबसे अधिक आवश्यकता है।

संक्षेप में: ART AI को ऑटोपायलट पर दौड़ना बंद करने और अपने द्वारा सीखे गए मानचित्र के साथ गाड़ी चलाना सिखाता है, जिसके परिणामस्वरूप स्पष्ट छवियां और तेज़ जनरेशन प्राप्त होता है, और यह मूल AI मॉडल को बदले बिना संभव होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →