← नवीनतम पेपर
💻 computer science

Denoising as Path Planning: Training-Free Acceleration of Diffusion Models with DPCache

यह शोध पत्र DPCache को प्रस्तुत करता है, जो डिफ्यूजन मॉडल्स के लिए एक ट्रेनिंग-मुक्त त्वरण ढांचा (acceleration framework) है, जो सैंपलिंग को एक वैश्विक पथ नियोजन समस्या (global path planning problem) के रूप में तैयार करता है और इष्टतम की टाइमस्टेप्स (key timesteps) चुनने के लिए एक पाथ-अवेयर कॉस्ट टेंसर पर डायनेमिक प्रोग्रामिंग का उपयोग करता है, जिससे न्यूनतम गुणवत्ता हानि के साथ महत्वपूर्ण गति प्राप्त होती है और कुछ मेट्रिक्स में फुल-स्टेप बेसलाइन्स से भी बेहतर प्रदर्शन करता है।

मूल लेखक: Bowen Cui, Yuanbin Wang, Huajiang Xu, Biaolong Chen, Aixi Zhang, Hao Jiang, Zhengzheng Jin, Xu Liu, Pipei Huang

प्रकाशित 2026-03-09
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Bowen Cui, Yuanbin Wang, Huajiang Xu, Biaolong Chen, Aixi Zhang, Hao Jiang, Zhengzheng Jin, Xu Liu, Pipei Huang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक उत्कृष्ट कृति (masterpiece) बनाने की कोशिश कर रहे हैं, लेकिन आपका एक सख्त नियम है: आपको एक बार में केवल एक छोटा सा ब्रशस्ट्रोक लगाना होगा, और अंतिम चित्र प्राप्त करने के लिए आपको यह 50 बार करना होगा। वर्तमान AI इमेज जनरेटर (डिफ्यूजन मॉडल्स) इसी तरह काम करते हैं। वे एक शोर (noise) और स्टैटिक से भरे कैनवास से शुरू होते हैं और धीरे-धीरे एक स्पष्ट छवि उभरने तक इसे "डिनोइज़" (denoise) करते हैं।

समस्या क्या है? 50 स्टेप्स करना धीमा है। यह ऐसा है जैसे आप किराने के सामान के लिए पैदल एक-एक कदम चलकर दुकान तक जा रहे हों, जबकि आप गाड़ी चलाकर जा सकते थे।

मौजूदा तरीके इसे तेज करने के लिए कुछ शॉर्टकट लेते हैं। कुछ उतने ही स्टेप्स लेते हैं लेकिन तेजी से चलते हैं (जिससे अक्सर वे लड़खड़ा जाते हैं)। अन्य पूरी तरह से स्टेप्स को छोड़ने की कोशिश करते हैं, लेकिन वे इसे अंधे होकर करते हैं—जैसे एक ड्राइवर जो नक्शे पर हर तीसरा मोड़ इसलिए छोड़ देता है क्योंकि "वह एक सीधी रेखा जैसा दिखता है।" यह अक्सर कार को खाई में ले जाता है (एक धुंधली या विकृत छवि)।

DPCache से मिलिए: AI आर्ट के लिए GPS।

यह पेपर एक नई विधि पेश करता है जिसे DPCache कहा जाता है। स्टेप्स को अंधे होकर छोड़ने के बजाय, DPCache इमेज जनरेशन प्रक्रिया को एक रोड ट्रिप की तरह मानता है और सबसे अच्छा रास्ता खोजने के लिए पाथ प्लानिंग (GPS की तरह) का उपयोग करता है।

यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:

1. "अभ्यास रन" (कैलिब्रेशन)

AI द्वारा आपके विशिष्ट चित्र को बनाना शुरू करने से पहले, यह कुछ रैंडम उदाहरणों पर एक छोटा सा "अभ्यास रन" करता है।

  • उपमा: कल्पना कीजिए कि एक डिलीवरी ड्राइवर मंगलवार की एक शांत सुबह एक नया रूट टेस्ट कर रहा है। वह पूरे रास्ते पर गाड़ी चलाता है, लेकिन साथ ही यह भी नोट करता है: "यदि मैं मेन स्ट्रीट पर रुकना छोड़ दूँ, तो मेरा कितना अतिरिक्त समय बर्बाद होगा? क्या होगा अगर मैं ओक एवेन्यू पर रुकना छोड़ दूँ?"
  • तकनीक: AI कुछ सैंपल्स पर पूरे 50 स्टेप्स चलाता है और एक कॉस्ट टेंसर (Cost Tensor) बनाता है। यह अनिवार्य रूप से एक विशाल 3D मैप है जो AI को बताता है: "स्टेप 10 से स्टेप 20 तक कूदना सस्ता है (कम एरर), लेकिन स्टेप 10 से स्टेप 30 तक कूदना महंगा है (उच्च एरर) क्योंकि वहां इमेज बहुत अधिक बदल जाती है।"

2. "स्मार्ट प्लानर" (डायनेमिक प्रोग्रामिंग)

एक बार जब AI के पास यह मैप आ जाता है, तो वह केवल यह अनुमान नहीं लगाता कि कौन से स्टेप्स छोड़ने हैं। यह एक पहेली सुलझाने के लिए एक गणितीय एल्गोरिदम (डायनेमिक प्रोग्रामिंग) का उपयोग करता है: "मैं कम से कम कितने स्टॉप्स पर रुककर मूल रूट जैसा दिखने वाला गंतव्य प्राप्त कर सकता हूँ?"

  • उपमा: ड्राइवर के अनुमान लगाने के बजाय, GPS एकदम सही संयोजन की गणना करता है। यह कहता है, "ठीक है, हमें पहले 3 चौराहों पर रुकना ही होगा (क्योंकि वहां रास्ता कठिन है)। फिर, हम सुरक्षित रूप से 5 स्टॉप छोड़ सकते हैं और अगले बड़े जंक्शन तक सीधे जा सकते हैं। फिर हम 2 और छोड़ देंगे, फिर रुकेंगे।"
  • परिणाम: यह एक कस्टम "की स्टेप" (Key Step) शेड्यूल बनाता है। यह जानता है कि कौन से स्टेप्स महत्वपूर्ण हैं और किन स्टेप्स को छोड़ना सुरक्षित है।

3. "शॉर्टकट" (इन्फरेंस)

अब, जब आप AI को अपना चित्र बनाने के लिए कहते हैं, तो यह इस पूर्व-निर्धारित GPS रूट का पालन करता है।

  • जादू: "की स्टेप्स" (उन स्टॉप्स पर जिन्हें GPS ने लेने के लिए कहा है) पर, AI भारी काम करता है: यह इमेज की गणना करता है, शोर (noise) को अपडेट करता है, और परिणाम को सेव करता है।
  • शॉर्टकट: की स्टेप्स के बीच के सभी स्टेप्स के लिए, AI कोई भारी गणित नहीं करता है। यह बस पिछले सेव किए गए "की स्टेप" को देखता है और एक चतुर गणितीय ट्रिक का उपयोग करता है (जैसे पिछले फ्रेम के आधार पर वीडियो के अगले कुछ फ्रेमों की भविष्यवाणी करना) यह अनुमान लगाने के लिए कि इमेज कैसी दिखनी चाहिए। यह एक ऐसी फिल्म देखने जैसा है जहाँ आप केवल मुख्य फ्रेम देखते हैं, लेकिन आपका मस्तिष्क उनके बीच की सुचारू गति को भर देता है।

यह पुराने तरीकों से बेहतर क्यों है?

  • पुराना तरीका (फिक्स्ड शेड्यूल): एक बस की तरह जो हर 5 मिनट में रुकती है, चाहे वह व्यस्त शहर हो या खाली रेगिस्तान। यह रेगिस्तान में समय बर्बाद करती है और शहर में स्टॉप मिस कर देती है।
  • पुराना तरीका (लोकल एडैप्टिव): एक ऐसे ड्राइवर की तरह जो अपने ठीक सामने की सड़क को देखता है और निर्णय लेता है, "मैं यह मोड़ छोड़ दूंगा," बिना यह देखे कि वह मोड़ उसे किसी खाई की ओर ले जाता है। वे अल्पकालिक निर्णय लेते हैं जो यात्रा खराब कर देते हैं।
  • DPCache (ग्लोबल पाथ प्लानिंग): एक GPS की तरह जो पूरे मैप को देख सकता है। वह जानता है कि यहाँ एक मोड़ छोड़ना ठीक है क्योंकि वह एक सीधी हाईवे की ओर ले जाता है, लेकिन वहाँ एक मोड़ छोड़ना खतरनाक है। वह पूरी यात्रा को तेज़ लेकिन सुरक्षित बनाने के लिए योजना बनाता है।

परिणाम

इस पेपर ने कुछ सबसे उन्नत AI मॉडल्स (जैसे FLUX और HunyaVideo) पर इसका परीक्षण किया।

  • गति: इसने AI को 4 से 5 गुना तेज़ बना दिया।
  • गुणवत्ता: इमेज उतनी ही अच्छी थीं, या शायद मूल (स्लो) वर्जन से भी थोड़ी बेहतर थीं।
  • मेमोरी: इसके लिए सुपरकंप्यूटर की आवश्यकता नहीं थी; यह स्टैंडर्ड हार्डवेयर पर कुशलतापूर्वक चला।

संक्षेप में

DPCache को एक स्मार्ट इटिनररी (यात्रा कार्यक्रम) देने जैसा है। AI को यात्रा के हर एक कदम पर चलने के लिए मजबूर करने के बजाय, यह AI को बताता है: "ये रहे 10 सबसे महत्वपूर्ण चेकपॉइंट्स। इन पर सावधानी से चलें। बाकी रास्ते के लिए, बस इनके बीच में सहजता से फिसलते (glide) रहें।"

यह AI को उन सुंदर विवरणों को खोए बिना, सेकंडों में उच्च-गुणवत्ता वाली छवियां और वीडियो बनाने की अनुमति देता है जो उन्हें उत्कृष्ट बनाते हैं। यह एक धीमी, उबाऊ प्रक्रिया को एक तेज़, कुशल यात्रा में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →