← नवीनतम पेपर
💬 NLP

A Tutorial on Diffusion Theory: From Differential Equations to Diffusion Models

यह ट्यूटोरियल अवकल समीकरणों (differential equations) से उनके फॉरवर्ड और रिवर्स डायनेमिक्स को व्युत्पन्न करके डिफ्यूजन मॉडल्स के लिए एक एकीकृत ढांचा प्रदान करता है, मानक प्रशिक्षण उद्देश्यों और स्कोर मैचिंग के बीच समानता को प्रदर्शित करता है, और DDPM, DDIM और गाइडेड जनरेशन जैसे विभिन्न सैंपलिंग तरीकों के बीच सैद्धांतिक संबंधों को स्पष्ट करता है।

मूल लेखक: Jiayi Fu, Yuxia Wang

प्रकाशित 2026-05-22
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jiayi Fu, Yuxia Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बिल्ली की एक सुंदर, उच्च-रिज़ॉल्यूशन वाली तस्वीर है। अब, कल्पना कीजिए कि आप एक पुराने टीवी पर धीरे-धीरे स्टैटिक (static) को बढ़ा रहे हैं जब तक कि वह तस्वीर पूरी तरह से सफेद शोर (white noise) के समुद्र में खो न जाए। यह फॉरवर्ड प्रोसेस (Forward Process) है।

अब, कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट जासूस है जो उस स्टैटिक को देख सकता है और कह सकता है, "यदि मैं इस विशिष्ट स्थान से थोड़ा सा शोर हटा दूँ, तो बिल्ली का कान झाँकने लगेगा।" यदि यह जासूस इस प्रक्रिया को बार-बार, चरण-दर-चरण कर सकता है, तो वह स्टैटिक को वापस एक स्पष्ट तस्वीर में बदल सकता है। यह रिवर्स प्रोसेस (Reverse Process) है, और इसी तरह डिफ्यूजन मॉडल (Diffusion Models) छवियां तैयार करते हैं।

जियाई फू और युक्सिया वांग का यह शोध पत्र मूल रूप से डिफरेंशियल इक्वेशंस (differential equations) (वह गणित जो यह बताता है कि चीजें समय के साथ कैसे बदलती हैं) की भाषा में लिखा गया एक "यूजर मैनुअल" है। यह कई अलग-अलग तरीकों को जो एकता प्रदान करता है जिनसे वैज्ञानिक इन मॉडलों के बारे में सोच रहे थे।

यहाँ उनके विवरण का सरल उपमाओं (analogies) का उपयोग करके ब्रेकडाउन दिया गया है:

1. यात्रा का वर्णन करने के दो तरीके (ODE बनाम SDE)

शोध पत्र कहता है कि एक स्पष्ट छवि को शोर में बदलने (और वापस) की प्रक्रिया को दो अलग-अलग गणितीय भाषाओं में वर्णित किया जा सकता है:

  • स्टोकेस्टिक पथ (The Stochastic Path - SDE): इसे एक ऐसे यात्री के रूप में सोचें जो धुंधले जंगल में चल रहा है। उसके पास एक नक्शा है (जिस दिशा में उसे जाना चाहिए), लेकिन हवा (रैंडम शोर) उसे रास्ते से थोड़ा भटका देती है। हर कदम एक नियोजित दिशा और एक रैंडम झोंके का मिश्रण है। यह स्टोकेस्टिक डिफरेंशियल इक्वेशन (SDE) है।
  • डिटरमिनिस्टिक पथ (The Deterministic Path - ODE): अब, उसी यात्री की कल्पना करें, लेकिन इस बार हवा पूरी तरह से अनुमानित है, या वे एक विशाल, चिकने कन्वेयर बेल्ट पर चल रहे हैं जो उन्हें बिना किसी रैंडमनेस के ठीक वहीं ले जाता है जहाँ उन्हें जाना चाहिए। यह ऑर्डिनरी डिफरेंशियल इक्वेशन (ODE) है।

बड़ी अंतर्दृष्टि: शोध पत्र यह सिद्ध करता है कि भले ही ये दो पथ अलग दिखते हों (एक डगमगाता हुआ, दूसरा चिकना), वे दोनों एक ही स्थान (एक स्पष्ट छवि) से शुरू होते हैं और एक ही स्थान (शुद्ध शोर) पर समाप्त होते हैं। इससे भी महत्वपूर्ण बात यह है कि वे किसी भी क्षण में एक ही "डेंसिटी मैप" (density map) का पालन करते हैं। आप अंतिम परिणाम को बदले बिना डगमगाते पथ और चिकने पथ के बीच स्विच कर सकते हैं।

2. "स्कोर" (जासूस की सहज बुद्धि)

जासूस को कैसे पता चलता है कि किस दिशा में जाना है? वे स्कोर (Score) का उपयोग करते हैं।

गणित में, "स्कोर" केवल प्रायिकता (probability) का ग्रेडिएंट है। सरल शब्दों में, इसे एक ढलान (slope) के रूप में सोचें।

  • यदि आप एक पहाड़ी पर खड़े हैं, तो ढलान आपको बताती है कि "ऊपर" (जहाँ डेटा है) जाने का रास्ता कौन सा है और "नीचे" (जहाँ शोर है) जाने का रास्ता कौन सा है।
  • मॉडल का काम इस ढलान को सीखना है। यह एक शोर वाली छवि को देखकर सीखता है कि, "असली छवि की ओर जाने वाली 'ऊपर' की दिशा यह है।"

शोध पत्र दिखाता है कि इन मॉडलों को प्रशिक्षित करने का मानक तरीका (उनसे उस शोर का अनुमान लगाने के लिए कहना जो जोड़ा गया था) गणितीय रूप से इस "ढलान" या स्कोर को सीखने के समान है। यह एक छात्र को गणित का सवाल हल करना सिखाने जैसा है, जिसमें उन्हें सीधे फॉर्मूला बताने के बजाय उत्तर खोजने के लिए कहा जाता है। शोध पत्र सिद्ध करता है कि ये दोनों शिक्षण विधियाँ वास्तव में एक ही हैं।

3. प्रशिक्षण: शोर को हटाना सीखना (Learning to Denoise)

शोध पत्र समझाता है कि हमें मॉडल को सीधे "ढलान" के जटिल गणित को सिखाने की आवश्यकता नहीं है। इसके बजाय, हम इसे बस एक शोर वाली तस्वीर दिखा सकते हैं और पूछ सकते हैं, "हमने जो शोर जोड़ा था वह क्या था?"

  • यदि मॉडल शोर का सटीक अनुमान लगाने में सक्षम है, तो वह स्वचालित रूप से ढलान को सीख जाता है।
  • एक बार जब वह ढलान को जान लेता है, तो वह प्रक्रिया को उल्टा कर सकता है: शुद्ध शोर से शुरू करें और एक नई, वास्तविक छवि बनाने के लिए "ऊपर" की ओर चलें।

4. विभिन्न "चलने वाले" (DDPM, DDIM, DPM-Solver)

यह शोध पत्र उन कई प्रसिद्ध एल्गोरिदम को एकीकृत करता है जिनका उपयोग लोग छवियां उत्पन्न करने के लिए करते हैं। यह बताता है कि वे सभी उस "ढलान" के साथ कदम उठाने के अलग-अलग तरीके हैं:

  • DDPM (सावधान यात्री): यह विधि छोटे, सतर्क कदम उठाती है। यह हर चरण में थोड़ा सा रैंडमनेस जोड़ती है (SDE की तरह)। यह सटीक है लेकिन धीमी है।
  • DDIM (चिकना स्लाइडर): यह विधि रैंडम हवा को नजरअंदाज करती है और केवल चिकने कन्वेयर बेल्ट का अनुसरण करती है (ODE)। यह बहुत तेज़ है क्योंकि यह रैंडम झोंकों के प्रति प्रतिक्रिया करने में समय बर्बाद नहीं करती है, लेकिन इसके लिए एक बहुत अच्छे नक्शे (एक अच्छी तरह से प्रशिक्षित मॉडल) की आवश्यकता होती है।
  • DPM-Solver (एक्सप्रेस एलीवेटर): यह एक फैंसी नया तरीका है जो छोटे कदमों के बजाय पहाड़ी पर बड़े, कुशल छलांग लगाने के लिए गणितीय ट्रिक्स का उपयोग करता है। यह रिकॉर्ड समय में शीर्ष (अंतिम छवि) तक पहुँच जाता है।

शोध पत्र दिखाता है कि DDPM अनिवार्य रूप से डगमगाते पथ (SDE) का एक डिस्क्रीट संस्करण है, और DDIM चिकने पथ (ODE) का एक डिस्क्रीट संस्करण है। वे एक ही सिक्के के दो पहलू हैं।

5. प्रक्रिया को निर्देशित करना (Classifier Guidance)

कभी-कभी आप केवल एक बिल्ली नहीं चाहते; आप एक काली बिल्ली चाहते हैं। आप जासूस को कैसे निर्देशित करते हैं?

  • क्लासिफायर गाइडेंस (Classifier Guidance): आप एक दूसरा विशेषज्ञ लाते हैं (एक क्लासिफायर) जो चिल्लाता है, "अधिक काला! कम सफेद!" जासूस छवि के ढलान और विशेषज्ञ की पुकार दोनों को सुनता है, और एक काली बिल्ली बनाने के लिए अपने पथ को समायोजित करता है।
  • क्लासिफायर-फ्री गाइडेंस (Classifier-Free Guidance): दूसरे विशेषज्ञ को काम पर रखने के बजाय, आप मुख्य जासूस को इस तरह प्रशिक्षित करते हैं कि वह कह सके "मुझे नहीं पता कि आप क्या चाहते हैं" (कोई स्थिति नहीं) और "मुझे पता है कि आप एक काली बिल्ली चाहते हैं" (स्थिति)। जनरेशन के दौरान, वे परिणाम को निर्देशित करने के लिए इन दोनों उत्तरों को मिलाते हैं। शोध पत्र समझाता है कि यह "मिक्सिंग" इतनी अच्छी तरह से क्यों काम करती है।

6. महान एकीकरण: फ्लो मैचिंग (Flow Matching)

अंत में, यह शोध पत्र डिफ्यूजन मॉडल्स को एक नए क्षेत्र, फ्लो मैचिंग (Flow Matching) से जोड़ता है।

  • फ्लो मैचिंग शोर के बादल से डेटा के बादल तक एक सीधी रेखा खींचने जैसा है।
  • डिफ्यूजन एक घुमावदार नदी के पथ जैसा है।

शोध पत्र सिद्ध करता है कि भले ही वे अलग दिखते हों, यदि आप उन्हें एक ही तरह से प्रशिक्षित करते हैं (शोर/स्कोर का अनुमान लगाना), तो वे अंततः एक ही यात्रा का वर्णन करते हैं। "नॉइज़ प्रेडिक्शन" लॉस फंक्शन वास्तव में एक "फ्लो मैचिंग" लॉस फंक्शन है जो छिपा हुआ है। यह महसूस करने जैसा है कि चाहे आप कार चलाएं या साइकिल चलाएं, यदि आप एक ही GPS निर्देशांकों का पालन करते हैं, तो आप एक ही गंतव्य पर पहुँचते हैं।

सारांश

यह शोध पत्र एक सेतु (bridge) है। यह विभिन्न डिफ्यूजन एल्गोरिदम (DDPM, DDIM, Flow Matching) की अव्यवस्थित, जटिल दुनिया को लेता है और दिखाता है कि वे सभी एक ही डिफरेंशियल इक्वेशन को हल करने के अलग-अलग तरीके हैं।

  • फॉरवर्ड: डेटा को शोर में बदलना (आसान)।
  • रिवर्स: शोर को डेटा में बदलना (कठिन)।
  • रहस्य: शोर का अनुमान लगाकर "ढलान" (स्कोर) को सीखना।
  • परिणाम: चाहे आप एक डगमगाती छड़ी (SDE) के साथ चलें या एक चिकनी रेल (ODE) पर फिसलें, यदि आप ढलान का अनुसरण करते हैं, तो आप सुंदर छवियां बनाएंगे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →