← नवीनतम पेपर
🤖 machine learning

DiffusionOPD: A Unified Perspective of On-Policy Distillation in Diffusion Models

यह शोध पत्र DiffusionOPD का प्रस्ताव करता है, जो डिफ्यूजन मॉडल्स के लिए एक एकीकृत मल्टी-टास्क ट्रेनिंग प्रतिमान (paradigm) है जो सिंगल-टास्क एक्सप्लोरेशन को मल्टी-टास्क इंटीग्रेशन से अलग करने के लिए ऑनलाइन पॉलिसी डिस्टिलेशन का लाभ उठाता है, जो सुदृढीकरण शिक्षण (reinforcement learning) का एक सैद्धांतिक रूप से पुष्ट, लो-वेरिएंस विकल्प प्रदान करता है और विविध बेंचमार्क पर अत्याधुनिक प्रदर्शन और दक्षता प्राप्त करता है।

मूल लेखक: Quanhao Li, Junqiu Yu, Kaixun Jiang, Yujie Wei, Zhen Xing, Pandeng Li, Ruihang Chu, Shiwei Zhang, Yu Liu, Zuxuan Wu

प्रकाशित 2026-05-15
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Quanhao Li, Junqiu Yu, Kaixun Jiang, Yujie Wei, Zhen Xing, Pandeng Li, Ruihang Chu, Shiwei Zhang, Yu Liu, Zuxuan Wu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक प्रतिभाशाली लेकिन अनुभवहीन कलाकार (छात्र) को पेंटिंग करना सिखाने की कोशिश कर रहे हैं। समस्या यह है कि उस कलाकार को एक साथ तीन बहुत अलग कौशल सीखने की आवश्यकता है: सटीक टेक्स्ट बनाना, चित्रों को सुंदर बनाना, और एक दृश्य में वस्तुओं को सही ढंग से व्यवस्थित करना।

अतीत में, इन सभी कौशलों को एक साथ सिखाने की कोशिश करना एक आपदा थी। यदि आप कलाकार को एक ही समय में "इसे सुंदर बनाओ" और "टेक्स्ट को सटीक बनाओ" कहते, तो वे भ्रमित हो जाते और सबक आपस में टकरा जाते। वैकल्पिक रूप से, उन्हें एक समय में एक कौशल सिखाना (पहले टेक्स्ट, फिर सुंदरता, फिर व्यवस्था) धीमा था, और जब तक वे तीसरा कौशल सीख लेते, वे अक्सर पहले दो कौशल भूल जाते थे।

DiffusionOPD इस कलाकार को प्रशिक्षित करने का एक नया, स्मार्ट तरीका है। यह कैसे काम करता है, इसे सरल चरणों में यहाँ दिया गया है:

1. "विशेषज्ञ शिक्षक" रणनीति

छात्र को सब कुछ एक साथ सिखाने के बजाय, शोधकर्ता पहले तीन विशेषज्ञ शिक्षकों को नियुक्त करते हैं:

  • शिक्षक A टेक्स्ट लिखने में माहिर है।
  • शिक्षक B चीजों को सुंदर बनाने में माहिर है।
  • शिक्षक C वस्तुओं को व्यवस्थित करने में माहिर है।

प्रत्येक शिक्षक अकेले प्रशिक्षण देता है, केवल अपने विशिष्ट कौशल पर ध्यान केंद्रित करता है। क्योंकि वे छात्र का ध्यान खींचने के लिए आपस में लड़ नहीं रहे हैं, वे बिना भ्रमित हुए अपने स्वयं के क्षेत्रों में विशेषज्ञ बन जाते हैं।

2. "शैडोइंग" तकनीक (ऑन-पॉलिसी डिस्टिलेशन)

अब, छात्र अपने दम पर पेंटिंग करना शुरू करता है। जैसे ही छात्र पेंटिंग करता है, वह केवल अनुमान नहीं लगाता; वह शिक्षकों का "शैडोइंग" (अनुसरण) करता है।

  • छात्र अपनी पेंटिंग प्रक्रिया में एक कदम उठाता है।
  • संबंधित विशेषज्ञ शिक्षक उस कदम को देखता है और कहता है, "मैं इस विशिष्ट भाग को ठीक इसी तरह पेंट करता।"
  • छात्र तुरंत उस विशिष्ट कदम की नकल करता है।

यह पूरी पेंटिंग बनाते समय निरंतर होता रहता है। छात्र विशेषज्ञों को देखते हुए और काम करते समय ही उनसे सीखता है, न कि काम पूरा होने के बाद निर्देश प्राप्त करता है।

3. गुप्त मंत्र: एक "क्रिस्टल क्लियर" गणितीय सूत्र

शोध पत्र की सबसे बड़ी सफलता यह है कि छात्र शिक्षकों से कैसे सीखता है।

  • पुराना तरीका (PPO): कल्पना कीजिए कि आप एक ऐसे शिक्षक को सुनकर सीखने की कोशिश कर रहे हैं जो बहुत अधिक शोर (static noise) के माध्यम से बोल रहा है। आपको सामान्य विचार तो मिल जाता है, लेकिन आपको विवरणों का अनुमान लगाना पड़ता है, और अनुमान लगाने के कारण आपका मस्तिष्क थक जाता है। यह सीखने के लिए "शोर वाले" गणित का उपयोग करने जैसा है।
  • DiffusionOPD का तरीका: शोधकर्ताओं ने एक "क्रिस्टल क्लियर" गणितीय सूत्र की खोज की है। क्योंकि डिफ्यूजन मॉडल जिस तरह से काम करते हैं वे अनुमानित हैं (एक ऊबड़-खाबड़ उछाल के बजाय एक चिकनी ढलान की तरह), वे छात्र द्वारा किए गए कार्य और शिक्षक द्वारा किए जाने वाले कार्य के बीच के सटीक अंतर की गणना कर सकते हैं।

यह ऐसा है जैसे छात्र के हाथ में एक पूर्ण, शोर-मुक्त ब्लूप्रिंट है। उसे अनुमान लगाने की आवश्यकता नहीं है; वह शिक्षक के समाधान तक का सटीक रास्ता देख सकता है और सीधे उस पर चल सकता है। यह सीखने को बहुत तेज़ और स्थिर बनाता है।

4. यह बेहतर क्यों है

शोध पत्र दिखाता है कि यह विधि दो मुख्य तरीकों से जीतती है:

  • गति: छात्र बहुत तेज़ी से सीखता है क्योंकि वह अनुमान लगाने या विरोधाभासी निर्देशों से जूझने में समय बर्बाद नहीं कर रहा है।
  • गुणवत्ता: अंतिम पेंटिंग सभी कार्यों (टेक्स्ट, सुंदरता और व्यवस्था) में उस स्थिति से बेहतर है जब छात्र ने उन सभी को एक साथ सीखने या एक-एक करके सीखने की कोशिश की होती।

निष्कर्ष

DiffusionOPD एक छात्र कलाकार को उसकी अपनी रचनात्मक प्रक्रिया के माध्यम से चरण-दर-चरण मार्गदर्शन करने के लिए विश्व स्तरीय विशेषज्ञों की एक टीम को नियुक्त करने जैसा है, जो एक पूर्ण, शोर-मुक्त निर्देश पुस्तिका का उपयोग करता है। यह एक साथ सब कुछ करने के भ्रम और एक-एक करके सीखने के विस्मरण (forgetting) से बचता है, जिसके परिणामस्वरूप एक ऐसा AI मिलता है जो प्रशिक्षित करने में तेज़ है और जो भी करता है उसमें बेहतर है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →