← नवीनतम पेपर
🤖 AI

LESA: Learnable Stage-Aware Predictors for Diffusion Model Acceleration

यह शोध पत्र LESA का प्रस्ताव करता है, जो एक लर्नबल स्टेज-अवेयर प्रेडिक्टर फ्रेमवर्क है जो विभिन्न टेक्स्ट-टू-इमेज और टेक्स्ट-टू-वीडियो मॉडल्स में जनरेशन की गुणवत्ता को बनाए रखते हुए या उसमें सुधार करते हुए डिफ्यूजन ट्रांसफॉर्मर्स को महत्वपूर्ण रूप से त्वरित करने के लिए कोलमोगोरोव-आर्नोल्ड नेटवर्क और एक मल्टी-स्टेज, मल्टी-एक्सपर्ट आर्किटेक्चर का उपयोग करता है।

मूल लेखक: Peiliang Cai, Jiacheng Liu, Haowen Xu, Xinyu Wang, Chang Zou, Linfeng Zhang

प्रकाशित 2026-03-17
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Peiliang Cai, Jiacheng Liu, Haowen Xu, Xinyu Wang, Chang Zou, Linfeng Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक उत्कृष्ट कृति (masterpiece) पेंट करने की कोशिश कर रहे हैं, लेकिन आपका एक बहुत सख्त नियम है: आपको एक बार में केवल एक छोटा सा ब्रशस्ट्रोक लगाना है, और आपको अगला स्ट्रोक लगाने से पहले पेंट के सूखने का इंतज़ार करना होगा। यह इस तरह काम करता है जैसे डिफ्यूजन मॉडल्स (Diffusion Models - जो DALL-E 3 या Midjourney जैसे टूल्स के पीछे की AI है)। वे एक कैनवास से शुरू करते हैं जो पूरी तरह से स्टैटिक नॉइज़ (जैसे टीवी पर दिखने वाली बर्फ/static) से भरा होता है और धीरे-धीरे, स्टेप-दर-स्टेप, उस शोर को "डीनॉइज़" (denoise) करते हैं जब तक कि एक स्पष्ट छवि दिखाई न देने लगे।

समस्या क्या है? यह प्रक्रिया अविश्वसनीय रूप से धीमी है। एक तस्वीर पेंट करने में शायद 50 स्टेप्स लग सकते हैं, और प्रत्येक स्टेप के लिए AI को भारी मात्रा में गणित करने की आवश्यकता होती है। यह कमरे के एक छोर से दूसरे छोर तक जाने के लिए सामान्य रूप से चलने के बजाय 50 छोटे, सचेत कदम उठाने जैसा है।

LESA एक नया "शॉर्टकट" है जो AI को बिना पेंटिंग खराब किए बड़े कदम (giant leaps) लेने की अनुमति देता है। यह कैसे काम करता है, यहाँ सरल भाषा में समझाया गया है:

1. समस्या: "एक ही नियम सबके लिए" वाली गलती

इसे तेज़ करने के पिछले प्रयास ऐसे थे जैसे किसी कार को हर स्थिति में एक ही गियर का उपयोग करके चलाने की कोशिश करना।

  • "रीयूज़" (Reuse) विधि: कुछ विधियों ने बस यह कहा, "हे, पिछली तस्वीर लगभग वैसी ही दिख रही है जैसा पिछला स्टेप था, तो चलो पिछले स्टेप के काम को ही कॉपी कर लेते हैं।" यह कुछ समय के लिए तो काम करता है, लेकिन अंत में, तस्वीर धुंधली या अजीब हो जाती है क्योंकि AI वास्तव में थोड़ा बदला था, भले ही वह बदलाव बहुत कम था।
  • "अनुमान लगाने" (Guessing) की विधि: अन्यों ने पिछले कुछ स्टेप्स के आधार पर एक सीधी रेखा खींचकर भविष्य की भविष्यवाणी करने की कोशिश की (जैसे यह अनुमान लगाना कि एक गेंद कहाँ गिरेगी)। यह तब अच्छा काम करता है जब गेंद सुचारू रूप से लुढ़क रही हो, लेकिन जब गेंद अचानक उछलती है या दिशा बदल देती है, तो यह विफल हो जाता है।

लेखकों ने महसूस किया कि AI की "पेंटिंग प्रक्रिया" एक सीधी रेखा नहीं है। इसके तीन अलग-अलग चरण (phases) हैं:

  1. अराजकता का चरण (Chaos Phase - उच्च शोर): शुरुआत में, छवि जंगली रूप से बदल रही होती है। यह एक तूफानी समुद्र की तरह है। अगली लहर की भविष्यवाणी करना कठिन है क्योंकि सब कुछ बहुत तेज़ी से बदल रहा है।
  2. प्रवाह का चरण (Flow Phase - मध्यम शोर): छवि आकार लेने लगती है। बदलाव सुचारू और अनुमानित होते हैं, जैसे एक शांत नदी।
  3. विवरण का चरण (Detail Phase - निम्न शोर): छवि लगभग पूरी हो चुकी है। AI बस सूक्ष्म विवरण (जैसे पलकें या बनावट) जोड़ रहा है। बदलाव बहुत छोटे और सटीक होते हैं।

पुराने तरीकों ने तीनों चरणों के लिए एक ही भविष्यवाणी नियम का उपयोग करने की कोशिश की, जो एक ही जोड़ी जूतों को पहनकर सुनामी में सर्फिंग करने, नदी में सवारी करने और सुई में धागा पिरोने की कोशिश करने जैसा है। यह काम नहीं करता।

2. समाधान: LESA (एक "विशेषज्ञ टीम")

LESA का अर्थ है Learnable Stage-Aware predictors। LESA को एक स्मार्ट AI के रूप में नहीं, बल्कि तीन विशेषज्ञ विशेषज्ञों की एक टीम के रूप में सोचें, जिनमें से प्रत्येक का एक विशिष्ट कार्य है:

  • विशेषज्ञ 1 (तूफान का पीछा करने वाला - The Storm Chaser): अराजक शुरुआत में माहिर। वे जंगली, अप्रत्याशित बदलावों को संभालने में अच्छे हैं।
  • विशेषज्ञ 2 (नदी का मार्गदर्शक - The River Guide): मध्य चरण में माहिर। वे सुचारू, निरंतर प्रवाह की भविष्यवाणी करने में बेहतरीन हैं।
  • विशेषज्ञ 3 (माइक्रो-स्कैल्पल - The Micro-Scalpel): अंतिम चरण में माहिर। वे सूक्ष्म, अंतिम विवरणों के लिए अविश्वसनीय रूप से सटीक हैं।

अंधाधुंध अनुमान लगाने के बजाय, LESA पेंटिंग के वर्तमान चरण को देखता है और सही विशेषज्ञ पर स्विच कर देता है। यह सुनिश्चित करता है कि भविष्यवाणी हमेशा उस विशिष्ट क्षण के लिए सटीक हो।

3. गुप्त हथियार: "गणितीय स्विस आर्मी नाइफ" (KAN)

ये विशेषज्ञ इतने अच्छे कैसे बनते हैं? शोध पत्र में एक विशेष प्रकार के न्यूरल नेटवर्क का उपयोग किया गया है जिसे कोलमोगोरोव-आर्नोल्ड नेटवर्क (Kolmogorov-Arnold Network - KAN) कहा जाता है।

  • पुराना तरीका (MLP): कल्पना कीजिए कि एक मानक AI एक फैक्ट्री वर्कर की तरह है जो केवल हथौड़े का उपयोग कर सकता है। यदि उन्हें कुछ पेंच कसने की आवश्यकता है, तो उन्हें इसे तब तक मारना पड़ता है जब तक कि काम न बन जाए। यह कठोर है।
  • LESA का तरीका (KAN): कल्पना कीजिए कि एक AI एक स्विस आर्मी नाइफ है। यह काम के आधार पर पेचकश, ब्लेड या कॉर्कस्क्रू बनने के लिए सीख सकता है। KANs लचीले होते; वे डेटा के विशिष्ट वक्र (curve) के अनुकूल होने के लिए अपने गणित को "आकार" दे सकते हैं। यह उन्हें AI की पेंटिंग प्रक्रिया के जटिल, टेढ़े-मेढ़े पैटर्न को पारंपरिक कठोर तरीकों की तुलना में बहुत बेहतर तरीके से सीखने की अनुमति देता है।

4. प्रशिक्षण: "अभ्यास ही पूर्णता है"

इस टीम को सिखाने के लिए, शोधकर्ताओं ने दो-चरणीय प्रशिक्षण (two-stage training) पद्धति का उपयोग किया:

  1. शिक्षक-छात्र चरण (Teacher-Student Phase): सबसे पहले, उन्होंने AI को पूरी तस्वीर सामान्य रूप से पेंट करने दी (जिसे "ग्राउंड ट्रुथ" कहा जाता है)। LESA विशेषज्ञ देखते हैं और सीखते हैं, शिक्षक के स्टेप्स की पूरी तरह से नकल करने की कोशिश करते हैं।
  2. "ड्रिफ्ट" चरण (The "Drift" Phase): फिर, उन्होंने विशेषज्ञों को अपनी भविष्यवाणियों का उपयोग करके तस्वीर बनाने की कोशिश करने दी। यदि वे कोई गलती करते हैं, तो उन्हें केवल सुधारा नहीं जाता; उन्हें अपनी गलतियों के आधार पर पेंटिंग जारी रखनी होती है। यह उन्हें मजबूत और विश्वसनीय बनाता है ताकि वे थोड़ा भटकने पर घबराएं नहीं।

परिणाम: सुपर स्पीड, बिना गुणवत्ता खोए

परिणाम प्रभावशाली हैं। LESA का उपयोग करके:

  • FLUX.1 (एक लोकप्रिय इमेज मॉडल) गुणवत्ता में लगभग बिना किसी कमी के 5 गुना तेज़ हो गया।
  • Qwen-Image 6.25 गुना तेज़ हो गया, और छवियां पिछले स्पीड-अप तरीकों की तुलना में वास्तव में बेहतर थीं।
  • HunyuanVideo (एक वीडियो जनरेटर) वीडियो को स्मूथ और स्पष्ट रखते हुए 5 गुना तेज़ हो गया।

संक्षेप में:
कल्पना कीजिए कि आप एक खेत में चल रहे हैं।

  • सामान्य AI: 50 छोटे, सावधानी भरे कदम उठाता है। (धीमा)
  • पुराना स्पीड-अप: दौड़ने की कोशिश करता है, लेकिन लड़खड़ा जाता है क्योंकि उसे इलाके का पता नहीं है। (तेज़ लेकिन अव्यवस्थित)
  • LESA: एक नक्शा रखता है जो बताता है, "यहाँ एक कीचड़ भरा दलदल है, सावधानी से चलें। यहाँ एक चिकना रास्ता है, दौड़ें! यहाँ एक कांच का फर्श है, दबे पाँव चलें!" यह मैदान पार करने के लिए अपनी गति और शैली को अनुकूलित करता है, जिससे आप बिना गिरे रिकॉर्ड समय में मैदान पार कर लेते हैं।

LESA AI इमेज और वीडियो जनरेशन को वास्तविक समय (real-time) के अनुप्रयोगों के लिए इतना तेज़ बनाता है, बिना उस सुंदर गुणवत्ता के जिसे हम उम्मीद करते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →