← नवीनतम पेपर
🤖 AI

ResilPhase: Plug-and-Play Phase Mapping and Noise-Resilient Macro-Trajectory Extrapolation for Diffusion Acceleration

ResilPhase एक प्लग-एंड-प्ले फ्रेमवर्क है जो डिफ्यूजन मॉडल्स को तेज़ करता है, जो इन्फरेंस को ODE स्पेस में स्थिर मैक्रो-ट्रैजेक्टरी एक्सट्रपलेशन के रूप में पुनर्गठित करता है, और मौजूदा कैश-देन-फोरकास्ट विधियों में निहित गुणवत्ता गिरावट और अस्थिरता को दूर करने के लिए एक डेरिवेटिव-फ्री बैरीसेंट्रिक लैग्रेंज एक्सट्रैपोलेटर और बाउंडेड फेज मैपिंग का उपयोग करता है।

मूल लेखक: Qicheng Zhao, Yu Li, Qi Sun, Zheyu Yan

प्रकाशित 2026-06-26
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Qicheng Zhao, Yu Li, Qi Sun, Zheyu Yan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोलरकोस्टर के रास्ते की भविष्यवाणी करने की कोशिश कर रहे हैं। इसे सटीक रूप से करने के लिए, आपको आमतौर पर हर एक सेकंड में कार की स्थिति की जांच करनी होगी, यह देखना होगा कि वह कितनी तेज़ चल रही है (गति), उसकी गति कैसे बदल रही है (त्वरण/acceleration), और वह त्वरण कैसे बदल रहा है (जर्क/jerk)।

समस्या: "अत्यधिक जटिल" रोलरकोस्टर
वर्तमान AI इमेज और वीडियो जनरेटर (जिन्हें डिफ्यूजन मॉडल्स कहा जाता है) इसी तरह काम करते हैं। एक तस्वीर बनाने के लिए, वे सैकड़ों छोटे चरणों से गुजरते हैं, और हर एक क्षण में छवि की स्थिति की जांच करते हैं। यह अविश्वसनीय रूप से धीमा है।

चीजों को तेज़ करने के लिए, हाल के तरीकों ने चालाकी दिखाने की कोशिश की: "आइए बीच के चरणों को छोड़ दें! हम बस पिछले कुछ बिंदुओं को देखेंगे और अनुमान लगाएंगे कि अगला बिंदु कहाँ होगा।" उन्होंने इन बिंदुओं के माध्यम से एक रेखा खींचने के लिए गणितीय सूत्रों (पॉलीनोमियल्स) का उपयोग किया।

हालाँकि, यह शोध पत्र तर्क देता है कि ये तरीके विफल हो रहे हैं क्योंकि वे गलत चीजों पर ध्यान केंद्रित कर रहे हैं:

  1. वे गलत विवरण देख रहे हैं: पूरे रोलरकोस्टर ट्रैक को देखने के बजाय, वे कार के व्यक्तिगत बोल्ट्स की छोटी, थरथराहट वाली गतिविधियों की भविष्यवाणी करने की कोशिश कर रहे हैं। ये छोटी गतिविधियाँ अराजक और शोर (noisy) से भरी होती हैं। यदि आप एक बोल्ट पर गलत अनुमान लगाते हैं, तो वह त्रुटि पूरे कार के ढांचे में बढ़ती जाती है, जिससे पूरी भविष्यवाणी खराब हो जाती है।
  2. वे गलत गणित का उपयोग कर रहे हैं: वे शोर वाले बिंदुओं के बीच के अंतर को देखकर "गति" या "त्वरण" की गणना करने की कोशिश करते हैं। यह एक हिलते हुए पत्ते को देखकर हवा की गति मापने जैसा है। यह गणित शोर को बढ़ा देता है, जिससे भविष्यवाणी पटरी से उतर जाती है।
  3. "एज इफेक्ट" (किनारे का प्रभाव): जब आप बिंदुओं की एक सीधी रेखा के आधार पर भविष्य का अनुमान लगाने की कोशिश करते हैं, तो आप जितना दूर का अनुमान लगाएंगे, वह रेखा उतनी ही अधिक लहराएगी और किनारों पर अनियंत्रित हो जाएगी। यह गणित की एक ज्ञात समस्या है जिसे "रंग (Runge's) घटना" कहा जाता है।

समाधान: ResilPhase
लेखकों ने इन तीन समस्याओं को ठीक करने के लिए ResilPhase (रेज़िलिफ़ेज़ - रेज़िलिएंट फेज मैपिंग) नामक एक नया सिस्टम बनाया है। यह कैसे काम करता है, इसके लिए सरल उपमाओं का उपयोग किया गया है:

1. "बड़ी तस्वीर" की रणनीति (ग्लोबल ड्रिफ्ट)

हर एक बोल्ट (लेयर-दर-लेयर फीचर्स) की थरथराहट वाली गति की भविष्यवाणी करने के बजाय, ResilPhase एक सरल प्रश्न पूछता है: "यदि हम यहाँ से शुरू करते हैं और वहाँ समाप्त करते हैं, तो कुल तय की गई दूरी क्या है?"

इसे ग्लोबल ड्रिफ्ट कहा जाता है। कल्पना कीजिए कि आपको सड़क के ऊबड़-खाबड़पन से कोई लेना-देना नहीं है; आपको केवल स्टेशन से फिनिश लाइन तक की सीधी रेखा की परवाह है। इस बड़ी, सुचारू गति की भविष्यवाणी करके, AI उस "डोमिनो प्रभाव" से बच जाता है जहाँ छोटी त्रुटियां जमा होकर पूरी छवि को नष्ट कर देती हैं। यह बिखरे हुए बीच के विवरणों को छोड़कर अंत-से-अंत तक की यात्रा पर ध्यान केंद्रित करता है।

2. "बिना स्पीडोमीटर" वाली रणनीति (डेरिवेटिव-फ्री)

पुराने तरीकों ने भविष्य का अनुमान लगाने के लिए गति और त्वरण की गणना करने की कोशिश की। लेकिन चूंकि डेटा शोर से भरा था, इसलिए गति की गणना करने से शोर और भी बढ़ गया।

ResilPhase कहता है, "गति की गणना मत करो। बस बिंदुओं को देखो।"
वे बेरीसेंट्रिक लैग्रेंज इंटरपोलेशन (Barycentric Lagrange Interpolation) नामक एक विशेष गणितीय तकनीक का उपयोग करते हैं। इसे ऐसे समझें जैसे बिंदुओं के एक सेट के माध्यम से एक चिकनी वक्र (curve) बनाना, बिना यह मापे कि पेन उनके बीच कितनी तेजी से चल रहा था। यह पूरी तरह से शोर वाले "गति" डेटा को अनदेखा करता है और बस बिंदुओं को सबसे स्थिर तरीके से जोड़ता है। यह शोर को भविष्यवाणी को बर्बाद करने से रोकता है।

3. "जादुई मानचित्र" की रणनीति (फेज मैपिंग)

सही रणनीति होने के बावजूद, समान रूप से अंतराल वाले बिंदुओं (जैसे हर 1 सेकंड में घड़ी देखना) के आधार पर भविष्य का अनुमान लगाने से किनारों पर अजीब लहरें (रंग की घटना) पैदा होती हैं।

ResilPhase फेज मैपिंग पेश करता है। कल्पना कीजिए कि आपके पास समय का एक रबर जैसा नक्शा है।

  • पुराना तरीका: आप मानचित्र को समान रूप से खींचते हैं। किनारे बहुत अधिक खिंच जाते हैं और फट जाते हैं (त्रुटियां विस्फोट करती हैं)।
  • नया तरीका: आप एक विशेष "लचीले" मानचित्र (जिसे चेबिशेव या बैलेंस्ड मैपिंग कहा जाता है) का उपयोग करते हैं। आप मानचित्र के बीच के हिस्से को अधिक खींचते हैं और किनारों को सिकोड़ते हैं। यह बिंदुओं को इस तरह से पुनर्व्यवस्थित करता है कि गणित स्थिर रहे, भले ही आप भविष्य में बहुत दूर की भविष्यवाणी कर रहे हों। यह भविष्यवाणी को सटीक और सुव्यवस्थित रखता है, जिससे "लहरें" छवि को नष्ट नहीं कर पातीं।

परिणाम

इन तीन विचारों को मिलाकर—बड़ी तस्वीर पर ध्यान केंद्रित करना, गति की गणना को छोड़ना, और स्थिरता बनाए रखने के लिए समय के मानचित्र को खींचना—ResilPhase पहले की तुलना में 5 गुना तेजी से चित्र और वीडियो बना सकता है।

महत्वपूर्ण बात यह है कि यह केवल तेज़ ही नहीं होता है; यह वास्तव में बेहतर भी होता है। जबकि अन्य तेज़ तरीके बहुत अधिक गति पर धुंधली या विकृत छवियां बनाते हैं, ResilPhase अत्यधिक गति पर भी विवरणों को स्पष्ट और रंगों को सही रखता है।

संक्षेप में: ResilPhase AI को शोर भरे विवरणों और अराजक गणित से भ्रमित होने से रोकता है, जिससे उसे "बड़ी तस्वीर" देखने और बहुत कम समय में उच्च गुणवत्ता वाली कला बनाने की अनुमति मिलती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →