← नवीनतम पेपर
💻 computer science

CAB: Accelerating Flow and Diffusion Sampling via Rectification and Corrected Adams-Bashforth

यह शोध पत्र CAB (करेक्टेड एडम्स-बश्फोर्थ) प्रस्तुत करता है, जो एक ट्रेनिंग-मुक्त सैंपलर है जो सैंपलिंग डायनेमिक्स को एक रेक्टिफाइड कोऑर्डिनेट सिस्टम में बदलकर और एक करेक्शन टर्म के साथ मल्टीस्टेप प्रेडिक्टर लागू करके फ्लो और डिफ्यूजन मॉडल्स को त्वरित करता है, जिससे बिना किसी अतिरिक्त फंक्शन इवैल्यूएशन की आवश्यकता के कम-स्टेप रिजीम में गुणवत्ता-दक्षता ट्रेड-ऑफ में महत्वपूर्ण सुधार होता है।

मूल लेखक: Anuska Roy, Pravin Nair

प्रकाशित 2026-05-20
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Anuska Roy, Pravin Nair

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बिल्ली की एकदम सटीक तस्वीर बनाने की कोशिश कर रहे हैं, लेकिन आपकी आँखों पर पट्टी बंधी हुई है। आपके पास एक जादुई मार्गदर्शक (AI मॉडल) है जो आपको निर्देश फुसफुसाता है: "अपना हाथ थोड़ा बाईं ओर ले जाएं," "थोड़ा ऊपर जाएं," "रुकें।"

AI इमेज जनरेशन की दुनिया में, इस "फुसफुसाहट" को सैंपलिंग (sampling) कहा जाता है। AI शोर (static noise) से भरे एक कैनवास से शुरू करता है और एक गणितीय पथ का अनुसरण करते हुए धीरे-धीरे इसे एक स्पष्ट छवि में बदल देता है।

समस्या: धीमी चाल (The Slow Walk)

आमतौर पर, एक सटीक तस्वीर पाने के लिए, AI को कई छोटे कदम (अक्सर 50 या अधिक) उठाने पड़ते हैं। प्रत्येक कदम के लिए AI को "सोचना" (एक जटिल गणना चलाना) पड़ता है। यदि आप इसे केवल कुछ ही कदम (मान लीजिए 6 से 10) लेने की अनुमति देते हैं, तो तस्वीर अक्सर धुंधली, विकृत, या अजीब चीजों से भरी आती है, जैसे कि तीन कानों वाली बिल्ली या पिघलता हुआ चेहरा।

तेजी से काम करने के मौजूदा तरीके दो अलग-अलग प्रकार के शॉर्टकट की तरह हैं:

  1. "ट्रेनिंग" शॉर्टकट: आप AI को चलने का एक नया, तेज़ तरीका सिखाते हैं। यह अच्छा काम करता है लेकिन इसे सीखने में बहुत समय लगता है और यह हर AI पर काम नहीं करता।
  2. "स्मार्ट वॉकर" शॉर्टकट: आप AI को एक स्मार्ट मैप देते हैं ताकि वह बिना गिरे बड़े कदम उठा सके। लेकिन अगर मैप बहुत जटिल है, तो AI भ्रमित हो जाता है और यदि वह पर्याप्त कदम नहीं लेता है, तो तस्वीर खराब हो जाती है।

समाधान: CAB (द "करेक्टेड एडम्स-बाशफोर्थ" मेथड)

लेखकों ने CAB नामक एक नया तरीका प्रस्तावित किया है। CAB को एक ऐसे GPS की तरह समझें जिसमें एक "करेक्शन" (सुधार) फीचर है जो बिना किसी नए प्रशिक्षण के किसी भी मौजूदा AI पर काम करता है।

यहाँ बताया गया है कि CAB कैसे काम करता है, एक सरल उपमा का उपयोग करके:

1. रास्ता सीधा करना (Rectification)

कल्पना कीजिए कि जिस रास्ते पर AI को चलना है वह एक घुमावदार, टेढ़ा-मेढ़ा पहाड़ी रास्ता है। घुमावदार सड़क पर बड़े कदम उठाना खतरनाक है; आप मोड़ चूक सकते हैं और नीचे गिर सकते हैं।

  • CAB क्या करता है: यह जादुई रूप से रास्ते को सीधा कर देता है। यह घुमावदार पथ को एक सीधे हाईवे में बदल देता है।
  • यह क्यों मदद करता है: एक सीधे रास्ते पर, आप मोड़ मिस होने की चिंता किए बिना बड़े, आत्मविश्वास भरे कदम उठा सकते हैं। इससे AI के लिए गणित बहुत आसान हो जाता है।

2. "पीछे देखना" वाला कदम (Adams-Bashforth)

अब जब रास्ता सीधा हो गया है, तो CAB एडम्स-बाशफोर्थ (Adams-Bashforth) नामक एक तकनीक का उपयोग करता है।

  • उपमा: कल्पना कीजिए कि आप एक सीधे रास्ते पर चल रहे हैं। केवल यह देखने के बजाय कि आप अभी कहाँ हैं, आप यह देखते हैं कि आप 2 या 3 कदम पहले कहाँ थे। आप भविष्य का अनुमान लगाने के लिए उस इतिहास का उपयोग करते हैं कि आपको आगे कहाँ जाना चाहिए।
  • लाभ: यह AI को केवल कुछ ही कदमों में बहुत सटीक रूप से भविष्य के पथ का अनुमान लगाने की अनुमति देता है।

3. "सेफ्टी नेट" (The Correction)

यही असली जादू है। कभी-कभी, एक सीधे रास्ते पर भी, ज़मीन अचानक बदल सकती है (शायद हवा चल जाए, या ज़मीन खिसक जाए)। एक साधारण "पीछे देखने" वाला अनुमान अभी भी थोड़ा गलत हो सकता है।

  • CAB क्या करता है: यह एक छोटा सा करेक्शन टर्म (सुधार शब्द) जोड़ता है। यह जाँच करता है: "क्या मेरा अनुमान पिछले कदम की वास्तविकता से मेल खाता था?" यदि AI का अनुमान थोड़ा गलत था, तो CAB पिछले कदम और अनुमान के बीच के अंतर के आधार पर एक छोटा, त्वरित सुधार लागू करता है।
  • जादू: यह यह सब बिना AI को कोई अतिरिक्त काम दिए करता है। यह उस जानकारी का उपयोग करता है जो AI ने पिछले चरणों में पहले ही गणना कर ली थी। यह एक को-पायलट की तरह है जो ड्राइवर को कार रोकने के लिए कहे बिना, स्टीयरिंग में एक छोटा सा समायोजन फुसफुसाता है।

परिणाम: स्पष्ट तस्वीरें, तेज़ गति

लेखकों ने विभिन्न AI मॉडलों (इमेज और वीडियो दोनों के लिए) पर इस नए तरीके का परीक्षण किया और पाया:

  • कम स्टेप काउंट (6–20 स्टेप्स): यहीं पर CAB सबसे बेहतर प्रदर्शन करता है। जबकि अन्य तरीके तेज़ी से चलने के लिए मजबूर किए जाने पर धुंधली या शोर वाली छवियां बनाते हैं, CAB स्पष्ट, साफ और विस्तृत चित्र बनाता है।
    • उदाहरण: पेपर के परीक्षणों में, जब केवल 6 स्टेप्स में एक बस या टेनिस खिलाड़ी को बनाने के लिए कहा गया, तो अन्य तरीकों ने बस को एक धब्बे जैसा बना दिया या खिलाड़ी का चेहरा विकृत कर दिया। CAB विवरणों को स्पष्ट और संरचना को सही रखता है।
  • हाई स्टेप काउंट: जब कई स्टेप्स दिए जाते हैं, तो CAB मौजूदा सर्वोत्तम तरीकों के समान ही प्रदर्शन करता है, जिससे सिद्ध होता है कि यह किसी चीज़ को बिगाड़ता नहीं है।
  • कोई अतिरिक्त लागत नहीं: इसके लिए AI को फिर से प्रशिक्षित करने की आवश्यकता नहीं है, और यह प्रक्रिया को धीमा नहीं करता है। वास्तव में, यह प्रक्रिया को अधिक कुशल बनाता है क्योंकि आपको कम स्टेप्स के साथ बेहतर परिणाम मिलते हैं।

सारांश में

CAB एक मौजूदा AI को एक सीधा रास्ता और एक स्मार्ट को-पायलट देने जैसा है जो स्टीयरिंग व्हील में छोटे, मुफ्त समायोजन करता है। यह AI को सामान्य समय के एक अंश में उच्च गुणवत्ता वाली छवियां और वीडियो बनाने की अनुमति देता है, बिना कुछ भी नया सीखे। यह "जल्दबाजी में धुंधली तस्वीरों" की समस्या को इसलिए हल करता है क्योंकि यह यात्रा को केवल तेज़ ही नहीं, बल्कि स्मार्ट बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →