← नवीनतम पेपर
💻 computer science

Few-Step Diffusion Sampling Through Instance-Aware Discretizations

यह शोध पत्र एक इंस्टेंस-अवेयर डिस्क्रीटाइजेशन फ्रेमवर्क प्रस्तावित करता है जो इनपुट-डिपेंडेंट प्रायर्स के आधार पर टाइमस्टेप एलोकेशन्स को अनुकूलित करना सीखता है, जिससे वैश्विक रूप से साझा किए गए शेड्यूल्स की सीमाओं को दूर किया जा सकता है और नगण्य इन्फरेंस ओवरहेड के साथ विविध डिफ्यूजन और फ्लो मैचिंग मॉडल्स में निरंतर जनरेशन की गुणवत्ता में सुधार किया जा सकता है।

मूल लेखक: Liangyu Yuan, Ruoyu Wang, Tong Zhao, Dingwen Fu, Mingkun Lei, Beier Zhu, Chi Zhang

प्रकाशित 2026-03-19
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Liangyu Yuan, Ruoyu Wang, Tong Zhao, Dingwen Fu, Mingkun Lei, Beier Zhu, Chi Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जटिल पेंटिंग को फिर से बनाने की कोशिश कर रहे हैं, जैसे कि कोई विस्तृत परिदृश्य (landscape) या किसी व्यक्ति का चित्र। आप एक खाली कैनवास से शुरुआत करते हैं जो स्टैटिक शोर (जैसे टीवी पर दिखने वाला बर्फ जैसा शोर/static noise) से ढका हुआ है। आपका लक्ष्य उस शोर को धीरे-धीरे एक अंतिम चित्र में बदलना है।

डिफ्यूजन मॉडल्स (DALL-E 3 या Midjourney जैसे टूल्स के पीछे की AI) ऐसा ही करते हैं—वे शोर को थोड़ा-थोड़ा करके साफ करते हैं, जब तक कि चित्र स्पष्ट न हो जाए।

समस्या: "एक ही आकार सबके लिए" वाला नक्शा (The "One-Size-Fits-All" Map)

शोर से चित्र तक पहुँचने के लिए, AI एक गणितीय पथ का अनुसरण करता है। इस प्रक्रिया को तेज़ करने के लिए, AI को इस पथ पर "कदम" (steps) लेने होते हैं।

  • पुराना तरीका: कल्पना कीजिए कि एक टूर गाइड 100 लोगों के समूह को शहर के भ्रमण पर ले जा रहा है। गाइड के पास पूरे दिन के लिए एक एकल, पूर्व-लिखित यात्रा कार्यक्रम (itinerary) है।
    • उन लोगों के लिए जो एक साधारण पार्क देखना चाहते हैं, गाइड उन्हें पहले संग्रहालयों के एक जटिल और घुमावदार भूलभुलैया से गुजरने के लिए मजबूर करता है। यह समय की बर्बादी है।
    • उन लोगों के लिए जो एक विशाल कैथेड्रल देखना चाहते हैं, गाइड उन्हें पार्क के माध्यम से बहुत तेज़ी से ले जाता है, जिससे वे बारीकियों को मिस कर देते हैं।
    • परिणाम: हर कोई अपनी मंजिल तक पहुँच तो जाता है, लेकिन कुछ लोग ऊब जाते हैं, कुछ भ्रमित हो जाते हैं, और अंतिम तस्वीरें भी एकदम सटीक नहीं होतीं। AI के संदर्भ में, इसे ग्लोबल शेड्यूल (Global Schedule) कहा जाता है। यह हर इमेज के लिए समान संख्या में स्टेप्स का उपयोग करता है, चाहे वह इमेज कितनी भी कठिन क्यों न हो।

समाधान: हर इमेज के लिए एक व्यक्तिगत GPS

यह पेपर एक नई विधि पेश करता है जिसे INDIS (इंस्टेंस-अवेयर डिसक्रेटाइजेशन - Instance-Aware Discretization) कहा जाता है।

INDIS को एक व्यक्तिगत GPS के रूप में सोचें जो यात्रा शुरू करने से पहले आपके विशिष्ट शुरुआती बिंदु और गंतव्य को देखता है।

  1. यह यात्रा का विश्लेषण करता है: AI इमेज बनाना शुरू करने से पहले, यह विशिष्ट "शोर" (शुरुआती बिंदु) और प्रॉम्प्ट (जैसे, "एक बिल्ली" बनाम "एक अराजक विस्फोट") को देखता है।
  2. यह स्टेप्स को कस्टमाइज़ करता है:
    • यदि इमेज सरल है (जैसे नीला आकाश), तो GPS कहता है, "बड़े, तेज़ कदम उठाएं। हम 3 मूव्स में वहां पहुँच सकते हैं!"
    • यदि इमेज जटिल है (जैसे विवरणों से भरा एक चेहरा), तो GPS कहता है, "धीमे हो जाइए। आँखों को सही बनाने के लिए यहाँ छोटे, सावधानीपूर्ण कदम उठाएं।"
  3. परिणाम: हर इमेज को ठीक उतनी ही "मेहनत" मिलती है जितनी उसे चाहिए। सरल चीजें तुरंत बन जाती हैं; जटिल चीजों को आवश्यक अतिरिक्त ध्यान मिलता है।

यह क्यों महत्वपूर्ण है

  • गति बनाम गुणवत्ता (Speed vs. Quality): आमतौर पर, यदि आप उच्च-गुणवत्ता वाली इमेज चाहते हैं, तो आपको अधिक समय तक प्रतीक्षा करनी पड़ती है (अधिक स्टेप्स लेने पड़ते हैं। यदि आप तेज़ चाहते हैं, तो गुणवत्ता गिर जाती है। INDIS इस समझौते (trade-off) को तोड़ देता है। यह बहुत कम स्टेप्स (कभी-कभी केवल 3 या 5) में उच्च-गुणवत्ता वाले परिणाम प्राप्त करता है क्योंकि यह इमेज के आसान हिस्सों पर समय बर्बाद नहीं करता है।
  • कोई री-ट्रेनिंग नहीं (No Re-Training): सबसे अच्छी बात? AI मॉडल को शुरू से फिर से प्रशिक्षित करने की आवश्यकता नहीं है। यह मौजूदा टूर गाइड को एक नया, स्मार्ट GPS डिवाइस देने जैसा है। यह एक हल्का अपग्रेड है जो तुरंत काम करता है।

उदाहरण के रूप में एनालॉजी (Analogy in Action)

कल्पना कीजिए कि आप कुकीज़ बेक कर रहे हैं।

  • ग्लोबल शेड्यूल: आप कुकीज़ के हर बैच को ठीक 12 मिनट के लिए ओवन में रखते हैं। कुछ कुकीज़ अधपकी (गीली) रह जाती हैं, और कुछ जल जाती हैं।
  • INDIS: आपके पास एक स्मार्ट ओवन है जो प्रत्येक कुकी की व्यक्तिगत रूप से जांच करता है। वह देखता है कि चॉकलेट चिप कुकी को 10 मिनट चाहिए, जबकि ओटमील किशमिश वाली कुकी को 14 मिनट चाहिए। यह स्वचालित रूप से हर कुकी के लिए टाइमर को एडजस्ट करता है।

सारांश

यह पेपर AI इमेज जनरेटर्स को एक स्मार्ट तरीका बताने का प्रस्ताव देता है: "हर तस्वीर के साथ एक जैसा व्यवहार न करें। देखें कि आप क्या बना रहे हैं, और तय करें कि इसे परफेक्ट बनाने के लिए आपको ठीक कितने स्टेप्स की आवश्यकता है।"

परिणाम स्वरूप तेज़ जेनरेशन, अधिक शार्प इमेज और कम कंप्यूटिंग पावर की बर्बादी होती है, और इसके लिए AI को बुनियादी स्तर से फिर से बनाने की आवश्यकता नहीं होती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →