← नवीनतम पेपर
🤖 machine learning

TAP: A Token-Adaptive Predictor Framework for Training-Free Diffusion Acceleration

यह शोध पत्र TAP को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त (training-free) फ्रेमवर्क है जो एक कम लागत वाले प्रोब के आधार पर प्रत्येक चरण में प्रत्येक टोकन के लिए सबसे सटीक प्रेडिक्टर को अनुकूल रूप से चुनकर डिफ्यूजन मॉडल इन्फरेंस को तेज़ करता है, जिससे न्यूनतम गुणवत्ता हानि के साथ महत्वपूर्ण गति प्राप्त होती है।

मूल लेखक: Haowei Zhu, Tingxuan Huang, Xing Wang, Tianyu Zhao, Jiexi Wang, Weifeng Chen, Xurui Peng, Fangmin Chen, Junhai Yong, Bin Wang

प्रकाशित 2026-03-05
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Haowei Zhu, Tingxuan Huang, Xing Wang, Tianyu Zhao, Jiexi Wang, Weifeng Chen, Xurui Peng, Fangmin Chen, Junhai Yong, Bin Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक कलाकार हैं जो एक उत्कृष्ट कृति (masterpiece) बनाने की कोशिश कर रहे हैं, लेकिन आपके पास एक बहुत सख्त नियम है: आपको चित्र पूरा करने के लिए 50 छोटे, सावधानी भरे कदम उठाने होंगे। हर एक कदम पर, आपको अपने विशाल आर्ट स्टूडियो के बिल्कुल पीछे तक जाना होगा, अपने पूरे कैनवास को देखना होगा, एक विशाल विश्वकोश (encyclopedia) से परामर्श करना होगा, और यह तय करना होगा कि आगे क्या पेंट करना है।

यही वह तरीका है जिससे वर्तमान डिफ्यूजन मॉडल्स (Diffusion Models) (Midjourney या DALL-E जैसे टूल्स के पीछे का AI) काम करते हैं। वे शोर (static noise) से शुरुआत करके और धीरे-धीरे उसे एक स्पष्ट चित्र में बदलकर इमेज बनाते हैं। समस्या यह है कि स्टूडियो के पीछे तक जाने और हर कदम पर विश्वकोश देखने में बहुत समय लगता है।

पुराना तरीका: "एक ही आकार सबके लिए" वाला शॉर्टकट (The "One-Size-Fits-All" Shortcut)

चीजों को तेज करने के लिए, पिछले AI शोधकर्ताओं ने एक शॉर्टकट आजमाया। उन्होंने कहा, "हे, स्टेप 10 और स्टेप 11 के बीच चित्र में बहुत ज्यादा बदलाव नहीं आता है। चलिए स्टेप 10 में जो किया था उसे ही कॉपी कर लेते हैं और दिखावा करते हैं कि हमने स्टेप 11 भी कर लिया।"

यह चित्र के सरल हिस्सों (जैसे नीला आसमान) के लिए ठीक काम करता है, लेकिन जटिल हिस्सों (जैसे एक भालू के फर या मानव चेहरे) के लिए बुरी तरह विफल हो जाता है। यदि आप भालू के कान को कॉपी-पेस्ट करते हैं, तो वह धुंधला या विकृत हो सकता है।

कुछ अधिक समझदार शोधकर्ताओं ने गणित का उपयोग करके अगले कदम का अनुमान (predict) लगाने की कोशिश की (जैसे किसी गेंद की वर्तमान गति के आधार पर यह अंदाजा लगाना कि वह कहाँ गिरेगी)। लेकिन उन्होंने पूरी इमेज के हर एक पिक्सेल के लिए एक ही भविष्यवाणी सूत्र (prediction formula) का उपयोग किया। यह पूरे पेंटिंग के लिए एक ही कठोर नियम पुस्तिका का उपयोग करने जैसा है। यह जटिल हिस्सों के लिए बहुत सरल है और सरल हिस्सों के लिए बहुत जटिल।

नया समाधान: TAP (द "स्मार्ट फोरमैन")

यह पेपर TAP (Token-Adaptive Predictor) को पेश करता है। TAP को एक पेंटर के रूप में नहीं, बल्कि पेंटरों (पिक्सेल, या "टोकन") की एक टीम को प्रबंधित करने वाले एक सुपर-स्मार्ट फोरमैन (सुपरवाइजर) के रूप में सोचें।

यहाँ बताया गया है कि TAP कैसे काम करता है, एक सरल उदाहरण का उपयोग करते हुए:

1. "एक त्वरित झलक" (The "Quick Peek" - द प्रोब)

TAP यह तय करने से पहले कि इमेज के एक विशिष्ट हिस्से के साथ क्या करना है, वह AI के मस्तिष्क की केवल पहली परत की एक सुपर-फास्ट, कम लागत वाली "झलक" (peek) लेता है।

  • उदाहरण: कल्पना कीजिए कि फोरमैन एक विशिष्ट पेंटर के पास जाता है और पूछता है, "हे, क्या तुम एक शांत आसमान पेंट कर रहे हो या एक उथल-पुथल भरा तूफान?"
  • इस "झलक" में लगभग कोई समय नहीं लगता, लेकिन यह फोरमैन को बताता है कि इमेज का वह विशिष्ट हिस्सा कितना बदल रहा है।

2. "टूलबॉक्स" (The "Toolbox" - द प्रेडिक्टर फैमिली)

TAP भविष्य का अनुमान लगाने के लिए केवल एक तरीके पर निर्भर नहीं रहता। इसके पास विभिन्न भविष्यवाणी विधियों से भरा एक टूलबॉक्स है:

  • सिंपल कॉपी: चिकने, उबाऊ हिस्सों के लिए अच्छा (जैसे एक दीवार)।
  • सिंपल मैथ: धीरे-धीरे बदलने वाले हिस्सों के लिए अच्छा।
  • कॉम्प्लेक्स मैथ: तेजी से चलने वाले, अराजक हिस्सों के लिए अच्छा (जैसे आग या फर)।

3. "काम के लिए सही औजार" (The "Right Tool for the Job" - टोकन-एडेप्टिव सिलेक्शन)

यही असली जादू है। इमेज के हर एक पिक्सेल के लिए, TAP यह तय करने के लिए "त्वरित झलक" का उपयोग करता है कि टूलबॉक्स से कौन सा टूल इस्तेमाल करना है।

  • पिक्सेल A (आसमान): झलक दिखाती है कि यह शांत है। TAP कहता है, "सिंपल कॉपी टूल का उपयोग करें।" हो गया।
  • पिक्सेल B (भालू की आँख): झलक दिखाती है कि यह तेजी से बदल रहा है। TAP कहता है, "कॉम्प्लेक्स मैथ टूल का उपयोग करें।" हो गया।

TAP यह काम हर एक पिक्सेल के लिए एक साथ करता है। यह ऐसा है जैसे एक फोरमैन जिसे तुरंत पता चल जाता है कि आसमान पेंट करने वाले पेंटर को झाड़ू की जरूरत है, जबकि आँखों पर काम करने वाले को स्कैल्पल (सर्जिकल चाकू) की जरूरत है।

यह एक बड़ी बात क्यों है?

  1. यह मुफ्त है (Training-Free): AI को इसे सीखने के लिए वापस स्कूल जाने की जरूरत नहीं है। TAP एक नया तरीका है जिससे मौजूदा किसी भी मॉडल का तुरंत उपयोग किया जा सकता है।
  2. यह तेज है: क्योंकि TAP अधिकांश पिक्सेल्स के लिए महंगे "स्टूडियो के पीछे जाने" के काम को छोड़ देता है, इसलिए इमेज की गुणवत्ता खोए बिना इमेज 6 गुना तेजी से (या उससे अधिक) जेनरेट होती है।
  3. यह स्मार्ट है: पुराने तरीकों ने पूरे इमेज को एक ही नियम से तेज करने की कोशिश की, जिससे जटिल हिस्से खराब दिखने लगे। TAP आसान हिस्सों को तेज करता है और कठिन हिस्सों को सावधानी से संभालता है।
  4. यह मेमोरी बचाता है: इसे पूरी पेंटिंग का इतिहास स्टोर करने के बजाय केवल थोड़ी सी जानकारी (एक "झलक") याद रखने की आवश्यकता होती है।

परिणाम

प्रयोगों में, TAP ने एक ऐसे मॉडल को लिया जिसे एक चित्र बनाने के लिए आमतौर पर 50 स्टेप्स लगते हैं और उसे लगभग 8 स्टेप्स में उतना ही अच्छा बना दिया।

  • पुराना तरीका: धीमा, या तेज लेकिन धुंधला।
  • TAP: तेज और स्पष्ट।

संक्षेप में: TAP एक ऐसे कंडक्टर की तरह है जो केवल पूरे ऑर्केस्ट्रा को जोर से या धीरे बजाने के लिए नहीं कहता। इसके बजाय, कंडक्टर वास्तविक समय में प्रत्येक वाद्य यंत्र को सुनता है और वायलिन को सरलता से, ड्रम को जटिल रूप से बजाने और बांसुरी को आराम करने के लिए कहता है, और वह भी एक ही समय में। परिणाम? एक सुंदर सिम्फनी जो आधे समय में बजती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →