← नवीनतम पेपर
💻 computer science

Just-in-Time: Training-Free Spatial Acceleration for Diffusion Transformers

यह शोधपत्र जस्ट-इन-टाइम (JiT) को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त फ्रेमवर्क है जो स्थानिक अतिरेक (spatial redundancy) का लाभ उठाकर डिफ्यूजन ट्रांसफॉर्मर्स को त्वरित करता है ताकि एंकर टोकन के एक विरल उपसमुच्चय (sparse subset) पर अपडेट की गणना की जा सके, जिससे FLUX.1-dev मॉडल पर लगभग लॉसलेस इमेज क्वालिटी के साथ 7x तक की गति वृद्धि प्राप्त होती है।

मूल लेखक: Wenhao Sun, Ji Li, Zhaoqiang Liu

प्रकाशित 2026-03-12
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wenhao Sun, Ji Li, Zhaoqiang Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक कलाकार हैं जिसे एक व्यस्त शहर का एक विशाल, हाइपर-रियलिस्टिक भित्ति चित्र (mural) बनाने का काम सौंपा गया है।

पुराना तरीका (समस्या):
वर्तमान में, सबसे उन्नत AI कलाकार (जिन्हें डिफ्यूजन ट्रांसफॉर्मर कहा जाता है) एक ऐसे पूर्णतावादी (perfectionist) की तरह काम करते हैं जो पहले स्ट्रोक से लेकर आखिरी स्ट्रोक तक, एक-एक करके पूरे भित्ति चित्र के हर छोटे से छोटे हिस्से को पेंट करता है। वे शोर (static/noise) से ढके एक खाली कैनवास से शुरू करते हैं और धीरे-धीरे हर एक पिक्सेल को एक साथ परिष्कृत (refine) करते हैं।

समस्या यह है कि यह अविश्वसनीय रूप से धीमा है। एक साधारण छवि के लिए भी, AI को चित्र पूरा होने से पहले हजारों बार हर एक पिक्सेल के बारे में "सोचना" पड़ता है। यह एक स्विमिंग पूल को एक-एक बूंद करके भरने जैसा है, जहाँ हर बूंद के बाद जल स्तर की जाँच की जाती है। यह सटीक तो है, लेकिन इसमें बहुत समय लगता है और बहुत अधिक ऊर्जा की आवश्यकता होती है।

नया विचार (JiT - जस्ट-इन-टाइम):
यह शोध पत्र एक नई विधि पेश करता है जिसे JiT (Just-in-Time) कहा जाता है। पूरे भित्ति चित्र को एक साथ पेंट करने के बजाय, JiT एक स्मार्ट और कुशल फोरमैन (सुपरवाइजर) की तरह काम करता है जिसे पता होता है कि पेंटर्स को ठीक कब और कहाँ भेजना है।

JiT कैसे काम करता है, इसे तीन सरल अवधारणाओं में विभाजित किया गया है:

1. "पहले बड़ी तस्वीर" की रणनीति (स्पेशियल रिडंडेंसी - Spatial Redundancy)

जब आप किसी धुंधली फोटो को स्पष्ट होते देखते हैं, तो आपको सबसे पहले क्या दिखता है? आप बड़ी आकृतियाँ देखते हैं: आकाश, क्षितिज, एक इमारत की रूपरेखा। आप ईंटों की बनावट या पेड़ की व्यक्तिगत पत्तियों को बहुत अंत तक नहीं देखते।

  • उपमा (Analogy): कल्पना कीजिए कि आप एक घर बना रहे हैं। आप नींव डालने से पहले दरवाज़ों के हैंडल और ट्रिम लगाने और पेंट करने की शुरुआत नहीं करेंगे।
  • JiT इसका उपयोग कैसे करता है: छवि बनाने के शुरुआती चरणों में, JiT महसूस करता है कि अधिकांश "पिक्सेल" (जिन्हें टोकन कहा जाता है) केवल खाली जगह को भर रहे हैं या एक ही बैकग्राउंड जानकारी को दोहरा रहे हैं। इसलिए, यह AI को कहता है: "हे, अभी खाली आकाश या धुंधले बैकग्राउंड पर अपनी दिमागी शक्ति बर्बाद मत करो। बस उन कुछ प्रमुख स्थानों पर ध्यान केंद्रित करो जो मुख्य आकार को परिभाषित करते हैं।"
  • परिणाम: AI केवल "एंकर" टोकन (महत्वपूर्ण हिस्सों) के एक छोटे, विरल (sparse) सेट पर भारी गणना करता है और बाकी का अनुमान लगा लेता है। इससे बहुत सारा समय बचता है।

2. "स्मार्ट अनुमान" (SAG-ODE)

आप पूछ सकते हैं, "यदि यह केवल कुछ ही जगहों को देख रहा है, तो क्या बाकी की छवि खराब नहीं हो जाएगी?"

  • उपमा: एक जिग्सॉ पज़ल (jigsaw puzzle) के बारे में सोचें। यदि आपके पास कोने के टुकड़े और बीच के कुछ प्रमुख टुकड़े हैं, तो आप वास्तव में हर एक टुकड़े को देखे बिना आसानी से अनुमान लगा सकते हैं कि उनके बीच की तस्वीर कैसी दिखेगी।
  • JiT इसका उपयोग कैसे करता है: JiT एक चतुर गणितीय ट्रिक (जिसे लिफ्टर - Lifter कहा जाता है) का उपयोग करता है ताकि उन कुछ महत्वपूर्ण "एंकर" स्थानों से गणनाओं को ले जाकर उन्हें पूरी छवि में सुचारू रूप से "फैलाया" जा सके। यह एक लो-रेज़ोल्यूशन स्केच लेने और फिर अंतराल को भरने के लिए एक स्मार्ट एल्गोरिदम का उपयोग करने जैसा है ताकि वह हाई-रेज़ोल्यूशन फोटो की तरह दिखे, बिना हर एक पिक्सेल के लिए वास्तविक काम किए।

3. "निर्बाध हैंडऑफ" (डिटरमिनिस्टिक माइक्रो-फ्लो - Deterministic Micro-Flow)

जैसे-जैसे छवि स्पष्ट होती जाती है, AI को विवरणों (जैसे ईंटों की बनावट या किसी व्यक्ति की आँखें) पर ध्यान देना शुरू करना पड़ता है। JiT छवि के अधिक हिस्सों को धीरे-धीरे "जगाता" है।

  • उपमा: एक निर्माण दल (construction crew) की कल्पना करें। शुरू में, केवल नींव बनाने वाली टीम काम कर रही है। फिर, फ्रेमिंग टीम आती है। यदि फ्रेमिंग टीम बस आकर बेतरतीब ढंग से हथौड़े चलाना शुरू कर दे, तो घर ढह सकता है। उन्हें एक सुचारू संक्रमण (transition) की आवश्यकता होती है जहाँ नए कर्मचारी पुराने कर्मचारियों के साथ पूरी तरह फिट बैठें।
  • JiT इसका उपयोग कैसे करता है: जब JiT यह तय करता है कि छवि के एक नए हिस्से को "जगाना" है, तो यह एक विशेष माइक्रो-फ्लो (Micro-Flow) प्रक्रिया का उपयोग करता है। यह छवि के नए, निष्क्रिय भागों को सक्रिय भागों के स्टाइल और शोर के स्तर (noise level) से मेल खाने के लिए धीरे से निर्देशित करता है। यह "ग्लिच" या अजीब आर्टिफैक्ट्स (जैसे कि एक धुंधला चेहरा अचानक एक स्पष्ट शरीर पर दिखाई देना) को रोकता है। यह सुनिश्चित करता है कि संक्रमण मानवीय आंखों के लिए अदृश्य हो।

"जस्ट-इन-टाइम" का जादू

Just-in-Time नाम विनिर्माण (manufacturing) से आता है (जैसे टोयोटा की कार फैक्ट्रियां), जहाँ पुर्जे ठीक उसी समय डिलीवर किए जाते हैं जब उनकी आवश्यकता होती है, न कि पहले।

  • पुराना तरीका: AI हर चरण में पूरी छवि (सभी भागों) को प्रोसेस करने की कोशिश करता है, भले ही उसे इसकी आवश्यकता न हो।
  • JiT तरीका: JiT "कंप्यूटेशनल पावर" (पुर्जों) को Just-in-Time (ठीक समय पर) डिलीवर करता है।
    • शुरुआती चरण: छवि के केवल "कंकाल" (skeleton) को प्रोसेस किया जाता है।
    • मध्य चरण: "मांसपेशियां" और "त्वचा" जोड़ी जाती हैं।
    • अंतिम चरण: "मेकअप" और "आभूषण" (बारीक विवरण) लगाए जाते हैं।

परिणाम

इस शोध पत्र ने FLUX.1-dev पर परीक्षण किया, जो आज उपलब्ध सबसे अच्छे इमेज जनरेटरों में से एक है।

  • गति: इसने AI को 4 से 7 गुना तेज़ बना दिया।
  • गुणवत्ता: छवियां लगभग धीमी, पूर्ण संस्करण के समान ही दिखीं। वहां कोई धुंधले पैच या अजीब ग्लिच नहीं थे।
  • कोई ट्रेनिंग की आवश्यकता नहीं: सबसे अच्छी बात? उन्हें AI मॉडल को फिर से प्रशिक्षित (retrain) करने की आवश्यकता नहीं पड़ी। उन्होंने केवल यह बदला कि AI कैसे चलता है, जैसे कि एक सुपरकंप्यूटर को नया कंप्यूटर बनाने के बजाय उसे बेहतर निर्देश देना।

सारांश में:
JiT उन चित्रकारों की टीम को काम पर रखने जैसा है जो एक साथ पूरी दीवार पेंट करने की कोशिश करने के बजाय, पहले बड़ी आकृतियों पर ध्यान केंद्रित करते हैं, खाली जगहों का अनुमान लगाते हैं, और केवल तभी विस्तृत चित्रकारों को लाते हैं जब चित्र लगभग पूरा होने वाला होता है। परिणाम? एक कृति (masterpiece) जो बहुत कम समय में तैयार होती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →