← नवीनतम पेपर
💻 computer science

SJD-VP: Speculative Jacobi Decoding with Verification Prediction for Autoregressive Image Generation

यह शोध पत्र SJD-VP का प्रस्ताव करता है, जो एक प्लग-एंड-प्ले विधि है जो इस अवलोकन का लाभ उठाकर ऑटोरेग्रेसिव इमेज जनरेशन को तेज़ करता है कि जिन टोकन की संभावनाओं में इटरेशन के दौरान वृद्धि होती है, उनके स्वीकार किए जाने की संभावना अधिक होती है, जिससे स्पेक्युलेटिव डिकोडिंग की दक्षता और इमेज की गुणवत्ता में सुधार होता है।

मूल लेखक: Bingqi Shan, Baoquan Zhang, Xiaochen Qi, Xutao Li, Yunming Ye, Liqiang Nie

प्रकाशित 2026-03-31
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Bingqi Shan, Baoquan Zhang, Xiaochen Qi, Xutao Li, Yunming Ye, Liqiang Nie

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक लंबी कहानी लिखने की कोशिश कर रहे हैं, एक बार में एक शब्द करके। AI इमेज जनरेशन की दुनिया में, "कहानी" एक छवि (image) है, और "शब्द" पिक्सेल के छोटे टुकड़े (जिन्हें टोकन कहा जाता है) हैं।

सामान्य तौर पर, AI मॉडल बहुत सावधान और धीमे लेखक की तरह होते हैं। वे एक शब्द लिखते हैं, जाँचते हैं कि क्या वह सही है, फिर अगला शब्द लिखते हैं। यह सटीक तो है लेकिन बहुत धीमा है।

इस गति को बढ़ाने के लिए, शोधकर्ताओं ने एक तकनीक का आविष्कार किया जिसे स्पेक्युलेटिव जैकोबी डिकोडिंग (SJD) कहा जाता है। इसे एक "ड्राफ्टिंग टीम" (Drafting Team) के रूप में सोचें। एक-एक शब्द लिखने के बजाय, AI एक साथ पूरे पैराग्राफ का अनुमान लगाता है, और फिर अंत में उन सभी की जाँच करता है। यदि अनुमान सही हैं, तो यह बहुत समय बचाता है। यदि वे गलत हैं, तो उसे उन्हें फेंकना पड़ता है और फिर से शुरू करना पड़ता है।

समस्या:
वर्तमान "ड्राफ्टिंग टीम" थोड़ी अनाड़ी है। वे उन शब्दों का अनुमान लगाते हैं जो अभी के हिसाब से सही लग रहे हैं, लेकिन वे इस बात पर ध्यान नहीं देते कि "एडिटर" (सत्यापन चरण/verification step) वास्तव में क्या स्वीकार करेगा।

  • उपमा: एक छात्र की कल्पना करें जो परीक्षा के उत्तरों का अनुमान लगा रहा है। वे ऐसे उत्तर चुनते हैं जो ठीक-ठाक लगते हैं, लेकिन उन्हें यह एहसास नहीं होता कि शिक्षक (वेरिफायर) का एक बहुत ही विशिष्ट और सख्त नियम है: "मैं केवल उन उत्तरों को स्वीकार करता हूँ जो सोचने के साथ-साथ अधिक मजबूत और आत्मविश्वासी होते जाते हैं।" क्योंकि छात्र इस नियम को अनदेखा करता है, शिक्षक उसके अधिकांश उत्तरों को खारिज कर देता है, और छात्र को अपना काम फिर से करना पड़ता है। इससे गति-वृद्धि (speed-up) विफल हो जाती है।

समाधान: SJD-VP ("स्मार्ट प्रेडिक्टर")
लेखकों ने एक गुप्त पैटर्न देखा। उन्होंने उन उत्तरों को देखा जिन्हें शिक्षक ने स्वीकार किया था और महसूस किया: "जो उत्तर स्वीकार किए जाते हैं, उनमें लगभग हमेशा एक प्रवृत्ति (trend) होती है कि वे अंतिम जाँच से पहले, चरण-दर-चरण अधिक आत्मविश्वासी (उच्च संभावना) होते जाते हैं।"

उन्होंने एक नया सिस्टम बनाया, SJD-VP, जो ड्राफ्टिंग टीम के लिए एक क्रिस्टल बॉल (भविष्य बताने वाला यंत्र) की तरह कार्य करता है।

यह कैसे काम करता है, एक सरल रूपक का उपयोग करते हुए:

1. "कॉन्फिडेंस ट्रैकर" (वेरिफिकेशन प्रायर)

सिर्फ अगला शब्द अनुमान लगाने के बजाय, AI अब हर उस संभावित शब्द के "कॉन्फिडेंस मीटर" पर नज़र रखता है जिसे वह चुन सकता है।

  • पुराना तरीका: "मुझे लगता है कि 'बिल्ली' एक अच्छा शब्द है।"
  • नया तरीका (SJD-VP): "मुझे लगता है कि 'बिल्ली' एक अच्छा शब्द है, और देखो! पिछली कुछ सेकंड में जब भी हमने 'बिल्ली' के बारे में सोचा, हमारा आत्मविश्वास इसमें बढ़ता गया। यह सीढ़ी चढ़ रहा है! इसका मतलब है कि एडिटर इसे पसंद करेगा।"

2. "बेयसियन फ्यूजन" (स्मार्ट मिश्रण)

AI दो सूचनाओं को जोड़ता है:

  1. मॉडल अभी क्या सोचता है कि क्या सही है।
  2. "कॉन्फिडेंस ट्रैकर" (बढ़ते आत्मविश्वास का पैटर्न)।

यह इसे एक शेफ की तरह मिलाता है जो ताजी सामग्री को एक गुप्त मसाले के साथ मिलाता है। परिणाम एक "सुपर-गेस" (Super-Guess) है जिसके स्वीकृत होने की संभावना बहुत अधिक होती है।

3. परिणाम

चूंकि ड्राफ्टिंग टीम अब उन शब्दों का अनुमान लगा रही है जो एडिटर के गुप्त नियम (बढ़ता हुआ आत्मविश्वास) में फिट बैठते हैं, इसलिए एडिटर उनमें से बहुत अधिक को स्वीकार करता है।

  • पहले: टीम 10 शब्द अनुमान लगाती है, एडिटर 3 को स्वीकार करता है। (बहुत सारा समय बर्बाद होता है)।
  • SJD-VP के साथ: टीम 10 शब्द अनुमान लगाती है, एडिटर 7 या 8 को स्वीकार करता है। (बहुत तेज़!)।

यह एक बड़ी बात क्यों है?

  1. यह प्लग-एंड-प्ले है: आपको पूरा AI इंजन फिर से बनाने की आवश्यकता नहीं है। आप बस "ड्राफ्टिंग टीम" को इस नए "स्मार्ट प्रेडिक्टर" से बदल सकते हैं। यह बिना किसी अतिरिक्त प्रशिक्षण के LlamaGen या Emu3 जैसे मौजूदा AI मॉडल के साथ काम करता है।
  2. बेहतर गुणवत्ता: क्योंकि AI को उन शब्दों की ओर निर्देशित किया जाता है जो "बढ़ते आत्मविश्वास" वाले हैं, इसलिए यह अनजाने में अधिक सटीक शब्दों को चुनता है, न कि केवल तेज़ शब्दों को। इससे चित्र अधिक स्पष्ट और सटीक दिखते हैं।
  3. गति: यह पेपर दिखाता है कि यह तरीका पिछले तरीकों की तुलना में इमेज जनरेशन को 3 गुना तेज़ बनाता है, जबकि चित्रों को और भी बेहतर बनाता है।

संक्षेप में:
पुराना तरीका एक ऐसे धावक की तरह था जो अंधे होकर दौड़ रहा था, इस उम्मीद में कि वह फिनिश लाइन तक पहुँच जाएगा। नया तरीका (SJD-VP) एक ऐसे धावक की तरह है जिसके पास एक GPS है जो जानता है कि फिनिश लाइन कहाँ है और उसे बिना लड़खड़ाए वहां तक ले जाता है। यह AI को तेज़, स्मार्ट और अधिक सटीक बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →