← नवीनतम पेपर
💬 NLP

STaRR: Spatial-Temporal Token-Dynamics-Aware Responsive Remasking for Diffusion Language Models

यह शोध पत्र STaRR का प्रस्ताव करता है, जो एक प्रशिक्षण-मुक्त (training-free) ढांचा है जो स्थानिक-कालिक आत्मविश्वास गतिशीलता (spatial-temporal confidence dynamics) के आधार पर टोकन रीमास्किंगिंग निर्णयों को गतिशील रूप से अनुकूलित करके डिफ्यूजन लैंग्वेज मॉडल्स की अनुमान गति और गुणवत्ता में सुधार करता है, जिससे सटीकता से समझौता किए बिना महत्वपूर्ण गति प्राप्त होती है।

मूल लेखक: Xinhao Sun, Huaijin Zhao, Maoliang Li, Zihao Zheng, Jiayu Chen, Yun Liang, Xiang Chen

प्रकाशित 2026-02-24
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xinhao Sun, Huaijin Zhao, Maoliang Li, Zihao Zheng, Jiayu Chen, Yun Liang, Xiang Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जटिल पहेली (puzzle) को हल करने की कोशिश कर रहे हैं, लेकिन एक-एक करके बाएं से दाएं टुकड़े रखने के बजाय, आपके पास एक जादुई सहायक है जो पहेली बोर्ड के सभी खाली स्थानों को एक ही समय में भरने की कोशिश करता है।

डिफ्यूजन लैंग्वेज मॉडल्स (DLMs) इसी तरह काम करते हैं। वे इंसान की तरह एक-एक शब्द टाइप करके वाक्य नहीं लिखते। इसके बजाय, वे "मास्क" (खाली जगहों) से भरे एक बोर्ड से शुरुआत करते हैं और वहां शब्दों का अनुमान लगाते हैं। फिर वे अपने अनुमानों की जांच करते हैं। यदि वे किसी शब्द के बारे में बहुत आश्वस्त हैं, तो वे उसे रखते हैं। यदि वे अनिश्चित हैं, तो वे उसे मिटा देते हैं (पुनः मास्क कर देते हैं) और अगले दौर में फिर से कोशिश करते हैं।

समस्या क्या है? कभी-कभी सहायक बहुत अधिक सावधान हो जाता है। वह एक ऐसे शब्द को भी मिटा सकता है जिसे वह वास्तव में जानता था, सिर्फ इसलिए क्योंकि उसका "कॉन्फिडेंस स्कोर" (विश्वास स्कोर) एक कठोर, पूर्व-निर्धारित रेखा से थोड़ा नीचे था। इससे समय बर्बाद होता है, जिससे सहायक को उन शब्दों का दोबारा अनुमान लगाने के लिए मजबूर होना पड़ता है जिन्हें उसने पहले ही समझ लिया था।

पेश है STaRR (स्पेशियल-टेम्पोरल टोकन-डायनेमिक्स-अवेयर रिस्पॉन्सिव रीमास्किंगिंग)। STaRR को एक स्मार्ट, सहज मैनेजर के रूप में सोचें जो सहायक पर नज़र रखता है और कहता है, "रुको, इसे अभी मत मिटाओ! बड़ी तस्वीर को देखो।"

यहाँ बताया गया है कि STaRR कैसे काम करता है, सरल उपमाओं (analogies) के माध्यम से:

1. पुराना तरीका: एक कठोर नियम पुस्तिका

एक सख्त शिक्षक की कल्पना करें जो कहता है, "यदि आपके टेस्ट का स्कोर 90% से कम है, तो आपको प्रश्न फिर से करना होगा।"

  • खामी: भले ही आपने पहली बार में ही सही उत्तर दिया हो, यदि आप घबरा गए थे और आपका स्कोर 89% आया, तो शिक्षक आपसे उसे दोबारा करवाता है। यदि आपका नियम बहुत सख्त है, तो आप समय बर्बाद करते हैं।
  • पेपर में: यह "स्टैटिक थ्रेशोल्ड" (स्थिर सीमा) है। यह एक एकल संख्या (कॉन्फिडेंस) को अलग-थलग देखता है और संदर्भ (context) को अनदेखा करता है।

2. STaRR का तरीका: एक सहज मैनेजर

STaRR केवल स्कोर को नहीं देखता; यह स्कोर की कहानी को देखता है। यह दो विशेष उपकरणों का उपयोग करता है:

टूल A: "टाइम-लैप्स कैमरा" (टेम्पोरल डायनेमिक्स)

एक पौधे को बढ़ते हुए देखने वाले वीडियो की कल्पना करें।

  • पुराना तरीका: शिक्षक पौधे की एक बार जांच करता है। यदि पौधा 1 इंच का है, तो वे कहते हैं, "यह तैयार नहीं है।"
  • STaRR: STaRR वीडियो देखता है। वह देखता है कि पौधा 0.1 इंच था, फिर 0.5, फिर 0.9, और अब यह 1.0 है। भले ही 1.0 "बहुत बड़ा" नहीं है, लेकिन ट्रेंड (प्रवृत्ति) दिखाता है कि यह लगातार बढ़ रहा है और अब स्थिर होने वाला है।
  • जादू: STaRR टेम्पोरल वेरिएंस (सामयिक भिन्नता) की गणना करता है। यदि किसी शब्द का कॉन्फिडेंस स्थिर और सुसंगत रहा है (उस बढ़ते हुए पौधे की तरह), तो STaRR कहता है, "ठीक है, यह कन्वर्ज (स्थिर) हो गया है। इसे रखें!" भले ही स्कोर कठोर नियम से थोड़ा कम हो। यह सहायक को उन शब्दों को दोबारा अनुमान लगाने में समय बर्बाद करने से रोकता है जो पहले ही स्थिर हो चुके हैं।

टूल B: "पड़ोस की निगरानी" (स्पेशियल डायनेमिक्स)

एक कक्षा की कल्पना करें जहाँ छात्र मिलकर गणित का एक सवाल हल कर रहे हैं।

  • पुराना तरीका: शिक्षक एक छात्र को देखता है जिसे "B" मिला है और कहता है, "तुम गलत हो, दोबारा करो," यह अनदेखा करते हुए कि उनके आसपास के सभी छात्रों को "A" मिला है और वे आश्वस्त हैं।
  • STaRR: STाRR पड़ोसियों को देखता है। यदि एक छात्र ऐसे दोस्तों से घिरा हुआ है जो सभी आश्वस्त हैं और उत्तर पर सहमत हैं, तो STaRR समझ जाता है, "यह छात्र भी शायद सही है, भले ही वह थोड़ा शर्मीला हो।"
  • जादू: STaRR स्पेशियल डेविएंस (स्थानिक विचलन) की गणना करता है। यदि कोई शब्द उच्च-कॉन्फिडेंस वाले शब्दों से घिरा हुआ है, तो STaRR उस पर अधिक भरोसा करता है। यदि कोई शब्द एक "आउटलियर" (विजातीय) है (बाकी सब आश्वस्त हैं, लेकिन यह एक डगमगा रहा है), तो STaRR कहता है, "ठहरिए, चलिए इसे फिर से मास्क करते हैं और फिर से कोशिश करते हैं।"

3. "सुरक्षा जाल" (रिस्पॉन्सिवनेस ऑप्टिमाइजेशन)

कभी-कभी, मैनेजर (STaRR) एक त्वरित निर्णय ले सकता है जो गलत साबित हो सकता है।

  • समाधान: STaRR के पास एक "सस्पेक्टेड फास्ट" (संदिग्ध तेज़) और "सस्पेक्टेड स्लो" (संदिग्ध धीमा) लेबल सिस्टम है।
    • सस्पेक्टेड फास्ट: यदि किसी शब्द को बहुत जल्दी डिकोड किया गया है और वह डगमगा रहा है, तो STaRR उस पर "इंतज़ार करो और देखो" का लेबल लगा देता है। यदि अगले स्टेप में वह बदलता है, तो उसे तुरंत मिटा दिया जाता है।
    • सस्पेक्टेड स्लो: यदि कोई शब्द बहुत लंबे समय तक "दोबारा करें" मोड में फंसा हुआ है, तो STaRR कहता है, "ठीक है, आप 3 राउंड से फंसे हुए हैं। बस एक उत्तर चुनें और आगे बढ़ें," ताकि प्रक्रिया कहीं अटक न जाए।

परिणाम: एक सुपरचार्ज्ड पहेली समाधानकर्ता

इन स्मार्ट ट्रिक्स का उपयोग करके, STaRR मॉडल को अनावश्यक काम करने से रोकता है।

  • गति: यह मॉडल को 4 से 9 गुना तेज़ बनाता है।
  • गुणवत्ता: यह केवल तेज़ ही नहीं होता; यह वास्तव में बेहतर उत्तर देता है क्योंकि यह मॉडल को उन चीजों पर दोबारा संदेह करने से रोकता है जिन्हें वह पहले से जानता है।

संक्षेप में:
STaRR एक रोबोट को एक कठोर, मूर्ख नियम पुस्तिका का पालन करने से बदलकर उसमें मानवीय अंतर्ज्ञान (intuition) देने जैसा है। यह जानता है कि किसी अनुमान पर भरोसा कब करना है, यह इस आधार पर कि वह अनुमान समय के साथ कैसे बदला है और उसके "दोस्त" (पड़ोसी) कौन हैं। यह डिफ्यूजन लैंग्वेज मॉडल्स को अपनी बुद्धि खोए बिना बिजली की गति से टेक्स्ट जेनरेट करने की अनुमति देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →