← नवीनतम पेपर
💬 NLP

Prefilling-dLLM: Predictive Prefilling for Long-Context Inference in Diffusion Language Models

यह शोध पत्र Prefilling-dLLM को प्रस्तुत करता है, जो एक ट्रेनिंग-फ्री फ्रेमवर्क है जो प्रासंगिक प्रीफिक्स चंक्स (prefix chunks) को कैश और स्पार्सली सेलेक्ट करके डिफ्यूजन लैंग्वेज मॉडल्स में लॉन्ग-कॉन्टेक्स्ट इन्फरेंस को तेज करता है, जिससे कम्प्यूटेशनल कॉम्प्लेक्सिटी को फुल सीक्वेंस लेंथ के द्विघात (quadratic) से घटाकर डिकोड लेंथ के द्विघात तक कम कर दिया जाता है, जिससे स्टेट-ऑफ-द-आर्ट स्पीडअप प्राप्त होता है और 'लॉस्ट-इन-द-मिडल' घटना को कम किया जाता है।

मूल लेखक: Jing Xiong, Qi Han, Shansan Gong, Yunta Hsieh, Chengyue Wu, Chaofan Tao, Chenyang Zhao, Ngai Wong

प्रकाशित 2026-06-10
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jing Xiong, Qi Han, Shansan Gong, Yunta Hsieh, Chengyue Wu, Chaofan Tao, Chenyang Zhao, Ngai Wong

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत बड़ी जिग्सॉ पहेली (jigsaw puzzle) को हल करने की कोशिश कर रहे हैं, लेकिन पूरी तस्वीर को एक साथ देखने के बजाय, आपको हर बार केवल एक नया टुकड़ा रखने से पहले पूरे डिब्बे के सभी टुकड़ों की फिर से जांच करनी पड़ती है।

यह मूल रूप से वह तरीका है जिससे Diffusion Large Language Models (dLLMs) वर्तमान में लंबी कहानियों या दस्तावेज़ों को संभालते हैं। हर बार जब मॉडल एक नया शब्द बनाने की कोशिश करता है, तो वह बातचीत के इतिहास को बिल्कुल शुरुआत से फिर से पढ़ता और प्रोसेस करता है। जैसे-जैसे कहानी लंबी होती जाती है, यह "पुनः पढ़ना" इतना धीमा और महंगा हो जाता है कि यह एक भारी बैकपैक लेकर मैराथन दौड़ने जैसा हो जाता है जो हर कदम के साथ भारी होता जा रहा है।

यह पेपर इस समस्या को ठीक करने के लिए Prefilling-dLLM नामक एक नई विधि पेश करता है। यह कैसे काम करता है, इसके लिए कुछ रोजमर्रा के उदाहरणों का उपयोग किया गया है:

1. समस्या: "पुनः पढ़ने" का जाल (The "Re-Reading" Trap)

पारंपरिक AI मॉडल में, एक बार जब आप किताब का एक पन्ना पढ़ लेते हैं, तो आप उसे याद रखते हैं और केवल उस नए पन्ने पर ध्यान केंद्रित करते हैं जिसे आप पढ़ रहे हैं। लेकिन इन डिफ्यूजन मॉडल्स में, कंप्यूटर किताब को भूल जाता है और हर एक नया शब्द लिखने के लिए पेज 1 से पेज 1,000 तक पूरी किताब को फिर से पढ़ता है।

  • परिणाम: यदि किताब छोटी है, तो यह ठीक है। यदि किताब 32,000 पन्नों लंबी है, तो कंप्यूटर अपना 99% समय पुराने पन्नों को फिर से पढ़ने में बिता देता है और केवल 1% समय वास्तव में नए शब्द लिखने में।

2. समाधान: "स्मार्ट लाइब्रेरियन" सिस्टम (The "Smart Librarian" System)

लेखक Prefilling-dLLM नामक एक सिस्टम का प्रस्ताव देते हैं जो एक अत्यंत कुशल लाइब्रेरियन (पुस्तकालयाध्यक्ष) की तरह काम करता है। पूरी लाइब्रेरी को हर बार फिर से पढ़ने के बजाय, लाइब्रेरियन दो काम करता है:

स्टेप A: "प्रीफिल" (लाइब्रेरी को व्यवस्थित करना)

लिखना शुरू करने से पहले, लाइब्रेरियन विशाल इनपुट टेक्स्ट (जिसे "प्रिफिक्स" कहा जाता है) को लेता है और उसे चंक्स (chunks) (जैसे किताब के अध्याय) में काट देता है।

  • ट्रिक: लाइब्रेरियन प्रत्येक अध्याय को एक बार पढ़ता है, उसके लिए एक "समरी कार्ड" (जिसे KV कैश कहा जाता है) बनाता है, और उसे शेल्फ पर रख देता है।
  • नवाचार: लाइब्रेरियन हर अध्याय के हर एक शब्द को नहीं पढ़ता है। वे एक विशेष तकनीक का उपयोग करते हैं ताकि केवल सबसे महत्वपूर्ण वाक्यों को ही रखा जा सके और बाकी अनावश्यक सामग्री को हटा दिया जाए। यह इन समरी कार्डों को बहुत छोटा और संभालने में तेज़ बनाता है।

स्टेप B: "डिकोड" (कहानी लिखना)

अब, जब मॉडल को अगला शब्द लिखने की आवश्यकता होती है, तो वह पूरी लाइब्रेरी को फिर से नहीं पढ़ता है।

  • चयन: मॉडल पूछता है, "जो मैं अभी लिख रहा हूँ, उसके लिए कौन से अध्याय वास्तव में प्रासंगिक हैं?" यह शेल्फ से केवल शीर्ष कुछ अध्यायों (सबसे प्रासंगिक चंक्स) को चुनने के लिए एक स्मार्ट स्कोरिंग सिस्टम का उपयोग करता है।
  • दक्षता: यह लाइब्रेरी के उस 90% हिस्से को अनदेखा कर देता जिसकी इस विशिष्ट वाक्य के लिए आवश्यकता नहीं है। यह पहले से बनाए गए केवल प्रासंगिक "समरी कार्डों" को देखता है।

3. यह क्यों एक गेम-चेंजर है

पेपर का दावा है कि यह दृष्टिकोण एक बड़ी गति प्रदान करता है क्योंकि:

  • कोई पुनः पढ़ना नहीं: लंबे टेक्स्ट को पढ़ने की भारी मेहनत शुरुआत में एक बार ही होती है।
  • स्मार्ट स्किपिंग: वास्तविक लेखन चरण के दौरान, मॉडल टेक्स्ट के केवल एक छोटे से हिस्से (शीर्ष प्रासंगिक चंक्स) को देखता है, न कि पूरी चीज़ को।
  • गति: लंबे संदर्भों (8,000 से 32,000 शब्दों) पर, यह विधि पिछले तरीकों की तुलना में 9 से 28 गुना तेज़ है, जबकि उत्तर भी सही देती है।

4. "लॉस्ट इन द मिडल" रहस्य को सुलझाना (Solving the "Lost in the Middle" Mystery)

लंबे AI मॉडल्स के साथ एक ज्ञात समस्या है जिसे "लॉस्ट इन द मिडल" कहा जाता है। कल्पना कीजिए कि कोई व्यक्ति तथ्यों की एक लंबी सूची पढ़ रहा है; उसे पहले कुछ और अंतिम कुछ तथ्य पूरी तरह याद रहते हैं, लेकिन वह बीच की चीज़ों को पूरी तरह भूल जाता है।

  • पेपर का समाधान: लेखकों ने पाया कि टेक्स्ट को चंक्स में काटकर और प्रत्येक चंक की शुरुआत में एक विशेष "एंकर" टोकन (जैसे अध्याय का शीर्षक) जोड़कर, मॉडल टेक्स्ट में कहीं भी जानकारी खोज सकता है, यहाँ तक कि बीच में भी। यह एक ऐसी विषय-सूची की तरह है जो पूरी तरह से काम करती है, ताकि मॉडल कभी खो न जाए, चाहे कहानी कितनी भी लंबी क्यों न हो।

5. "चंक साइज" का संतुलन (The "Chunk Size" Balance)

पेपर ने यह भी परीक्षण किया कि ये "अध्याय" कितने बड़े होने चाहिए।

  • बहुत बड़ा: यदि चंक्स बहुत बड़े हैं, तो मॉडल टेक्स्ट के बीच में महत्वपूर्ण विवरणों को मिस कर सकता है।
  • बहुत छोटा: यदि चंक्स बहुत छोटे हैं, तो कंप्यूटर चंक्स की सूची को मैनेज करने में बहुत अधिक समय खर्च करता है।
  • सही संतुलन (Sweet Spot): उन्होंने पाया कि बहुत लंबे टेक्स्ट के लिए, उच्च सटीकता बनाए रखने के लिए कई छोटे चंक्स का उपयोग करना सबसे अच्छा काम करता है।

सारांश

Prefilling-dLLM एक ऐसे छात्र से स्विच करने जैसा है जो क्विज़ के हर सवाल का जवाब देने के लिए 500 पन्नों की पाठ्यपुस्तक को फिर से पढ़ता है, बनाम एक ऐसे छात्र से जो एक बार एक स्मार्ट, संक्षिप्त अध्ययन गाइड (study guide) बनाता है, और फिर जवाब देते समय केवल उन्हीं विशिष्ट पृष्ठों को पलटता है जिनकी उसे आवश्यकता होती है।

परिणाम? AI बिना धीमा हुए बहुत लंबे संवाद और दस्तावेज़ों को संभाल सकता है, और यह टेक्स्ट के बीच में छिपे महत्वपूर्ण विवरणों को भूलता नहीं है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →