← नवीनतम पेपर
🤖 machine learning

Retrofitting Linear Attention into Diffusion Language Models

यह शोध पत्र ब्लॉक-हाइब्रिड अटेंशन (block-hybrid attention) प्रस्तुत करता है, जो एक ऐसी विधि है जो सक्रिय ब्लॉक के भीतर सटीक सॉफ्टमैक्स (softmax) को बनाए रखते हुए पिछले ब्लॉकों पर अटेंशन को लीनियर (linearize) करती है, जिससे पूर्व-प्रशिक्षित डिफ्यूजन लैंग्वेज मॉडल्स (diffusion language models) को न्यूनतम प्रदर्शन गिरावट के साथ 1.7x तक तेज़ इन्फरेंस (inference) प्राप्त करने के लिए कुशलतापूर्वक रेट्रोफिट करना संभव हो जाता है।

मूल लेखक: Jinha Kim, Younghun Roh, Jaeyeon Kim

प्रकाशित 2026-08-10
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jinha Kim, Younghun Roh, Jaeyeon Kim

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आर्टिफिशियल इंटेलिजेंस की दुनिया की कल्पना एक विशाल, हलचल भरी लाइब्रेरी के रूप में करें जहाँ एक सुपर-स्मार्ट रोबोट लाइब्रेरियन एक कहानी लिखने की कोशिश कर रहा है। वर्षों तक, इस लाइब्रेरियन के काम करने का मानक तरीका "ऑटोरिग्रेसिव" (autoregressive) था: वह एक शब्द लिखता, रुकता, जो कुछ भी उसने लिखा उस पर विचार करता, फिर अगला शब्द लिखता, रुकता और फिर से विचार करता। यह ईंट-दर-ईढ़ी मीनार बनाने जैसा था, जहाँ हर अगली ईंट लगाने से पहले गोंद के सूखने का इंतज़ार करना पड़ता था। हालांकि यह तरीका भरोसेमंद था, लेकिन लंबी कहानियों के लिए यह काफी धीमा था।

हाल ही में, "डिफ्यूजन" (Diffusion) नामक एक नई शैली आई। ईंट-दर-ईंट निर्माण करने के बजाय, डिफ्यूजन लाइब्रेरियन एक खाली पन्ने से शुरुआत करता है जो प्रश्न चिह्नों (?) से भरा होता है और एक ही बार में पूरी कहानी का अनुमान लगाने की कोशिश करता है, और फिर अपने अनुमानों को बार-बार परिष्कृत (refine) करता है जब तक कि शब्द समझ में न आने लगें। यह एक साथ भित्ति चित्र (mural) पेंट करने वाली कलाकारों की एक टीम की तरह है; वे बहुत तेज़ी से काम कर सकते हैं क्योंकि उन्हें पिछली ईंट के सूखने का इंतज़ार नहीं करना पड़ता। हालाँकि, इस तेज़ विधि में भी एक समस्या है। जैसे-जैसे भित्ति चित्र बड़ा होता जाता है, कलाकारों को यह सुनिश्चित करने के लिए कि नए शब्द फिट बैठें, पहले से तय किए गए हर एक शब्द को लगातार देखना पड़ता है। यह 10,000 पन्नों की किताब को याद रखने की कोशिश करने जैसा है जब आप पेज नंबर 101 लिख रहे हों, जो अंततः सभी को धीमा कर देता है और लाइब्रेरी की मेमोरी भर देता है।

यही वह पहेली है जिसे शोधकर्ताओं की एक टीम ने सुलझाया। उन्होंने पूछा: "क्या हम इस डिफ्यूजन पद्धति के याद रखने के तरीके को बदलकर इसे और भी तेज़ बना सकते हैं?" उनका उत्तर "ब्लॉक-हाइब्रिड अटेंशन" (Block-Hybrid Attention) नामक एक चतुर तकनीक है। उन्होंने महसूस किया कि जबकि लाइब्रेरियन को वर्तमान पैराग्राफ को पूरी तरह से याद रखने की आवश्यकता होती है (तावटों के प्रवाह को बनाए रखने के लिए), उसे पिछले अध्यायों के हर एक शब्द को हाई-डेफिनिशन में फिर से पढ़ने की आवश्यकता नहीं है। इसके बजाय, वह पुराने अध्यायों को एक छोटे, निश्चित आकार के "समरी शीट" (summary sheet) में संक्षेपित कर सकता है। यह लाइब्रेरियन को इतिहास के भार से दबे बिना, बिजली की गति से कहानी के नए हिस्सों को लिखने की अनुमति देता है।

मुख्य विचार: एक दो-गति वाली मेमोरी प्रणाली

यह शोध पत्र एक मौजूदा, शक्तिशाली डिफ्यूजन लैंग्वेज मॉडल (विशेष रूप से 16-बिलियन पैरामीटर वाला LLaDA 2.1) को अपग्रेड करने का तरीका पेश करता है ताकि वह बिना शून्य से पुन: प्रशिक्षित (retrain) हुए इस "समरी शीट" रणनीति का उपयोग कर सके।

मॉडल के मस्तिष्क की कल्पना उसके सोचने के 20 अलग-अलग स्तरों (layers) के रूप में करें। मूल मॉडल में, प्रत्येक स्तर एक अत्यंत चौकस लाइब्रेरियन की तरह कार्य करता है जो वर्तमान शब्द को समझने के लिए पिछले हर शब्द को पढ़ता है। यह सटीक है लेकिन भारी है। शोधकर्ताओं का नवाचार, ब्लॉक-हाइब्रिड अटेंशन, काम को दो मोड में विभाजित करता है:

  1. "अब" मोड (Exact Attention): जब मॉडल शब्दों के उस वर्तमान ब्लॉक पर काम कर रहा होता है जिसे वह सक्रिय रूप से उत्पन्न कर रहा है, तो वह अपने "सुपर-अटेंटिव" मोड को बनाए रखता है। यह सुनिश्चित करने के लिए कि वाक्य पूरी तरह से समझ में आएं, वह वर्तमान पैराग्राफ के हर शब्द को देखने के लिए मानक, भारी-भरकम मेमोरी का उपयोग करता है।
  2. "अतीत" मोड (Linear Attention): जब मॉडल को पिछले ब्लॉक्स (तैयार किए गए अध्यायों) को याद करने की आवश्यकता होती है, तो वह "लीनियर अटेंशन" (Linear Attention) पर स्विच हो जाता है। पूरी किताब को फिर से पढ़ने के बजाय, वह एक निश्चित आकार की समरी स्टेट (summary state) का परामर्श लेता है। यह किसी पुस्तक के इंडेक्स या एक-पृष्ठीय सारांश को देखने जैसा है, न कि पूरी सामग्री को फिर से पढ़ने जैसा। यह सारांश किताब कितनी भी लंबी हो जाए, हमेशा एक ही आकार का रहता है।

उन्होंने यह कैसे किया: दो-चरणीय अपग्रेड

शोधकर्ताओं ने केवल पुर्जों को बदला और उम्मीद नहीं की; उन्होंने यह सुनिश्चित करने के लिए कि अपग्रेड के दौरान मॉडल अपनी बुद्धिमत्ता न खो दे, एक सावधानीपूर्वक दो-चरणीय प्रक्रिया का उपयोग किया।

  • चरण 1: शैडो ट्रेनिंग (The Shadow Training): उन्होंने मूल, स्मार्ट मॉडल (जिसे "टीचर" कहा गया) को लिया और उसे फ्रीज कर दिया। फिर, उन्होंने 20 में से 6 अटेंशन लेयर्स को अपने नए "ब्लॉक-हाइब्रिड" संस्करण (जिसे "स्टूडेंट" कहा गया) से बदल दिया। स्टूडेंट को टीचर के आउटपुट की हुबहू नकल करने के लिए प्रशिक्षित किया गया था, जिसमें इनपुट के रूप में टेक्स्ट के "करप्टेड" (corrupted) संस्करण का उपयोग किया गया था। यह एक मास्टर शेफ की छाया बनने जैसा था, जहाँ छात्र शेफ की सटीक गतिविधियों की नकल करने और उन्हीं स्वादों को चखने की कोशिश कर रहा था, लेकिन केवल उन विशिष्ट व्यंजनों के लिए जिन्हें छात्र को बदलने के लिए सौंपा गया था। इस चरण में लगभग 24 घंटे लगे।
  • चरण 2: फाइन-ट्यूनिंग (The Fine-Tuning): एक बार जब स्टूडेंट ने टीचर की नकल करना सीख लिया, तो शोधकर्ताओं ने पूरे मॉडल को फिर से एक साथ काम करने दिया। उन्होंने मॉडल के कनेक्शनों में सूक्ष्म, सटीक समायोजन करने के लिए LoRA (Low-Rank Adaptation) नामक तकनीक का उपयोग किया। यह अपग्रेड किए गए मॉडल को एक त्वरित "पॉलिश" देने जैसा था ताकि उन छोटी-मोटी खामियों को ठीक किया जा सके जो तब हुई थीं जब नए हिस्से अब पुराने हिस्सों के साथ बात कर रहे थे। इस चरण में 6 घंटे लगे।

परिणाम: तेज़, हल्का और फिर भी स्मार्ट

टीम ने अपने अपग्रेड किए गए मॉडल का परीक्षण किया, जिसे उन्होंने LLaDA-HYBRID नाम दिया, यह देखने के लिए कि क्या यह अभी भी लिखने और समस्याओं को हल करने में अच्छा है, और क्या यह वास्तव में तेज़ है।

क्या यह अभी भी सोचना जानता है?
आश्चर्यजनक रूप से, हाँ। भले ही उन्होंने 20 में से 6 लेयर्स को इस "समरी शीट" पद्धति के साथ बदल दिया, मॉडल का प्रदर्शन मूल के बहुत करीब रहा।

  • एक कोडिंग टेस्ट HumanEval पर, मूल मॉडल ने 75.6% स्कोर किया, और हाइब्रिड मॉडल ने 72.0% स्कोर किया।
  • गणित के एक टेस्ट CMATH पर, मूल मॉडल को 88.3% मिला, और हाइब्रिड को 86.7% मिला।
  • दिलचस्प बात यह है कि एक अन्य कोडिंग टेस्ट MBPP+ पर, हाइब्रिड मॉडल में सुधार हुआ, जो 57.7% से बढ़कर 63.0% हो गया।
    शोध पत्र सुझाव देता है कि हालांकि मॉडल कठिन तर्क कार्यों (जैसे कि एक कठिन विज्ञान क्विज़ GPQA-Diamond, जहाँ यह 38.9% से गिरकर 30.8% हो गया) पर थोड़ा कम सटीक है, लेकिन इसने कोडिंग और गणित हल करने की अपनी क्षमता को काफी हद तक सुरक्षित रखा है।

क्या यह वास्तव में तेज़ है?
यही वह जादू है। क्योंकि मॉडल को अब हर नए शब्द के लिए पूरे इतिहास को फिर से पढ़ने की आवश्यकता नहीं है, इसलिए यह एक साथ अधिक अनुरोधों (requests) को संभाल सकता है।

  • यह देखने के लिए कि मॉडल प्रति सेकंड कितने शब्द उत्पन्न कर सकता है, हाइब्रिड मॉडल अपने पीक परफॉर्मेंस (128 समवर्ती अनुरोधों को संभालते समय) पर मूल मॉडल की तुलना में 1.7 गुना तेज़ था।
  • मूल मॉडल की मेमोरी का उपयोग कहानी लंबी होने के साथ बढ़ता गया, जिससे अंततः एक ऐसी सीमा आ गई जहाँ वह अधिक उपयोगकर्ताओं को नहीं संभाल सका। हाइब्रिड मॉडल, अपने निश्चित आकार के "समरी शीट" के कारण, मेमोरी खत्म होने से पहले अधिक समवर्ती अनुरोधों को संभालने में सक्षम था।

निष्कर्ष

यह शोध पत्र सुझाव देता है कि हमें हमेशा नए, तेज़ AI को शून्य से बनाने की आवश्यकता नहीं होती है। इसके बजाय, हम एक शक्तिशाली, मौजूदा AI को ले सकते हैं और उसे एक "हाइब्रिड मेमोरी" सिस्टम दे सकते हैं। वर्तमान क्षण पर अपना तीक्ष्ण ध्यान केंद्रित रखते हुए और अतीत को एक संक्षिप्त रूप में सारांशित करके, हम इन मॉडलों को काफी तेज़ और कुशल बना सकते हैं। शोधकर्ताओं ने पाया कि इस अपग्रेड को सार्वजनिक डेटा पर लगभग 60 घंटे के प्रशिक्षण में किया जा सकता है, जो उनकी बुद्धिमत्ता से बहुत अधिक समझौता किए बिना AI सेवाओं को तेज़ और सस्ता बनाने का एक आशाजनक मार्ग प्रदान करता है। हालाँकि, लेखक नोट करते हैं कि यह तो बस शुरुआत है; उन्होंने केवल 6 लेयर्स को अपग्रेड किया है, और भविष्य के कार्य और भी अधिक लेयर्स को अपग्रेड करने या और भी लंबी कहानियों को संभालने के तरीके खोज सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →