← नवीनतम पेपर
🤖 machine learning

HyperDFlash: MHC-Aligned Block Speculative Decoding with Gated Residual Reduction

यह शोध पत्र HyperDFlash प्रस्तुत करता है, जो DeepSeek-V4 के MHC आर्किटेक्चर के लिए एक ब्लॉक-समानांतर स्पेक्युलेटिव डिकोडिंग फ्रेमवर्क है, जो प्री-कोलैप्स रेसिडुअल स्टेट्स के साथ ड्राफ्टर को संरेखित करके, एक लाइटवेट गेटेड रेसिडुअल रिड्यूसर का उपयोग करके और लक्षित KL डिस्टिलेशन लागू करके नेटिव ड्राफ्ट सटीकता में गिरावट को दूर करता है, जिससे बेहतर स्पीडअप और स्वीकृति दर प्राप्त होती है।

मूल लेखक: Luxi Lin, Shuang Peng, Rui Ma, Junhao Hua, Shuwei Fan, Zhengda Qin, Qiang Wang, Hongjian Sun, Fangmin Chen, Songwei Liu

प्रकाशित 2026-06-26
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Luxi Lin, Shuang Peng, Rui Ma, Junhao Hua, Shuwei Fan, Zhengda Qin, Qiang Wang, Hongjian Sun, Fangmin Chen, Songwei Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक लंबी कहानी लिखने की कोशिश कर रहे हैं, लेकिन आपके पास एक बहुत ही सख्त, धीमा संपादक (Target Model) है जो हर एक शब्द को आगे बढ़ने से पहले चेक करता है। यह उच्च गुणवत्ता सुनिश्चित करता है, लेकिन यह लेखन प्रक्रिया को कष्टदायक रूप से धीमा बना देता है।

Speculative Decoding एक चतुर तकनीक है जो इस प्रक्रिया को तेज करने के लिए है। संपादक द्वारा एक-एक करके शब्दों को चेक करने का इंतज़ार करने के बजाय, आप एक तेज़, हल्का Drafting Assistant (मसौदा तैयार करने वाला सहायक) काम पर रखते हैं जो एक साथ अगले कुछ शब्दों का अनुमान लगा लेता है। फिर संपादक एक ही बार में, समानांतर नज़र (parallel glance) से उन सभी अनुमानों के पूरे बैच की जाँच करता है। यदि अनुमान सही हैं, तो आप बहुत सारा समय बचा लेते हैं। यदि वे गलत हैं, तो संपादक उन्हें ठीक करता है, और आप फिर से प्रयास करते हैं।

यह पेपर HyperDFlash को पेश करता है, जो एक नया, सुपर-स्मार्ट Drafting Assistant है जिसे विशेष रूप से DeepSeek-V4 नामक एक नए प्रकार के AI आर्किटेक्चर के लिए डिज़ाइन किया गया है।

समस्या और समाधान का विवरण यहाँ दिया गया है, सरल उपमाओं (analogies) का उपयोग करते हुए:

समस्या: "टूटा हुआ हैंडऑफ" (The Broken Handoff)

DeepSeek-V4 मॉडल अद्वितीय है। अगला शब्द तय करने के लिए केवल एक एकल "मस्तिष्क" (सूचना का एक प्रवाह) होने के बजाय, इसमें कई समानांतर पथ (जैसे कि एक विषय पर चर्चा करने के लिए चार विशेषज्ञों की एक टीम) हैं। अंतिम निर्णय लेने से ठीक पहले, ये पथ एक विशेष, जटिल तंत्र का उपयोग करके आपस में मिल जाते हैं जिसे Multi-Hyper-Connection (MHC) कहा जाता है।

पिछले तरीकों ने एक सामान्य ड्राफ्टिंग असिस्टेंट (जैसे कि DFlash) का उपयोग करने की कोशिश की, लेकिन यह इस मॉडल के साथ ऐसा था जैसे किसी बेकर को एक जटिल, बहु-स्तरीय केक थमाना, जो केवल एक स्लाइस को संभालने के बारे में जानता हो।

  • बेमेल (The Mismatch): जेनेरिक असिस्टेंट ने केक के "मध्य" भाग (intermediate features) को देखा और उसे एक साधारण सूची में बदलने की कोशिश की। इसने DeepSeek-V4 की टीम के विचारों को मिलाने के अनूठे तरीके को अनदेखा कर दिया।
  • परिणाम: असिस्टेंट ने पहला शब्द तो सही बताया, लेकिन जैसे ही उसने दूसरे, तीसरे या चौथे शब्द का अनुमान लगाने की कोशिश की, वह "फ्लैटन" की गई जानकारी से भ्रमित हो गया। सटीकता तेजी से गिर गई, और संपादक को अधिकांश अनुमानों को खारिज करना पड़ा, जिससे गति का लाभ (speedup) बर्बाद हो गया।

समाधान: HyperDFlash

लेखकों ने एक नया असिस्टेंट बनाया है जो DeepSeek-V4 संपादक की भाषा बोलता है। उन्होंने इसे तीन मुख्य तरकीबों के साथ किया:

1. "अंतिम ब्रीफिंग" (Pre-Collapse Conditioning)

असिस्टेंट से प्रक्रिया के बीच के अव्यवस्थित, मध्यवर्ती नोट्स देखने के बजाय, वे उसे अंतिम ब्रीफिंग देते हैं जो संपादक निर्णय लेने से ठीक पहले प्राप्त करता है।

  • उपमा: एक रिले रेस की कल्पना करें। पिछले असिस्टेंट्स ने ट्रैक के बीच में ली गई एक धुंधली फोटो के आधार पर अगले धावक की चाल का अनुमान लगाने की कोशिश की। HyperDFlash तब तक इंतजार करता है जब तक धावक फिनिश लाइन पर नहीं पहुँच जाता, वह देखता है कि वह बिल्कुल कैसे स्थित है, और फिर उस सटीक, अंतिम स्नैपशॉट के आधार पर अगली चाल की भविष्यवाणी करता है। यह असिस्टेंट को संपादक की वास्तविक निर्णय लेने की प्रक्रिया के साथ पूरी तरह से संरेखित रखता है।

2. "स्मार्ट गेटकीपर" (Inherited Gated Reducer)

DeepSeek-V4 संपादक अपने चार विशेषज्ञ पथों को एक विशेष, सीखे हुए "गेट" (gate) का उपयोग करके जोड़ता है जो संदर्भ के आधार पर प्रत्येक पथ को कितना महत्व देना है, यह तय करता है। एक जेनेरिक असिस्टेंट इन पथों को जोड़ने के लिए एक भारी, मूर्ख, स्थिर नियम (जैसे एक निश्चित फॉर्मूला) का उपयोग करने की कोशिश करेगा, जो काम नहीं करता है।

  • सुधार: HyperDFlash उसी सटीक गेट मैकेनिज्म को चुरा लेता है जिसका उपयोग संपादक करता है। यह संपादक के अपने "नियमों की किताब" को असिस्टेंट को देने जैसा है।
  • लाभ: क्योंकि यह संपादक के अपने नियमों का उपयोग करता है, इसलिए असिस्टेंट पूरी तरह से संरेखित है। इससे भी बेहतर, क्योंकि यह संपादक के विशिष्ट तर्क की नकल करता है, इसे शुरू से नियमों का एक विशाल नया सेट सीखने की आवश्यकता नहीं है। यह एक जेनेरिक समाधान की तुलना में 1,000 गुना हल्का (कम पैरामीटर्स) है लेकिन बहुत बेहतर काम करता है क्योंकि यह उसी परिवार से "पैदा" हुआ है।

3. "अर्ली मेंटर" (Targeted KL Distillation)

ट्रेनिंग के दौरान, असिस्टेंट को यह सीखना होता है कि अनुमान कैसे लगाया जाए। आमतौर पर, यह केवल यह सीखता है कि एक शब्द "सही" है या "गलत"।

  • सुधार: लेखकों ने एक विशेष ट्रेनिंग चरण जोड़ा है जहाँ संपादक अनुमान के पहले कुछ शब्दों के लिए असिस्टेंट के लिए एक मेंटर (गुरु) के रूप में कार्य करता है। केवल "हाँ/नहीं" कहने के बजाय, मेंटर क्या हो सकता है इसकी पूर्ण संभावना (probability) दिखाता है (जैसे, "60% संभावना है कि यह 'बिल्ली' है, 30% 'कुत्ता'")।
  • केवल पहले कुछ ही क्यों? जैसे-जैसे असिस्टेंट आगे के शब्दों का अनुमान लगाता है, मेंटर की सलाह कम प्रासंगिक होती जाती है क्योंकि मेंटर उन "सही" शब्दों को देख रहा होता है जिन्हें असिस्टेंट ने अभी तक नहीं पहचाना है। इसलिए, वे एक मजबूत नींव बनाने के लिए केवल महत्वपूर्ण शुरुआती चरणों के लिए इस मेंटरशिप का उपयोग करते हैं, और फिर असिस्टेंट को अपने दम पर चलने देते हैं।

परिणाम

जब उन्होंने इस नए सिस्टम का परीक्षण किया:

  • Native MTP (इन-बिल्ट गेसर): पहले शब्द के लिए अच्छा है, लेकिन तीसरे, चौथे या पांचवें के लिए बहुत खराब है।
  • Vanilla DFlash (जेनेरिक असिस्टेंट): अद्वितीय DeepSeek आर्किटेक्चर के अनुकूल होने के लिए संघर्ष करता है।
  • HyperDFlash: लगातार अधिक शब्दों को क्रम में सही ढंग से अनुमानित करता है।

मुख्य बात (The Bottom Line):
DeepSeek-V4 मॉडल की अनूठी "बहु-पथ" संरचना का सम्मान करके और इसके अपने मर्जिंग नियमों के हल्के, कॉपी किए गए संस्करण का उपयोग करके, HyperDFlash इस AI को पहले की तुलना में 2.8 गुना तेज़ टेक्स्ट जेनरेट करने की अनुमति देता है, जबकि उच्च गुणवत्ता बनाए रखता है। यह एक धीमी, चरण-दर-चरण प्रक्रिया को बिना सटीकता खोए, एक तेज़, समानांतर स्प्रिंट में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →