← नवीनतम पेपर
💬 NLP

When Hidden States Drift: Can KV Caches Rescue Long-Range Speculative Decoding?

यह शोध पत्र KVShot प्रस्तुत करता है, जो एक नैदानिक ढांचा (diagnostic framework) है जो यह प्रदर्शित करता है कि कैसे ड्राफ्ट मॉडलों को लक्षित KV कैश (target KV caches) को पुन: उपयोग करने में सक्षम करने से स्पेक्युलेटिव डिकोडिंग (speculative decoding) में दीर्घकालिक सटीकता ह्रास (long-range accuracy decay) को कम किया जा सकता है, और साथ ही वर्तमान प्रशिक्षण पाइपलाइनों में उन संरचनात्मक बाधाओं की पहचान करता है जो ब्लॉक-वाइज प्रशिक्षण प्रतिमानों (block-wise training paradigms) की ओर बदलाव को आवश्यक बनाते हैं।

मूल लेखक: Tianyu Liu, Yuhao Shen, Xinyi Hu, Baolin Zhang, Hengxin Zhang, Jun Dai, Jun Zhang, Shuang Ge, Lei Chen, Yue Li, MingCheng Wan

प्रकाशित 2026-04-30
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tianyu Liu, Yuhao Shen, Xinyi Hu, Baolin Zhang, Hengxin Zhang, Jun Dai, Jun Zhang, Shuang Ge, Lei Chen, Yue Li, MingCheng Wan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक कहानी में अगले वाक्य की भविष्यवाणी करने की कोशिश कर रहे हैं। आपके पास एक सुपर-इंटेलिजेंट ऑथर (टारगेट मॉडल) है जो कहानी को पूरी तरह से लिखता है, लेकिन वह बहुत धीमा है क्योंकि वह एक बार में एक शब्द लिखता है। काम को तेज़ करने के लिए, आपने एक स्पीडी असिस्टेंट (ड्राफ्ट मॉडल) को काम पर रखा है जो ऑथर द्वारा जांचने से पहले अगले कुछ शब्दों का अनुमान लगा सके। यदि असिस्टेंट सही अनुमान लगाता है, तो ऑथर बस उसकी पुष्टि कर देता है, जिससे समय बचता है। यदि असिस्टेंट गलत अनुमान लगाता है, तो ऑथर को फिर से शुरुआत करनी पड़ती है।

समस्या: "धुंधली फोटो" का प्रभाव

वर्तमान में, सबसे अच्छे असिस्टेंट को ऑथर के "विचारों" (जिसे हिडन स्टेट्स कहा जाता है) से संकेत मिलते हैं।

  • उपमा: कल्पना कीजिए कि ऑथर अगले शब्द को लिखने के लिए सुरागों की एक लंबी सूची देख रहा है। निर्णय लेने के लिए, वह पूरी सूची को सिकोड़कर और संक्षिप्त करके एक एकल, धुंधली फोटो में बदल देता है। यह फोटो अगले ही शब्द के निर्णय के लिए एकदम सही है।
  • समस्या: यदि असिस्टेंट आगे के पाँचवें या छठे शब्द का अनुमान लगाने की कोशिश करता है, तो वह उसी धुंधली फोटो को देख रहा होता है। लेकिन फोटो को पहले शब्द को हल करने के लिए सिकोड़ा गया था। वे विवरण जिन्हें पहले शब्द के लिए अनदेखा किया गया था (क्योंकि वे अभी प्रासंगिक नहीं थे), पांचवें शब्द के लिए महत्वपूर्ण हो सकते हैं। जैसे-जैसे असिस्टेंट आगे का अनुमान लगाने की कोशिश करता है, चीजें उतनी ही धुंधली और कम सटीक होती जाती हैं। इसे "लॉन्ग-रेंज डिके" कहा जाता है।

प्रस्तावित समाधान: "फुल फाइलिंग कैबिनेट"

लेखक एक अलग दृष्टिकोण का सुझाव देते हैं: असिस्टेंट को ऑथर की "सिकुड़ी हुई फोटो" (हिडन स्टेट) देने के बजाय, उन्हें सुरागों का पूरा फाइलिंग कैबिनेट (KV कैश) दें।

  • उपमा: फाइलिंग कैबिनेट में हर एक सुराग पूरी तरह से सुरक्षित है, बिना किसी संक्षिप्तीकरण या धुंधलेपन के।
  • नया काम: अब, असिस्टेंट को यह अनुमान लगाने की ज़रूरत नहीं है कि सुराग क्या थे। उनके पास सभी सुराग वहीं मौजूद हैं। उनका एकमात्र काम यह पता लगाना है कि भविष्य के शब्द के लिए किन सुरागों को देखना है। यह एक लाइब्रेरी मिलने जैसा है और आपसे पूछा गया है कि आने वाले अध्याय के लिए सही किताब कैसे ढूँढनी है। आपके पास सारी जानकारी है; आपको बस यह जानने की ज़रूरत है कि उसे कैसे खोजा जाए।

प्रयोग: "KVShot"

शोधकर्ताओं ने असिस्टेंट की मदद करने के तीन तरीकों की तुलना करने के लिए KVShot नामक एक परीक्षण स्थल बनाया:

  1. पुराना तरीका (हिडन-ओनली): असिस्टेंट को धुंधली फोटो दें। (यह वर्तमान सिस्टम करते हैं)।
  2. नया तरीका (KV-ओनली): असिस्टेंट को पूरा फाइलिंग कैबिनेट दें, लेकिन कोई फोटो नहीं।
  3. हाइब्रिड तरीका: असिस्टेंट को धुंधली फोटो और फाइलिंग कैबिनेट दोनों दें, जिससे वे कैबिनेट का उपयोग करके फोटो की गलतियों को सुधार सकें।

उन्हें क्या पता चला

  1. फाइलिंग कैबिनेट मदद करता है (अंततः): जब असिस्टेंट कई शब्द आगे का अनुमान लगाने की कोशिश करता है (स्टेप 3, 4, 5+), तो "फुल फाइलिंग कैबिनेट" वाला दृष्टिकोण धुंधली फोटो की तुलना में बहुत बेहतर होता है। यह जानकारी को उतनी तेज़ी से नहीं खोता है।
  2. लेकिन इसे सीखना कठिन है: "फाइलिंग कैबिनेट" दृष्टिकोण की एक शर्त है। असिस्टेंट एक बहुत छोटा, सरल मॉडल है। वह कैबिनेट को प्रभावी ढंग से खोजने का तरीका सीखने में संघर्ष करता है। यह एक बच्चे को एक विशाल लाइब्रेरी देने और उससे एक ऐसी कहानी के लिए विशिष्ट पुस्तक खोजने के लिए कहने जैसा है जो उसने अभी तक लिखी भी नहीं है; वे अभिभूत हो जाते हैं।
    • जब उन्होंने असिस्टेंट को थोड़ा स्मार्ट बनाया (अधिक गहरा/डीपर), तो वह कैबिनेट का उपयोग करने में बेहतर हुआ, लेकिन फिर भी वह पहले ही शब्द के लिए "धुंधली फोटो" पद्धति को मात नहीं दे सका।
  3. हाइब्रिड जीतता है (थोड़ा सा): सबसे अच्छा परिणाम हाइब्रिड दृष्टिकोण से आया। असिस्टेंट ने तत्काल अगले शब्द के लिए धुंधली फोटो का उपयोग किया (जहाँ वह बेहतरीन है) और बाद के शब्दों के लिए खुद को सुधारने के लिए फाइलिंग कैबिनेट का उपयोग किया।
  4. स्पीड ट्रैप: भले ही लैब में हाइब्रिड असिस्टेंट ने अधिक शब्दों का सही अनुमान लगाया, लेकिन वास्तविक दुनिया में कुल गति में अधिक सुधार नहीं हुआ
    • क्यों? "फाइलिंग कैबिनेट" पद्धति के लिए असिस्टेंट को सुरागों को खोजने के लिए अतिरिक्त गणित करने की आवश्यकता होती है। इस अतिरिक्त काम ने असिस्टेंट को इतना धीमा कर दिया कि इससे सही शब्दों के अनुमान से बचाए गए समय की भरपाई हो गई।

मूल कारण: ट्रेनिंग मिसमैच

पेपर निष्कर्ष निकालता है कि समस्या "फाइलिंग कैबिनेट" की नहीं है; बल्कि यह है कि असिस्टेंट को कैसे प्रशिक्षित किया जाता है

  • वर्तमान में, असिस्टेंट को एक-एक करके, एक-एक शब्द का अनुमान लगाने के लिए प्रशिक्षित किया जाता है (एक धीमी, क्रमिक प्रक्रिया की तरह)।
  • लेकिन कैबिनेट का प्रभावी ढंग से उपयोग करने के लिए, असिस्टेंट को कई शब्दों को एक साथ देखने की आवश्यकता होती है ताकि वह खोजना सीख सके।
  • क्योंकि प्रशिक्षण विधि बहुत धीमी और क्रमिक है, असिस्टेंट कभी भी सुरागों की पूरी शक्ति का उपयोग करना नहीं सीख पाता है। यह किसी को 5 मील प्रति घंटे की गति से केवल पार्किंग लॉट में गाड़ी चलाकर रेस कार चलाना सिखाने जैसा है।

निचोड़

यह पेपर साबित करता है कि "पूर्ण सुरागों" (KV कैश) को रखना "संक्षिप्त विचारों" (हिडन स्टेट्स) का उपयोग करने की तुलना में लंबे अनुमानों के लिए जानकारी को सुरक्षित रखने का एक बेहतर तरीका है। हालांकि, हमारे वर्तमान प्रशिक्षण तरीके इन असिस्टेंट को कुशलतापूर्वक इन सुरागों का उपयोग करना सिखाने के लिए बहुत अनाड़ी हैं। इसे वास्तविक दुनिया में काम करने के लिए, हमें अपने मॉडलों को प्रशिक्षित करने के तरीके को बदलना होगा, जो "एक बार में एक शब्द" से हटकर "शब्दों के समूहों (चंक्स) के माध्यम से" की ओर बढ़े।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →