← नवीनतम पेपर
💬 NLP

YOCO++: Enhancing YOCO with KV Residual Connections for Efficient LLM Inference

यह शोध पत्र YOCO++ प्रस्तुत करता है, जो एक उन्नत क्रॉस-लेयर KV संपीड़न विधि है जो मूल YOCO दृष्टिकोण के प्रदर्शन को बेहतर बनाने के लिए भारित अवशिष्ट कनेक्शनों (weighted residual connections) को शामिल करती है, जिससे प्रशिक्षण या अनुमान गति से समझौता किए बिना 50% KV कैश संपीड़न दर पर मानक ट्रांसफॉर्मर से बेहतर प्रदर्शन करते हुए अत्याधुनिक दक्षता प्राप्त होती है।

मूल लेखक: You Wu, Ziheng Chen, Yizhen Zhang, Haoyi Wu, Chengting Yu, Yuchi Xu, Wenbo Su, Bo Zheng, Kewei Tu

प्रकाशित 2026-04-16
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: You Wu, Ziheng Chen, Yizhen Zhang, Haoyi Wu, Chengting Yu, Yuchi Xu, Wenbo Su, Bo Zheng, Kewei Tu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, तेज़ गति वाली लाइब्रेरी चला रहे हैं जहाँ एक लाइब्रेरियन (AI) को एक लंबी कहानी पढ़नी है और फिर शब्द-दर-शब्द अगला अध्याय लिखना है।

यह करने के लिए, लाइब्रेरियन अपने डेस्क पर एक "चीट शीट" (जिसे KV Cache कहा जाता है) रखता है। इसमें कहानी के अब तक के सबसे महत्वपूर्ण विवरण शामिल हैं, ताकि उसे हर बार नया वाक्य लिखने के लिए पूरी किताब दोबारा न पढ़नी पड़े।

समस्या: डेस्क बहुत छोटा है

जैसे-जैसे कहानी लंबी होती जाती है, यह चीट शीट बहुत बड़ी होती जाती है। अंततः, डेस्क (कंप्यूटर की मेमोरी) इतना भर जाता है कि लाइब्रेरियन कुछ भी ढूँढ नहीं पाता, या जगह बनाने के लिए उसे चीजें फेंकनी पड़ती हैं। इससे काम धीमा हो जाता है।

पुराना समाधान: "द मिडिल मैन" (YOCO)

गंदगी को ठीक करने के लिए, YOCO नामक एक पिछले तरीके ने एक चतुर ट्रिक आज़माई:

  • कहानी के हर पन्ने के लिए चीट शीट रखने के बजाय, लाइब्रेरियन कहानी के पहले आधे हिस्से के लिए ही शीट रखता है।
  • कहानी के दूसरे आधे हिस्से के लिए, वे बस बीच के हिस्से से चीट शीट की नकल करते हैं और उसे ही दोबारा उपयोग करते हैं।
  • परिणाम: डेस्क आधा कम भरा हुआ है, इसलिए लाइब्रेरियन दोगुना तेज़ काम करता है।
  • चुनौती: क्योंकि वे कहानी के नए हिस्सों के लिए एक पुराने, सामान्य चीट शीट का पुन: उपयोग कर रहे हैं, लाइब्रेरियन कभी-कभी भ्रमित हो जाता है या गलतियाँ कर देता है। कहानी की गुणवत्ता थोड़ी गिर जाती है।

नया समाधान: "सुपर-इन्हान्स्ड चीट शीट" (YOCO++)

इस पेपर के लेखकों ने पूछा: "क्या होगा अगर हम डेस्क को छोटा भी रख सकें और चीट शीट को स्मार्ट भी बना सकें?"

उन्होंने महसूस किया कि केवल बीच का पन्ना कॉपी करना काफी नहीं था। लाइब्रेरियन को सबसे पहले पन्ने के मूल विवरणों को उस पन्ने के वर्तमान विवरणों के साथ मिलाना (blend) होगा जिस पर वे काम कर रहे हैं।

यहाँ बताया गया है कि YOCO++ कैसे काम करता है, एक कुकिंग एनालॉजी (खाना बनाने के उदाहरण) का उपयोग करते हुए:

  1. रेसिपी: कल्पना कीजिए कि आप सूप बना रहे हैं।

    • YOCO ऐसा था जैसे कहना, "बस खाना पकाने के बाकी हिस्से के लिए बर्तन के बीच से शोरबा (broth) ले लो।" यह कुशल है, लेकिन स्वाद फीका हो जाता है।
    • YOCO++ कहता है, "आइए हम बर्तन के बिल्कुल नीचे वाले मूल, समृद्ध शोरबे (पहली परत) को लें और उसे हमारे द्वारा बनाए जाने वाले सूप के हर नए कलछी (ladle) में थोड़ा सा मिला दें।"
  2. गुप्त सामग्री (Residual Connections):

    • इस नए तरीके में, हर कदम के लिए, AI वर्तमान नोट्स को सबसे पहले पन्ने के नोट्स के साथ मिलाता (blend) है।
    • यह एक "मेमोरी एंकर" रखने जैसा है। भले ही AI कहानी में बहुत गहराई में हो, वह शुरुआत को कभी नहीं भूलता। यह पुराने और नए जानकारी का एक "वेटेड मिक्स" (एक विशिष्ट रेसिपी) बनाता है।
  3. जादुई स्केल:

    • शुरू में, AI को यह नहीं पता था कि कितना "पुराना शोरबा" जोड़ना है। इसलिए, शोधकर्ताओं ने एक स्केलिंग फैक्टर (एक वॉल्यूम नॉब की तरह) जोड़ा। उन्होंने नॉब को ऊँचा किया ताकि AI पुराने और वर्तमान के बीच के सही संतुलन को आसानी से सीख सके।

यह एक बड़ी बात क्यों है?

  • गति: पुराने YOCO तरीके की तरह ही, YOCO++ डेस्क को आधा खाली रखता है। लाइब्रेरियन अभी भी बहुत तेज़ है।
  • गुणवत्ता: क्योंकि लाइब्रेरियन अब हर कदम में "मूल स्वाद" को मिला रहा है, इसलिए कहानी अधिक समझ में आने वाली बनती है। यह वास्तव में उस मानक, धीमी विधि से बेहतर है जहाँ लाइब्रेरियन डेस्क पर सब कुछ रखने की कोशिश करता है।
  • कोई अतिरिक्त काम नहीं: शोधकर्ताओं ने इस मिश्रण (blending) को करने का एक तरीका खोजा जो लाइब्रेरियन के लिखने बैठने से पहले ही हो जाता है, ताकि यह उन्हें धीमा न करे।

निचोड़ (The Bottom Line)

YOCO++ एक लाइब्रेरियन को एक सुपर-स्मार्ट, कॉम्पैक्ट चीट शीट देने जैसा है। यह उन्हें दोगुना तेज़ काम करने (मेमोरी बचाने) की अनुमति देता है और साथ ही वास्तव में एक बेहतर, अधिक सुसंगत कहानी लिखने में मदद करता है, बजाय इसके कि वे डेस्क पर सभी नोट्स रखने की कोशिश करें। यह दोनों दुनिया का सबसे अच्छा है: गुणवत्ता से समझौता किए बिना गति।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →