← नवीनतम पेपर
🤖 AI

SplitZip: Ultra Fast Lossless KV Compression for Disaggregated LLM Serving

SplitZip एक GPU-अनुकूल, लॉसलेस कंप्रेसर है जो एक फिक्स्ड-लेंथ कोडबुक और स्पार्स एस्केप स्ट्रीम के माध्यम से फ्लोटिंग-पॉइंट एक्सपोनेंट रेडंडेंसी का लाभ उठाकर डिसएग्रिगेटेड LLM सर्विंग में KV कैश ट्रांसफर को त्वरित करता है, जिससे मौजूदा तरीकों की तुलना में काफी अधिक थ्रूपुट और कम विलंबता प्राप्त होती है।

मूल लेखक: Yipin Guo, Siddharth Joshi

प्रकाशित 2026-06-25
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yipin Guo, Siddharth Joshi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, उच्च-गति वाली लाइब्रेरी चला रहे हैं जहाँ दो अलग-अलग टीमें जटिल प्रश्नों के उत्तर देने के लिए मिलकर काम करती हैं।

  • टीम A (द "प्रीफिल" टीम): वे शोधकर्ता हैं। वे एक बहुत बड़ा, लंबा दस्तावेज़ (यूज़र का प्रॉम्प्ट) पढ़ते हैं और विस्तृत नोट्स लेते हैं। यह हिस्सा बहुत तेज़ है और इसमें बहुत अधिक दिमागी शक्ति (कंप्यूटिंग पावर) की आवश्यकता होती है।
  • टीम B (द "डिकोड" टीम): वे लेखक हैं। वे उन नोट्स का उपयोग करके एक-एक शब्द करके उत्तर लिखते हैं। यह हिस्सा धीमा है और इसके लिए नोट्स को थामे रखने के लिए बहुत अधिक मेमोरी की आवश्यकता होती है।

आधुनिक AI सिस्टम में, ये दोनों टीमें अक्सर लागत बचाने और वर्कलोड को संतुलित करने के लिए अलग-अलग इमारतों (अलग-अलग सर्वर) में काम करती हैं। समस्या क्या है? टीम A को अपने नोट्स टीम B को भेजने होंगे इससे पहले कि टीम B लिखना शुरू कर सके।

यदि नोट्स बहुत बड़े हैं (जैसे जब यूज़र किसी पूरी किताब के बारे में पूछता है), तो उन्हें मेल करने में बहुत समय लगता है। लेखक (टीम B), नोट्स के आने का इंतज़ार करते हुए खाली बैठा रहता है। यह "मेलिंग डिले" (मेल भेजने में देरी) वह बाधा है जो पूरे सिस्टम को धीमा कर देती है।

वर्तमान "मेलिंग" विधियों के साथ समस्या

पहले, लोगों ने नोट्स को छोटा (कंप्रेस) करने की कोशिश की ताकि उन्हें भेजना तेज़ हो सके।

  • "लॉसी" (Lossy) विधि: कुछ लोगों ने नोट्स के कुछ हिस्सों को हटा दिया ताकि जगह बच सके। लेकिन यह एक उपन्यास का सारांश बनाने जैसा है जिसमें से रैंडम वाक्य हटा दिए गए हों। यह जगह तो बचा सकता है, लेकिन कहानी (AI का उत्तर) गलत या निरर्थक हो सकती है।
  • "पुरानी" लॉसलेस (Lossless) विधि: अन्य लोगों ने नोट्स को बिना एक भी अक्षर खोए पूरी तरह से ज़िप किया। लेकिन जिस सॉफ़्टवेयर का वे उपयोग कर रहे थे, वह एक धीमे, पुराने ज़माने के टाइपिस्ट जैसा था। वह टीम A द्वारा नोट्स जेनरेट करने की गति के साथ तालमेल बिठाने के लिए बहुत धीमा था। जब तक नोट्स ज़िप हो जाते, टीम A पहले ही नोट्स का एक नया बैच जेनरेट कर चुकी होती।

समाधान: स्प्लिटज़िप (SplitZip)

शोधकर्ताओं ने SplitZip नामक एक नया सिस्टम बनाया है। इसे एक सुपर-स्मार्ट, हाई-स्पीड कूरियर सर्विस के रूप में समझें जो विशेष रूप से इन AI नोट्स के लिए डिज़ाइन की गई है।

यह इस प्रकार काम करता है, एक सरल उपमा का उपयोग करते हुए:

1. "नोट" की संरचना
AI जो नोट्स जेनरेट करता है, वे नंबरों से बने होते हैं। जिस फॉर्मेट (BF16) का वे उपयोग करते हैं, उसमें हर नंबर के तीन भाग होते हैं:

  • साइन (Sign): क्या यह पॉजिटिव है या नेगेटिव? (जैसे प्लस या माइनस का निशान)।
  • मैंटिसा (Mantissa): नंबर का विशिष्ट विवरण।
  • एक्सपोनेंट (Exponent): नंबर की "पावर" या स्केल (जैसे कि यह 10, 100, या 1,000 है)।

2. गुप्त खोज
शोधकर्ताओं ने गौर किया कि चीज़ें अजीब हैं: जबकि "विवरण" (मैंटिसा) हर जगह बिखरे हुए हैं, "पावर" (एक्सपोनेंट) बहुत दोहराव वाला है। यह ऐसा है जैसे आप एक किताब लिख रहे हों, और 99% समय, आप केवल "बहुत", "काफी" और "अत्यधिक" जैसे शब्दों का ही उपयोग करते हैं। आप शायद ही कभी "थोड़ा" या "बमुश्किल" जैसे शब्दों का उपयोग करते हैं।

3. स्प्लिटज़िप रणनीति
हर एक शब्द लिखने के बजाय, SplitZip यह करता है:

  • शॉर्टकट: यह सबसे सामान्य "पावर्स" (एक्सपोनेंट्स) की एक "टॉप 16" सूची बनाता है। यह इन 16 सामान्य पावर्स में से प्रत्येक को एक बहुत छोटे, 4-अक्षर वाले कोड (जैसे एक गुप्त हैंडशेक) असाइन करता है।
  • पैकिंग: यह एक सिंगल बाइट स्पेस में इन दो छोटे कोडों को पैक करता है। यह एक अक्षर की जगह में दो गुप्त हैंडशेक फिट करने जैसा है।
  • "रेयर" (दुर्लभ) सूची: 1% बार जब कोई "दुर्लभ" पावर आती है, तो यह उसे शॉर्टकट में जबरदस्ती डालने की कोशिश नहीं करता। इसके बजाय, यह एक छोटा "एस्केप नोट" लिखता है जो कहता है: "पोजीशन #50 पर, पावर वास्तव में 'Rare-Value-99' थी।"

4. यह तेज़ क्यों है

  • टीम A (एनकोडिंग) के लिए: क्योंकि सिस्टम जटिल, वेरिएबल-लेंथ कोड के बजाय फिक्स्ड, शॉर्ट कोड का उपयोग करता है, यह नोट्स को अविश्वसनीय रूप से तेज़ी से पैक कर सकता है। यह एक रोबोटिक हाथ जैसा है जो जानता है कि हर आइटम को कहाँ रखना है, बजाय एक इंसान के जो हर बार शर्ट को मोड़ने का सबसे अच्छा तरीका सोचने में लगा रहता है।
  • टीम B (डिकोडिंग) के लिए: जब नोट्स पहुँचते हैं, तो टीम B उन्हें तुरंत अनपैक कर सकती है। वे 4-अक्षर वाले कोड को देखते हैं, पावर प्राप्त करते हैं, और विवरणों के साथ उसे मिला देते हैं। यदि कोई "एस्केप नोट" है, तो वे बस उस एक स्थान को ओवरराइट कर देते हैं। यह बिना किसी भ्रमित करने वाले मोड़ के, काम की एक सीधी रेखा है।

परिणाम

पेपर का दावा है कि SplitZip एक गेम-चेंजर है:

  • गति: यह डेटा को 613 GB/s और 2181 GB/s की गति से कंप्रेस और डिकम्प्रेस करता है। इसे समझने के लिए, यह पिछले तरीकों की तुलना में सैकड़ों गुना तेज़ है जिन्होंने CPU पर ऐसा करने की कोशिश की थी।
  • पूर्ण सटीकता: यह "लॉसलेस" है। टीम B को मिलने वाले नोट्स बिट-फॉर-बिट समान हैं जो टीम A ने लिखे थे। कोई जानकारी खोई नहीं गई है।
  • वास्तविक दुनिया का प्रभाव: जब उन्होंने एक वास्तविक AI सिस्टम (SGLang फ्रेमवर्क का उपयोग करके) में इसका परीक्षण किया, तो उन्होंने देखा:
    • सर्वरों के बीच नोट्स का 1.32x तेज़ ट्रांसफर।
    • पहले उत्तर शब्द तक पहुँचने का समय (TTFT) 1.30x तेज़
    • प्रति घंटा कुल अनुरोधों (requests) की संख्या में 1.23x की वृद्धि

सारांश

SplitZip एक विशेष, हाई-स्पीड कूरियर की तरह है जो जानता है कि AI के नोट्स ज्यादातर दोहराव वाले होते हैं। पूरा भारी बॉक्स भेजने के बजाय, यह सामान्य वस्तुओं की एक छोटी, कोडेड सूची और दुर्लभ वस्तुओं के लिए एक छोटा नोट भेजता है। यह इसे इतनी तेज़ी से करता है कि AI सर्वर को कभी इंतज़ार नहीं करना पड़ता, जिससे यह बिना किसी विवरण को खोए, लंबे और जटिल प्रश्नों का उत्तर बहुत तेज़ी से दे पाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →