← नवीनतम पेपर
💻 computer science

Leyline: KV Cache Directives for Agentic Inference

यह शोध पत्र Leyline को प्रस्तुत करता है, जो एक नवीन सर्विंग-साइड प्रिमिटिव (serving-side primitive) है जो डिक्लेरेटिव डायरेक्टिव्स (declarative directives) और क्लोज्ड-फॉर्म RoPE करेक्शन्स (closed-form RoPE corrections) के माध्यम से एजेंटिक LLMs को कैश किए गए कंटेंट को गतिशील रूप से संपादित या हटाने में सक्षम बनाता है, जिससे महंगी री-प्रीफिलिंग (re-prefilling) की आवश्यकता समाप्त हो जाती है और लेटेंसी एवं टास्क सक्सेस रेट दोनों में महत्वपूर्ण सुधार होता है।

मूल लेखक: Bole Ma, Jan Eitzinger, Harald Koestler

प्रकाशित 2026-06-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Bole Ma, Jan Eitzinger, Harald Koestler

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, तेज़ बोलने वाले सहायक (एक AI) हैं जो एक जासूस को रहस्य सुलझाने में मदद कर रहे हैं। अपना काम करने के लिए, सहायक अपने दिमाग में एक विशाल "स्क्रैचपैड" (जिसे KV Cache कहा जाता है) रखता है। यह स्क्रैचपैड वह सब कुछ रखता है जो जासूस ने अब तक कहा है, मिली हुई हर सुराग और इस्तेमाल किया गया हर उपकरण।

पुराना तरीका: "अपेंड-ओनली" (केवल जोड़ने वाला) नोटबुक

अतीत में, AI सहायक एक ऐसे व्यक्ति की तरह काम करते थे जो एक ऐसी नोटबुक में लिखता था जिसे कभी मिटाया नहीं जा सकता।

  • नियम: आप एक सुराग लिखते हैं, फिर उसके नीचे अगला सुराग लिखते हैं। नोटबुक केवल बढ़ती जाती है।
  • समस्या: यदि जासूस को एहसास होता है, "रुको, वह पिछला सुराग गलत था, चलो उसे फेंक देते हैं और एक अलग कोण आज़माते हैं," तो पुराना सिस्टम उस लाइन को बस मिटा नहीं सकता था। उसे पेज नंबर सही रखने के लिए पूरी का पूरी पूरी पन्ना फाड़कर सब कुछ शुरू से फिर से लिखना पड़ता था।
  • लागत: यह धीमा और बर्बादी भरा है। यह एक पूरी किताब को फिर से लिखने जैसा है सिर्फ बीच में एक शब्द बदलने के लिए।

नई समस्या: "एजेंटिक" (Agentic) जासूस

आधुनिक AI एजेंट अधिक गतिशील होते हैं। वे केवल चैट नहीं करते; वे कार्य करते हैं। वे एक टूल आज़माते हैं, विफल होते हैं, उस विफलता को हटाते हैं, फिर से प्रयास करते हैं, और जगह बचाने के लिए पुराने नोट्स का सारांश बनाते हैं।

  • मुद्दा: जब एजेंट बातचीत के बीच में टेक्स्ट का एक हिस्सा हटा देता है, तो उसके बाद आने वाले टेक्स्ट के "पेज नंबर" (स्थितियाँ/positions) बदल जाते हैं।
  • परिणाम: पुराना "स्क्रैचपैड" भ्रमित हो जाता है। उसे लगता है कि सुराग गलत जगहों पर हैं, इसलिए उसे अपनी याददाश्त फेंकनी पड़ती है और सब कुछ शुरू से (re-prefill) करना पड़ता है। यह गति को खत्म कर देता है।

समाधान: लेलाइन (Leyline - "जादुई कैंची")

यह पेपर Leyline को पेश करता है, जो AI के सर्विंग सिस्टम के लिए एक नया टूल है। Leyline को एक जादुई कैंची और एक स्थिति-शिफ्ट करने वाले रूलर (पैमाने) के रूप में समझें।

यह इस प्रकार काम करता है, एक सरल उपमा का उपयोग करते हुए:

  1. निर्देश (The Directive):
    AI एजेंट Leyline को बताता है: "विफल टूल कॉल (Span) वाले पैराग्राफ को काट दो और उसे 'आउटपुट ओमिटेड' (Output omitted) कहने वाले एक छोटे नोट से बदल दो (Replacement)।" एजेंट को यह जानने की ज़रूरत नहीं है कि गणित कैसे किया जाए; वह बस निर्देश देता है।

  2. स्प्लिस (The Splice - कट और पेस्ट):
    Leyline पुराने पैराग्राफ को भौतिक रूप से काटकर निकालता है और उसकी जगह छोटा नोट पेस्ट कर देता है।

    • महत्वपूर्ण चरण: क्योंकि टेक्स्ट छोटा हो गया है, इसलिए उसके बाद का सब कुछ अब भौतिक रूप से शुरुआत के करीब है।
  3. "जादुई रूलर" (The δ\delta-Rotation):
    यही इस पेपर का गुप्त मंत्र है। AI में, किसी शब्द की "स्थिति" एक गुप्त कोड (RoPE) की तरह एनकोड की जाती है। यदि आप एक शब्द को स्थिति 100 से 90 पर ले जाते हैं, तो कोड को बदलना पड़ता है।

    • पुराना तरीका: कट के बाद आने वाले हर एक शब्द के लिए कोड को फिर से कैलकुलेट करें। (धीमा!)
    • Leyline का तरीका: Leyline एक गणितीय शॉर्टकट का उपयोग करता है। वह महसूस करता है कि यदि आपने सबको 10 स्थान पीछे धकेला है, तो आपको बस उसके बाद आने वाले शब्दों के कोड में एक साधारण "रोटेशन" (एक त्वरित गणितीय सुधार) लागू करने की आवश्यकता है। यह एक लाइन में खड़े लोगों को यह बताने जैसा है, "सब लोग 10 कदम बाईं ओर बढ़ें," और फिर बस उनके हेडबैंड को अपडेट करना ताकि वे अपनी नई जगह को दर्शा सकें, बजाय इसके कि उन्हें पूरी लाइन में फिर से चलाकर ले जाया जाए।

यह क्यों मायने रखता है (परिणाम)

शोधकर्ताओं ने इसे दो तरीकों से परखा:

  1. स्पीड टेस्ट (तंत्र):
    जब AI अपनी मेमोरी को एडिट करता है, तो Leyline बहुत सारा समय बचाता है।

    • उपमा: एक टाइपो को ठीक करने के लिए 50 पन्नों का दस्तावेज़ फिर से लिखने के बजाय, आप बस पन्ना बदलते हैं और पेज नंबर तुरंत अपडेट कर देते हैं।
    • परिणाम: सिस्टम प्रत्येक अनुरोध (request) के लिए 241 मिलीसेकंड तक तेज़ हो गया और इसकी मौजूदा मेमोरी का लगभग 11% अधिक पुन: उपयोग किया, जिसका अर्थ है कि इसे पूरी बातचीत को फिर से पढ़ने की आवश्यकता नहीं पड़ी।
  2. स्मार्ट एजेंट टेस्ट (पॉलिसी):
    शोधकर्ताओं ने AI को एक सरल नियम दिया: "यदि कोई टूल आउटपुट पुराना और बेकार है, तो उसे हटा दें।"

    • Leyline के बिना: AI टेक्स्ट को हटा देगा, लेकिन सिस्टम को सब कुछ फिर से कैलकुलेट करना होगा, जिससे AI इतना धीमा हो जाएगा कि वह कार्य करने में विफल हो सकता है।
    • Leyline के साथ: AI कचरे को तुरंत हटा देता है। क्योंकि संदर्भ (context) साफ और छोटा है, इसलिए AI महत्वपूर्ण सुरागों पर बेहतर ध्यान केंद्रित करता है।
    • परिणाम: AI ने कठिन डिबगिंग कार्यों को 14.3% अधिक सफलतापूर्वक हल किया क्योंकि वह पुराने, बेकार जानकारी से विचलित नहीं हुआ, और उसने इसे हटाने के लिए भारी गति दंड (speed penalty) भी नहीं चुकाया।

बड़ी तस्वीर (The Big Picture)

Leyleyne AI (एजेंट) और कंप्यूटर मेमोरी (कैश) के बीच के संबंध को बदल देता है।

  • पहले: कंप्यूटर मेमोरी एक निष्क्रिय, कठोर नोटबुक थी जिसे AI को सावधानी से संभालना पड़ता था।
  • अब: मेमोरी एक प्रोग्रामेबल टूल है। AI कह सकता है, "इसे काटो, इसे पेस्ट करो, और नंबर ठीक करो," और सिस्टम बिना अपनी जगह खोए तुरंत आज्ञा का पालन करता है।

यह पेपर साबित करता है कि यह अनुमति देकर कि AI स्पष्ट रूप से सिस्टम को क्या एडिट करना है, हम AI को तेज़, स्मार्ट और केंद्रित रख सकते हैं, भले ही वह लगातार अपना मन बदल रहा हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →