← नवीनतम पेपर
💻 computer science

Continuum: Efficient and Robust Multi-Turn LLM Agent Scheduling with KV Cache Time-to-Live

यह शोध पत्र CacheTTL प्रस्तुत करता है, जो एक नवीन KV कैश प्रबंधन प्रणाली है जो मल्टी-टर्न LLM एजेंट वर्कफ़्लो में टूल-कॉल ठहराव के दौरान कैश को चुनिंदा रूप से बनाए रखने के लिए एक गतिशील टाइम-टू-लिव मैकेनिज्म का उपयोग करती है, जिससे मौजूदा इवििक्शन नीतियों की तुलना में जॉब कंप्लीशन टाइम में 8 गुना से अधिक सुधार और बेहतर थ्रूपुट प्राप्त होता है।

मूल लेखक: Hanchen Li, Runyuan He, Qiuyang Mang, Qizheng Zhang, Huanzhi Mao, Xiaokun Chen, Hangrui Zhou, Alvin Cheung, Joseph Gonzalez, Ion Stoica

प्रकाशित 2026-05-06
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hanchen Li, Runyuan He, Qiuyang Mang, Qizheng Zhang, Huanzhi Mao, Xiaokun Chen, Hangrui Zhou, Alvin Cheung, Joseph Gonzalez, Ion Stoica

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक अत्यधिक कुशल, सुपर-फास्ट किचन चला रहे हैं जहाँ एक मास्टर शेफ (AI) एक साथ कई ग्राहकों के लिए जटिल व्यंजन बना रहा है।

समस्या: "रुकने और शुरू करने वाला" किचन

एक सामान्य AI चैटबॉट में, शेफ एक डिश बनाता है, उसे परोसता है, और फिर तुरंत अगली डिश बनाना शुरू कर देता है। यदि किचन में भीड़ हो जाती है, तो शेफ नए ग्राहक के ऑर्डर के लिए जगह बनाने के लिए वर्तमान डिश की आधी-तैयार सामग्री को फेंक देता है। यह सरल चैट्स के लिए ठीक काम करता है।

लेकिन आधुनिक AI "एजेंट्स" अलग होते हैं। वे केवल चैट नहीं करते; वे कार्य करते हैं। वे सोचते हैं, फिर एक टूल (जैसे मौसम की जांच करना या वेब सर्च करना) कॉल करते हैं, परिणाम का इंतजार करते हैं, और फिर उसी भोजन को बनाना जारी रखते हैं।

यहाँ वर्तमान सिस्टम में एक गड़बड़ी (glitch) है:

  1. शेफ एक भोजन बनाना शुरू करता है।
  2. शेफ एक टूल कॉल करने के लिए रुकता है (जैसे, "मौसम की जांच करें")।
  3. क्योंकि शेफ "रुका हुआ" है, किचन सिस्टम मान लेता है कि ऑर्डर पूरा हो गया है। वह वर्तमान डिश की आधी-तैयार सामग्री (KV Cache) को फेंक देता है ताकि अन्य ऑर्डर्स के लिए जगह बनाई जा सके।
  4. टूल 2 सेकंड में पूरा होता है। शेफ फिर से शुरू करने के लिए तैयार है।
  5. आपदा: सामग्री खत्म हो गई है! शेफ को या तो दूर के गोदाम से सामग्री दोबारा खरीदने (CPU offloading) या सब कुछ फिर से काटने-पीटने (re-computation) की आवश्यकता होती है।
  6. इससे भी बुरा यह है कि क्योंकि सामग्री फेंक दी गई थी, इसलिए शेफ को कटिंग बोर्ड पर जगह पाने के लिए अन्य ग्राहकों के पीछे लाइन में इंतजार करना पड़ता है।

यह बार-बार होता है। यदि एक एजेंट किसी समस्या को हल करने के लिए 20 स्टेप्स लेता है, तो वह काम को 20 बार दोहराने और लाइन में इंतजार करने में बर्बाद कर सकता है।

समाधान: CacheTTL (द "कीप-इट-रेडी" टाइमर)

शोधकर्ताओं ने एक नया सिस्टम बनाया जिसे CacheTTL कहा जाता है। इसे ऐसे समझें कि हर ऑर्डर के लिए शेफ को एक विशेष "कीप-इट-रेडी" (तैयार रखें) टाइमर दिया गया है।

शेफ के रुकने पर सामग्री को तुरंत फेंकने के बजाय, सिस्टम कहता है: "रुको! यह शेफ 2 सेकंड में वापस आ सकता है। आइए कुछ समय के लिए सामग्री को काउंटर पर ही रहने दें (Time-To-Live, या TTL)।"

यह सरल रूप से कैसे काम करता है:

  1. स्मार्ट भविष्यवाणी: सिस्टम इतिहास देखता है। "आमतौर पर, जब शेफ 'चेक वेदर' कॉल करता है, तो इसमें लगभग 2 सेकंड लगते हैं। जब वे 'सर्च द वेब' कॉल करते हैं, तो इसमें 5 सेकंड लगते हैं।"
  2. टाइमर: यह उस भविष्यवाणी के आधार पर एक टाइमर सेट करता है। यदि टूल कॉल के 2 सेकंड लगने की उम्मीद है, तो सामग्री 2.5 सेकंड के लिए काउंटर पर रहती है।
  3. फायदा:
    • यदि शेफ समय पर लौट आता है: सामग्री अभी भी वहीं है! शेफ वहीं से शुरू करता है जहाँ उसने छोड़ा था। कोई दोबारा काटने-पीटने की जरूरत नहीं, न ही लाइन में इंतजार करने की।
    • यदि शेफ देर से आता है: यदि टूल 2 सेकंड के बजाय 10 सेकंड लेता है, तो टाइमर खत्म हो जाता है। सिस्टम सुरक्षित रूप से अन्य ग्राहकों के लिए जगह बनाने के लिए सामग्री को फेंक देता है, जिससे किचन जाम होने से बच जाता है।

यह हमारे पास जो पहले था उससे बेहतर क्यों है?

पिछले सिस्टमों ने अनुमान लगाने की कोशिश की थी कि उन्हें सामग्री रखनी चाहिए या नहीं, लेकिन वे केवल एक चीज़ देखते थे: "क्या सामग्री को दोबारा खरीदना महंगा है?" उन्होंने बड़ी समस्या को नजरअंदाज कर दिया: "काम पर वापस आने के लिए शेफ को लाइन में कितना इंतजार करना पड़ेगा?"

CacheTTL इन दोनों को देखता है:

  • भोजन को दोबारा बनाने की लागत।
  • लाइन में इंतजार करने की लागत (क्यूइंग डिले)।

यह कुल मिलाकर सबसे अधिक समय बचाने के लिए सामग्री को काउंटर पर रखने का सही समय कैलकुलेट करता है।

परिणाम

शोधकर्ताओं ने वास्तविक दुनिया के AI एजेंटों के साथ इनका परीक्षण किया जो सॉफ्टवेयर बग्स हल करते हैं, वेब सर्च करते हैं और कोड लिखते हैं। उन्होंने पाया कि:

  • गति (Speed): वास्तविक दुनिया के कुछ परीक्षणों में एजेंट अपने कार्यों को 8 गुना तेजी से पूरा कर पाए।
  • दक्षता (Efficiency): किचन (GPU) बिना अटके एक साथ अधिक ऑर्डर्स संभाल सकता था।
  • मजबूती (Robustness): भले ही टूल कॉल उम्मीद से अधिक समय ले रहे थे, सिस्टम क्रैश नहीं हुआ या अटका नहीं; इसने बस टाइमर को समाप्त होने दिया और आगे बढ़ गया।

संक्षेप में

CacheTTL एक स्मार्ट किचन मैनेजर की तरह है जो जानता है कि जब शेफ फोन कॉल करने के लिए रुकता है, तो वह खाना बनाना खत्म नहीं कर रहा है। सामग्री को बिल्कुल सही समय के लिए तैयार रखने से, यह शेफ को या तो शुरू से शुरू करने या लाइन में इंतजार करने से रोकता है, जिससे पूरा किचन बहुत अधिक सुचारू और तेज़ चलता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →