Observation, Not Prediction: Conversation-Level Disaggregated Scheduling for Agentic Serving
यह शोध पत्र ConServe को पेश करता है, जो एक शेड्यूलिंग फ्रेमवर्क है जो शेड्यूलिंग यूनिट को व्यक्तिगत टर्न से बदलकर पूरी बातचीत (कन्वर्सेशन) में ले जाता है ताकि अज्ञात भविष्य की लागतों का पूर्वानुमान लगाने की आवश्यकता को समाप्त किया जा सके, जिससे कंप्यूट-बाउंड प्रीफिल और मेमोरी-बाउंड डिकोडिंग की एक स्थिर दो-चरणीय संरचना का लाभ उठाकर विलंबता (लेटेंसी) को कम किया जा सके और ऊर्जा दक्षता में सुधार किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक व्यस्त रेस्टोरेंट किचन चलाते हैं। पुराने दिनों में, हर ऑर्डर सरल होता था: एक ग्राहक आता है, आप भोजन बनाते हैं, और वे चले जाते हैं। आप किचन को आसानी से प्रबंधित कर सकते थे क्योंकि हर ऑर्डर में लगभग समान समय और प्रयास लगता था।
लेकिन अब, कल्पना कीजिए कि आपके ग्राहक "AI एजेंट" हैं। वे केवल भोजन का ऑर्डर नहीं देते; वे एक जटिल प्रोजेक्ट शुरू करते हैं।
- पहला टर्न (बड़ा ब्रीफ): ग्राहक बैठता है और आपको एक विशाल, 50 पन्नों का निर्देश मैनुअल देता है। इसे पढ़ने और समझने में बहुत समय लगता है (यह "प्रीफिल" है)।
- मध्य टर्न (टूल कॉल्स): शेफ खाना बनाना शुरू करता है, फिर रुककर एक सप्लायर को कॉल करता है, जवाब का इंतज़ार करता है, एक रेसिपी चेक करता है, और वापस कॉल करता है। ये चरण छोटे होते हैं, लेकिन ये बार-बार होते हैं।
- अंतिम टर्न (परिणाम): अंत में, व्यंजन परोसने के लिए तैयार होता है।
समस्या: शेड्यूलिंग का पुराना तरीका
वर्तमान किचन मैनेजर (AI सिस्टम) हर एक चरण को एक अलग ऑर्डर की तरह मानते हैं। हर बार जब शेफ एक सप्लायर को कॉल करने के लिए रुकता है, तो मैनेजर को निर्णय लेना पड़ता है: "क्या मैं इस चरण को मुख्य किचन में ही पूरा करने दूँ, या क्या मुझे इस विशिष्ट चरण को किसी अन्य, विशेष स्टेशन पर भेजना चाहिए?"
समस्या यह है कि मैनेजर को यह अनुमान लगाना पड़ता है कि वह चरण कितना लंबा होगा या उसे कितनी मेमोरी की आवश्यकता होगी इससे पहले कि वह वास्तव में हो। यदि उनका अनुमान गलत हो जाता है, तो वे चरण को गलत स्टेशन पर भेज देते हैं, जिससे ट्रैफिक जाम लग जाता है। यह एक ट्रैफिक पुलिसकर्मी की तरह है जो ड्राइवरों के शुरू होने से पहले ही यह भविष्यवाणी करने की कोशिश कर रहा है कि वे कितनी तेजी से गाड़ी चलाएंगे।
समाधान: ConServe (कन्वर्सेशन-लेवल अप्रोच)
यह पेपर ConServe नामक एक नई प्रणाली पेश करता है। प्रत्येक चरण को अलग-अलग प्रबंधित करने के बजाय, ConServe पूरी बातचीत को एक एकल इकाई के रूप में प्रबंधित करता है।
यहाँ बताया गया है कि ConServe एक सरल दो-चरणीय योजना का उपयोग करके नियमों को कैसे बदलता है:
चरण 1: भारी काम (द प्रीफिल)
जब ग्राहक उस 50 पन्नों के मैनुअल के साथ आता है, तो ConServe उसे तुरंत एक सुपर-फास्ट, हाई-पावर स्टेशन (एक शक्तिशाली GPU) पर भेज देता है। यह स्टेशन विशेष रूप से बड़े दस्तावेज़ों को तेज़ी से पढ़ने के लिए बनाया गया है। यह मैनुअल को पढ़ता है, संदर्भ (context) को समझता है, और आवश्यक चीज़ों का एक "मेमोरी मैप" (जिसे KV कैश कहा जाता है) बनाता है।
चरण 2: लॉन्ग टेल (बातचीत का बाकी हिस्सा)
एक बार जब वह प्रारंभिक मैप बन जाता है, तो ConServe कहता है: "ठीक है, भारी काम हो गया है। अब, यह पूरी बातचीत एक विशिष्ट, छोटे, ऊर्जा-कुशल स्टेशन की है।"
- उस "मेमोरी मैप" को इस नए स्टेशन पर केवल एक बार स्थानांतरित किया जाता है।
- उस क्षण से, हर एक फॉलो-अप चरण (टूल कॉल्स, छोटे अपडेट) उसी एक स्टेशन पर होता है।
- सिस्टम फिर कभी भी अनुमान नहीं लगाता। इससे कोई फर्क नहीं पड़ता कि अगला चरण छोटा है या लंबा; बातचीत काम पूरा होने तक उसी एक स्टेशन से जुड़ी रहती है।
यह बेहतर क्यों है (उपमा)
इसे एक डिलीवरी ट्रक की तरह सोचें:
- पुराना तरीका: आप भविष्यवाणी करने की कोशिश करते हैं कि अगला पैकेज भारी है या हल्का। यदि आपका अनुमान गलत हो जाता है, तो आप भारी भार के लिए छोटा ट्रक भेज देते हैं, या छोटे पैकेज के लिए बड़ा ट्रक। आप ईंधन और समय बर्बाद करते हैं।
- ConServe: आप शुरुआत में एक बार ट्रक लोड करते हैं। आप उस ट्रक को गंतव्य तक ले जाते हैं और वहां पार्क कर देते हैं। उस विशिष्ट ग्राहक के लिए बाद के सभी पैकेज उसी एक ही ट्रक पर लोड किए जाते हैं। आपको अगले पैकेज के वजन की भविष्यवाणी करने की आवश्यकता नहीं है; आप बस उसी ट्रक को कुशलतापूर्वक चलते रहने देते हैं।
परिणाम
इस पेपर ने वास्तविक AI एजेंट वर्कलोड पर इसका परीक्षण किया और पाया:
- गति: इसने ग्राहक द्वारा पहला वास्तविक परिणाम (सिर्फ एक टूल कॉल नहीं) देखने में लगने वाले समय को 51% कम कर दिया। यह ऐसा है जैसे आपको अपना भोजन 50% तेज़ी से मिल रहा है क्योंकि किचन इस बात को लेकर भ्रमित नहीं है कि सामग्री कहाँ रखनी है।
- दक्षता: इसने 7.5% ऊर्जा बचाई। केवल बड़े शुरुआती रीडिंग के लिए एक शक्तिशाली स्टेशन और बाकी के लिए एक सस्ते स्टेशन का उपयोग करके, यह बिजली का कम अपव्यय करता है।
- विश्वसनीयता: क्योंकि सिस्टम को आगे क्या होगा इसकी भविष्यवाणी (predict) करने की आवश्यकता नहीं है, इसलिए यह कभी भी "गलत मोड़" वाली त्रुटियां नहीं करता है। पुराने सिस्टम धीमे हो जाते थे या क्रैश हो जाते थे यदि उनकी भविष्यवाणियां गलत होती थीं; ConServe बस चलता रहता है क्योंकि यह जो कुछ भी अभी देख सकता है, उस पर भरोसा करता है।
संक्षेप में: ConServe AI बातचीत के हर छोटे चरण के भविष्य की भविष्यवाणी करने की कोशिश करना बंद करता है। इसके बजाय, यह पूरी बातचीत को एक कार्य के रूप में मानता है, भारी शुरुआत को एक शक्तिशाली इंजन के साथ संभालता है, और फिर एक स्थिर, कुशल इंजन को बाकी काम पूरा करने देता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।