← नवीनतम पेपर
💬 NLP

AGENTSERVESIM: A Hardware-aware Simulator for Multi-Turn LLM Agent Serving

यह शोध पत्र AGENTSERVESIM को प्रस्तुत करता है, जो एक हार्डवेयर-जागरूक सिम्युलेटर है जो मल्टी-टर्न LLM एजेंट सर्विंग डायनेमिक्स—जिसमें प्रोग्राम ऑर्केस्ट्रेशन, टूल-प्रेरित अंतराल (tool-induced gaps), और KV-कैश रेजिडेंसी शामिल है—को सटीक रूप से मॉडल करता है ताकि व्यापक वास्तविक-सिस्टम डिप्लॉयमेंट की आवश्यकता के बिना कमोडिटी CPUs पर सर्विंग नीतियों के स्केलेबल और लागत प्रभावी मूल्यांकन को सक्षम किया जा सके।

मूल लेखक: Rakibul Hasan Rajib, Mengxin Zheng, Qian Lou

प्रकाशित 2026-06-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Rakibul Hasan Rajib, Mengxin Zheng, Qian Lou

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक व्यस्त रेस्टोरेंट चला रहे हैं।

पुराना तरीका (Standard LLM Serving):
अतीत में, AI मॉडल्स को सर्व करना एक फास्ट-फूड ड्राइव-थ्रू की तरह था। हर कार (अनुरोध) आती है, एक बर्गर (एक एकल प्रश्न) का ऑर्डर देती है, उसे प्राप्त करती है, और चली जाती है। किचन को इस बात से कोई फर्क नहीं पड़ता कि कार ने पहले क्या किया था या वह आगे क्या करेगी। प्रत्येक ऑर्डर स्वतंत्र है। यदि कार बाद में वापस आती है, तो उसे एक बिल्कुल नए ग्राहक के रूप में माना जाता है।

नया तरीका (Multi-Turn Agent Serving):
अब, कल्पना कीजिए कि रेस्टोरेंट एक जटिल कुकिंग कॉम्पिटिशन (खाना पकाने की प्रतियोगिता) की मेजबानी कर रहा है। एक ही टीम (एक "एजेंट") लंबे समय तक मेज पर बैठी रहती है। वे एक सामग्री मांगते हैं, फिर शेफ को इंतजार करना पड़ता है जब तक कि टीम मसालों को खोजने के लिए पेंट्री (pantry) में न चली जाए (एक "टूल कॉल"), और फिर टीम वापस आती है और अगले स्टेप के लिए पूछती है। एक ही सत्र में यह दर्जनों बार होता है।

  • समस्या: शेफ (AI) को अब तक की पूरी रेसिपी याद रखनी पड़ती है। यदि टीम पेंट्री जाने के लिए 5 मिनट के लिए मेज छोड़ देती है, तो शेफ को काउंटर पर रखे नोट्स (जिसे "KV कैश" कहते हैं) फेंक नहीं देने चाहिए क्योंकि जब टीम वापस आएगी तो उन्हें उनकी आवश्यकता होगी। यदि टीम वापस आने पर किसी दूसरी मेज (अलग सर्वर) पर चली जाती है, तो नए शेफ को पूरी रेसिपी शुरू से पढ़नी पड़ती है, जिससे समय बर्बाद होता है।
  • चुनौती: इसे प्रबंधित करना कठिन है। आपको निर्णय लेना होता है: क्या हम नोट्स को महंगे, तेज़ काउंटर पर रखें? क्या हम उन्हें पीछे की एक धीमी शेल्फ पर ले जाएं? या यदि टीम बहुत लंबे समय तक चली जाती है, तो क्या हम उन्हें फेंक दें? और टीम के अगले टर्न को कौन सा शेफ संभालेगा?

समाधान: AGENTSERVESIM
लेखकों ने एक आभासी रेस्टोरेंट सिम्युलेटर बनाया है जिसे AGENTSERVESIM कहा जाता है।

वास्तविक, महंगे सुपरकंप्यूटरों पर इन जटिल नियमों का परीक्षण करने के बजाय (जिसमें बहुत पैसा खर्च होता है और बहुत समय लगता है), उन्होंने एक डिजिटल ट्विन बनाया है जो सामान्य, सस्ते कंप्यूटरों पर चलता है।

यह सिम्युलेटर कैसे काम करता है, यहाँ रेस्टोरेंट के उदाहरण का उपयोग किया गया है:

  1. द प्रोग्राम ऑर्केस्ट्रेटर (हेड वेटर):
    पुराने सिम्युलेटरों में, हर ऑर्डर को अलग से माना जाता था। इस सिम्युलेटर में एक हेड वेटर है जो पूरे कुकिंग कॉम्पिटिशन को एक एकल "प्रोग्राम" के रूप में ट्रैक करता है। वेटर जानता है कि टीम A वर्तमान में पेंट्री के इंतज़ार में है और वह अगला ऑर्डर तब तक शुरू नहीं होने देगा जब तक पेंट्री की यात्रा पूरी नहीं हो जाती।

  2. द टूल सिम्युलेटर (पेंट्री टाइमर):
    कभी-कभी टीम को पेंट्री (जैसे grep या pytest जैसे टूल चलाना) जाने की आवश्यकता होती है। इन यात्राओं में मिलीसेकंड या मिनट लग सकते हैं। सिम्युलेटर में एक विशेष टाइमर है जो इन देरी को सटीक रूप से दर्शाता है, ताकि सिस्टम यह परीक्षण कर सके कि क्या इंतज़ार के दौरान नोट्स को काउंटर पर रखना बेहतर है या उन्हें शेल्फ पर ले जाना।

  3. द सेशन-अवेयर राउटर (टेबल असाइनर):
    यदि रेस्टोरेंट में कई शेफ (सर्वर) हैं, तो यह राउटर टीम A को उसी शेफ के पास वापस भेजने की कोशिश करता है जिसके साथ उन्होंने शुरुआत की थी। इससे उनके रेसिपी नोट्स वहीं रहते हैं, जिससे समय बचता है। यदि वह शेफ बहुत व्यस्त है, तो राउटर नोट्स को नए शेफ के पास ले जाने की लागत बनाम फिर से शुरू करने की लागत की गणना करता है।

  4. द KV रेसिडेंसी मॉडल (नोट लेने वाला):
    यह सबसे स्मार्ट हिस्सा है। यह तय करता है कि "रेसिपी नोट्स" (KV कैश) कहाँ स्टोर किए जाएं।

    • HBM (हाई-स्पीड काउंटर): तेज़ लेकिन छोटा।
    • DRAM/CXL (पीछे की शेल्फ): धीमा लेकिन बड़ा।
    • मॉडल पूछता है: "क्या टीम 10 सेकंड में वापस आएगी या 10 मिनट में?" यदि यह 10 सेकंड है, तो नोट्स को काउंटर पर रखें। यदि यह 10 मिनट है, तो नोट्स को शेल्फ पर ले जाएं ताकि काउंटर अन्य टीमों के लिए खाली रहे।

यह क्यों महत्वपूर्ण है?
वास्तविक सुपरकंप्यूटरों पर इन रणनीतियों का परीक्षण करना एक नया रेस्टोरेंट लेआउट टेस्ट करने के लिए वास्तव में रेस्टोरेंट बनाने, स्टाफ रखने और हफ्तों तक चलाने जैसा है। यह महंगा और धीमा है।

  • परिणाम: लेखकों ने अपने सिम्युलेटर का वास्तविक सुपरकंप्यूटरों (वास्तविक AI मॉडल्स और वास्तविक हार्डवेयर का उपयोग करके) के विरुद्ध परीक्षण किया। उन्होंने पाया कि सिम्युलेटर यह भविष्यवाणी करने में कि "कुकिंग कॉम्पिटिशन" कितनी जल्दी समाप्त होगा, 6% से भी कम की त्रुटि (error) के साथ काम करता है।
  • लाभ: अब, इंजीनियर एक नियमित लैपटॉप पर हजारों "क्या-अगर" (what-if) परिदृश्यों को चलाकर यह पता लगा सकते हैं कि जटिल AI एजेंटों को चलाने का सबसे अच्छा तरीका क्या है, बिना हर एक टेस्ट के लिए महंगे सुपरकंप्यूटर किराए पर लिए।

संक्षेप में, उन्होंने AI एजेंटों के लिए एक अत्यधिक सटीक "फ्लाइट सिम्युलेटर" बनाया है जो शोधकर्ताओं को वास्तविक विमान को क्रैश किए बिना (या ईंधन पर बहुत अधिक खर्च किए बिना) जटिल, बहु-चरणीय AI कार्यों को चलाने का अभ्यास करने और अनुकूलित करने की अनुमति देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →