← नवीनतम पेपर
🤖 AI

Efficient LLM Serving for Agentic Workflows: A Data Systems Perspective

यह शोध पत्र Helium को प्रस्तुत करता है, जो एक वर्कफ़्लो-जागरूक सर्विंग फ्रेमवर्क है जो एजेंटिक LLM वर्कलोड को क्वेरी प्लान के रूप में मॉडल करने के लिए प्रोएक्टिव कैशिंग और कैश-अवेयर शेड्यूलिंग जैसे डेटा सिस्टम सिद्धांतों को लागू करता है, जिससे रेडंडेंसी (अनावश्यकता) समाप्त होती है और मौजूदा सिस्टमों की तुलना में 1.56x तक की गति वृद्धि प्राप्त होती है।

मूल लेखक: Noppanat Wadlom, Junyi Shen, Yao Lu

प्रकाशित 2026-03-18
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Noppanat Wadlom, Junyi Shen, Yao Lu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप अत्यधिक बुद्धिमान लेकिन बहुत धीमे रोबोट्स (ये आपके AI Agents हैं) की एक टीम के मैनेजर हैं। आपका लक्ष्य एक जटिल समस्या को हल करना है, जैसे कि एक वैश्विक छुट्टी की योजना बनाना या शेयर बाजार की गिरावट का विश्लेषण करना।

इसे करने के लिए, आप केवल एक रोबोट को सब कुछ करने के लिए नहीं कहते। आप काम को टुकड़ों में तोड़ देते हैं:

  1. रोबोट A उड़ानों की कीमतों पर शोध करता है।
  2. रोबोट B होटल की उपलब्धता की जांच करता है।
  3. रोबोट C मौसम के पूर्वानुमान को पढ़ता है।
  4. रोबोट D अंतिम यात्रा कार्यक्रम (itinerary) लिखता है।

कभी-कभी, आप दो रोबोटों को एक ही समय में अलग-अलग रास्तों पर भेजते हैं ताकि यह देखा जा सके कि कौन सा विचार बेहतर है (इसे speculative exploration कहा जाता है)।

समस्या: वर्तमान प्रणालियों की "भूलने की बीमारी" (Amnesia)

अभी, इन रोबोटों को चलाने वाली प्रणालियाँ (जैसे vLLM या LangGraph) एक ऐसे मैनेजर की तरह हैं जिसकी अल्पकालिक स्मृति (short-term memory) कम है।

  • परिदृश्य: रोबोट A और रोबोट B दोनों को अपना काम शुरू करने के लिए एक ही 50-पेज की ट्रैवल गाइड पढ़नी है।
  • पुराना तरीका: सिस्टम रोबोट A को मजबूर करता है कि वह पूरे 50 पेज पहले पन्ने से पढ़े। फिर, जब रोबोट B शुरू होता है, तो सिस्टम उसे वही 50 पेज फिर से पढ़ने के लिए कहता है, भले ही वह बिल्कुल वही किताब हो।
  • परिणाम: रोबोट अपना 80% समय बस वही उबाऊ परिचय दोबारा पढ़ने में बिता देते हैं, जिससे उनके पास वास्तविक सोचने के लिए बहुत कम समय बचता है। यह एक छात्र की तरह है जो हर होमवर्क असाइनमेंट से पहले अपनी पाठ्यपुस्तक का पहला अध्याय बार-बार पढ़ता है।

ऐसा इसलिए होता है क्योंकि वर्तमान प्रणालियाँ हर रोबोट के अनुरोध को एक नई, अलग घटना मानती हैं। वे यह नहीं समझ पातीं कि, "हे, आप दोनों एक ही किताब पढ़ रहे हैं! चलिए एक-दूसरे के नोट्स साझा करते हैं।"

समाधान: हीलियम (Helium - "सुपर-ऑर्गनाइज़र")

यह पेपर Helium नामक एक नए सिस्टम का परिचय देता है, जो एक बुद्धिमान और सक्रिय प्रोजेक्ट मैनेजर की तरह कार्य करता है। केवल कार्य सौंपने के बजाय, हीलियम काम शुरू होने से पहले पूरे वर्कफ़्लो को देखता है।

हीलियम कैसे काम करता है, इसके सरल उदाहरण यहाँ दिए गए हैं:

1. "ब्लूप्रिंट" (क्वेरी ऑप्टिमाइज़ेशन)

रोबोट्स के शुरू होने से पहले, हीलियम पूरे काम का एक ब्लूप्रिंट बनाता है। वह देखता है कि रोबोट A और रोबोट B दोनों को एक ही "प्रस्तावना (Introduction to Travel)" टेक्स्ट की आवश्यकता है।

  • पुराना तरीका: "रोबोट A, पेज 1-50 पढ़ें। रोबोट B, पेज 1-50 पढ़ें।"
  • हीलियम का तरीका: "रोबोट A, पेज 1-50 पढ़ें। रोबोट B, तुम्हें उन्हें फिर से पढ़ने की आवश्यकता नहीं है। बस वे नोट्स ले लो जो रोबोट A ने पहले ही लिख लिए हैं।"
    हीलियम रोबोटों के जागने से पहले ही सारा दोहराव वाला काम खत्म कर देता है।

2. "साझा नोटबुक" (प्रोएक्टिव कैशिंग)

AI में, "नोट्स" को KV Caches (तकनीकी रूप से "अभी जो पढ़ा गया उसकी स्मृति") कहा जाता है।

  • पुराना तरीका: सिस्टम तब तक इंतजार करता है जब तक कोई रोबोट नोट मांग नहीं लेता, तब तक वह यह नहीं देखता कि क्या वह मौजूद है। यदि नोट को जगह बनाने के लिए हटा दिया गया है, तो रोबोट को पूरी किताब फिर से पढ़नी पड़ती है।
  • हीलियम का तरीका: हीलियम पहले से ही वर्कफ़्लो को जानता है। वह कहता है, "मुझे पता है कि रोबोट A और B को 'ट्रैवल गाइड' के परिचय की आवश्यकता होगी। आइए उन नोट्स को एक विशेष, स्थायी नोटबुक में लिखने के लिए तैयार रखें इससे पहले कि वे शुरू करें।" यह Proactive Caching है। यह मेमोरी को पहले से लोड कर देता है ताकि रोबोटों को बुनियादी बातें दोबारा न पढ़नी पड़ें।

3. "ट्रैफिक कंट्रोलर" (कैश-अवेयर शेड्यूलिंग)

एक व्यस्त रसोई की कल्पना करें जिसमें कई शेफ (GPUs) हैं।

  • पुराना तरीका: मुख्य शेफ बस चिल्लाता है, "जो भी खाली है, अगला ऑर्डर ले लो!" इसका मतलब यह हो सकता है कि शेफ 1 एक सूप शुरू करता है, फिर शेफ 2 एक सलाद शुरू करता है, फिर शेफ 1 को वापस सूप पर जाना पड़ता है। वे बार-बार काम बदलते रहते हैं, जिससे समय बर्बाद होता है।
  • हीलियम का तरीका: हीलियम मेनू को देखता है और कहता है, "शेफ 1, आपके पास तीन ऑर्डर हैं जिनमें एक ही सूप बेस की आवश्यकता है। तीनों सूप एक के बाद एक करें ताकि आपको बीच में बर्तन साफ करने के लिए न रुकना पड़े।" फिर, जब शेफ 1 सूप के साथ व्यस्त होता है, तो हीलियम सलाद के ऑर्डर्स को शेफ 2 को भेज देता है।
    हीलियम उन कार्यों को एक साथ समूहबद्ध करता है जो समान "सामग्री" (प्रॉम्प्ट्स) साझा करते हैं, ताकि रोबोट बिना रुके एक सुचारू और निरंतर प्रवाह में काम कर सकें।

परिणाम: यह क्यों मायने रखता है

पेपर ने वित्तीय विश्लेषण और मल्टी-एजेंट बहसों जैसे जटिल कार्यों पर हीलियम का परीक्षण किया।

  • गति: हीलियम मौजूदा सर्वोत्तम प्रणालियों की तुलना में 1.56 गुना तेज़ था। कुछ सरल मामलों में, यह मौजूदा सेटअप की तुलना में (100 गुना तक) बहुत अधिक तेज़ था।
  • दक्षता (Efficiency): इसने एक ही गणित को दो बार न करके कंप्यूटिंग पावर की भारी बचत की।
  • स्केलेबिलिटी: जैसे-जैसे रोबोट्स की टीम बड़ी होती गई और कार्य अधिक जटिल होते गए, हीलियम व्यवस्थित करने में बेहतर होता गया, जबकि अन्य प्रणालियाँ धीमी और भ्रमित होती गईं।

बड़ी तस्वीर (The Big Picture)

मौजूदा AI जगत को उन जीनियसों के समूह के रूप में सोचें जो समस्याओं को हल करने में तो माहिर हैं लेकिन अपने डेस्क को व्यवस्थित करने में बहुत खराब हैं। वे बार-बार एक ही ईमेल को पढ़ रहे हैं और एक ही नंबरों की दोबारा गणना कर रहे हैं।

Helium वह नया ऑफिस मैनेजर है जो:

  1. पहले से योजना बनाता है (Query Optimization)।
  2. फाइलें तैयार करता है (Proactive Caching)।
  3. वर्कफ़्लो को व्यवस्थित करता है ताकि सभी सामंजस्य के साथ काम कर सकें (Cache-Aware Scheduling)।

AI एजेंटों को एक डेटा पाइपलाइन (जिस तरह से एक डेटाबेस लाखों रिकॉर्ड्स को संभालता है) की तरह मानकर, हीलियम एक अराजक, दोहराव वाले ढेर को एक सुव्यवस्थित, हाई-स्पीड फैक्ट्री में बदल देता है। इसका मतलब है कि हम बिना करोड़ों नए सुपरकंप्यूटर खरीदे बड़े, स्मार्ट और अधिक जटिल AI टीमों को चला सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →