← नवीनतम पेपर
🤖 AI

Towards Understanding, Analyzing, and Optimizing Agentic AI Execution: A CPU-Centric Perspective

यह शोध पत्र निष्पादन पैटर्न (execution patterns) को अभिलक्षित करके और दो शेड्यूलिंग अनुकूलन, COMB और MAS का प्रस्ताव देकर, एजेंटिक एआई सर्विंग (Agentic AI serving) में उपेक्षित सीपीयू-केंद्रित बाधाओं को संबोधित करता है, जो विषम सीपीयू-जीपीयू प्रणालियों (heterogeneous CPU-GPU systems) पर विलंबता (latency) को काफी कम करते हैं और संसाधन उपयोगिता में सुधार करते हैं।

मूल लेखक: Ritik Raj, Souvik Kundu, Ishita Vohra, Hong Wang, Tushar Krishna

प्रकाशित 2026-04-20
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ritik Raj, Souvik Kundu, Ishita Vohra, Hong Wang, Tushar Krishna

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक शानदार, सुपर-फास्ट शेफ (AI) है जो सेकंडों में जटिल व्यंजन (उत्तर जनरेट करना) बना सकता है। लेकिन यहाँ एक पेंच है—शेफ के पास हाथ नहीं हैं। काम को वास्तव में पूरा करने के लिए, उन्हें सहायकों की एक टीम (CPU) को बुलाना पड़ता है जो मौसम की जाँच करने, इंटरनेट खोजने, कोड लिखने या फाइलों को व्यवस्थित करने जैसे काम करती है।

लंबे समय से, कंप्यूटर वैज्ञानिक शेफ को तेज़ बनाने के लिए जुनूनी रहे हैं। उन्होंने बड़े किचन (GPUs) और तेज़ चाकू बनाए हैं। लेकिन यह नया पेपर तर्क देता है कि हम सहायकों (assistants) को अनदेखा कर रहे हैं। "एजेंटिक एआई" (Agentic AI - वह AI जो अपने आप कार्य करता है) की दुनिया में, असल में सहायक ही ट्रैफिक जाम का कारण बन रहे हैं।

यहाँ इस पेपर द्वारा की गई खोजों और उनके समाधान का एक सरल विवरण दिया गया है।

1. समस्या: "सुपर-शेफ" "धीमे सहायक" का इंतज़ार कर रहा है

शोधकर्ताओं ने देखा कि ये AI एजेंट कैसे काम करते हैं। उन्होंने महसूस किया कि जबकि AI (GPU) सोचने में अविश्वसनीय रूप से तेज़ है, वह कंप्यूटर के मुख्य प्रोसेसर (CPU) का इंतज़ार करने में बहुत सारा समय बिताता है ताकि वह "उबाऊ" लेकिन आवश्यक काम कर सके, जैसे:

  • वेब खोजना।
  • बग को ठीक करने के लिए कोड चलाना।
  • दस्तावेजों के एक विशाल डेटाबेस को पढ़ना।

उपमा: कल्पना कीजिए कि एक फॉर्मूला 1 रेस कार (GPU) शुरुआती रेखा पर खड़ी है। वह 200 मील प्रति घंटे की रफ्तार से चलने के लिए तैयार है। लेकिन ड्राइवर (CPU) कार को गैरेज से बाहर निकालने के लिए ट्रैफिक में फंसा हुआ है। कार कितनी भी तेज़ क्यों न हो, पूरी रेस ट्रैफिक की वजह से देरी से शुरू होती है।

पेपर में पाया गया कि कई AI कार्यों में, CPU कुल समय का 88% तक हिस्सा लेने के लिए जिम्मेदार होता है। यदि आपके पास एक सुपर-फास्ट GPU है लेकिन एक धीमा CPU है, तो आपका महंगा GPU बस CPU के बराबर आने का इंतज़ार करते हुए खाली बैठा रहता है।

2. निदान: दो प्रकार के ट्रैफिक जाम

शोधकर्ताओं ने विभिन्न AI कार्यों का परीक्षण किया और पाया कि सिस्टम दो मुख्य तरीकों से बाधित होता है:

  • "एक ही आकार सबके लिए" वाला जाम (One-Size-Fits-All Jam): जब आप एक साथ बहुत अधिक अनुरोध (requests) प्रोसेस करने की कोशिश करते हैं, तो CPU अत्यधिक बोझ महसूस करता है। यह एक कॉफी शॉप में केवल एक बैरिस्टा (barista) के साथ 100 ग्राहकों को सेवा देने की कोशिश करने जैसा है। बैरिस्टा (CPU) तनाव में आ जाता है, लाइन लंबी हो जाती है, और महंगी एस्प्रेसो मशीन (GPU) खाली बैठी रहती है क्योंकि बैरिस्टा ऑर्डर्स के साथ तालमेल नहीं बिठा पाता।
  • "मिश्रित भीड़" वाला जाम (Mixed Crowd Jam): कल्पना कीजिए कि एक कॉफी शॉप जहाँ कुछ ग्राहक केवल एक साधारण ब्लैक कॉफी चाहते हैं (सरल AI कार्य), जबकि अन्य एक जटिल, कस्टम लैटे चाहते हैं जिसके लिए बैरिस्टा को बीन्स पीसने और दूध गर्म करने में 10 मिनट लग सकते हैं (टूल्स के साथ जटिल AI कार्य)। यदि दुकान जटिल ऑर्डर्स को अंदर आने देती है, तो साधारण कॉफी पीने वाले लोग अनंत काल तक इंतज़ार करेंगे। यदि दुकान साधारण ऑर्डर्स को प्राथमिकता देती है, तो जटिल ऑर्डर्स अटक जाते हैं। सिस्टम अनुचित और अक्षम हो जाता है।

3. समाधान: रसोई के लिए दो नए नियम

इन जाम को ठीक करने के लिए, लेखकों ने दो नए "शेड्यूलिंग" रणनीतियों (काम को व्यवस्थित करने के नियम) का प्रस्ताव दिया।

रणनीति A: COMB (द "माइक्रो-ऑर्डर" सिस्टम)

जब हर कोई एक ही तरह का जटिल ड्रिंक ऑर्डर कर रहा हो।

एक साथ 128 जटिल लैटे बनाने की कोशिश करने के बजाय (जिससे घबराहट और ट्रैफिक जाम होता है), COMB सुझाव देता है कि बड़े ऑर्डर को छोटे "माइक्रो-बैच" में विभाजित किया जाए, जैसे कि 64 का बैच।

  • जादू: जब बैरिस्टा पहले 64 लैटे बना रहा होता है, तब एस्प्रेसो मशीन अगले बैच के लिए गर्म होना शुरू हो जाती है। वे एक रिले रेस की शैली में काम करते हैं।
  • परिणाम: CPU बोझिल नहीं होता, और GPU खाली नहीं बैठता। पेपर ने दिखाया कि यह औसत उपयोगकर्ता के लिए सिस्टम को 1.7 से 3.9 गुना तेज़ बना सकता है।

रणनीति B: MAS (द "VIP और रेगुलर" लेन)

जब आपके पास सरल और जटिल ऑर्डर्स का मिश्रण हो।

यह सिस्टम कॉफी शॉप में दो अलग-अलग लाइनें (क्यू) बनाता है:

  1. "क्विक कॉफी" लेन: उन सरल AI कार्यों के लिए जिन्हें केवल GPU की आवश्यकता है।
  2. "कॉम्प्लेक्स लैटे" लेन: उन कार्यों के लिए जिन्हें भारी काम करने के लिए CPU की आवश्यकता है।

सिस्टम यह गारंटी देता है कि "क्विक कॉफी" लेन कभी भी "कॉम्प्लेक्स लैटे" लेन द्वारा बाधित नहीं होगी, और न ही इसके विपरीत। भले ही दुकान जटिल ऑर्डर्स से भरी हो, सरल ऑर्डर्स फिर भी जल्दी सेवा प्राप्त करेंगे।

  • परिणाम: यह सुनिश्चित करता है कि "अल्पसंख्यक" प्रकार के अनुरोधों को नज़रअंदाज़ न किया जाए। इसने कुछ परीक्षणों में सबसे धीमी अनुरोधों को 2.4 गुना तेज़ बनाया, जिससे निष्पक्षता सुनिश्चित हुई।

4. यह क्यों महत्वपूर्ण है?

  • पैसा: GPUs (सुपर-शेफ) बहुत महंगे होते हैं। यदि वे CPU का इंतज़ार करते हुए खाली बैठे रहते हैं, तो आप पैसा बर्बाद कर रहे हैं। ये नई विधियाँ सुनिश्चित करती हैं कि आपको अपने पैसे का पूरा मूल्य मिले।
  • गति: उपयोगकर्ता को अपना कार्य पूरा होने के लिए लंबा इंतज़ार नहीं करना पड़ेगा।
  • ऊर्जा: पेपर में यह भी पाया गया कि CPU आश्चर्यजनक रूप से बहुत अधिक बिजली (कभी-कभी GPU से भी अधिक!) का उपयोग करता है। CPU को अनुकूलित करके, हम डेटा सेंटरों में ऊर्जा बचा सकते हैं।

मुख्य निष्कर्ष

हम पहले सोचते थे कि AI में बाधा (bottleneck) "मस्तिष्क" (मॉडल) में है। यह पेपर सिद्ध करता है कि जो AI कार्य करता है (Agentic AI), उसके लिए बाधा वास्तव में "हाथ" (टूल्स और CPU) हैं।

CPU को GPU के समान सम्मान देकर और वर्कफ़्लो को बेहतर ढंग से व्यवस्थित करके, हम AI सिस्टम को तेज़, सस्ता और सभी के लिए निष्पक्ष बना सकते हैं। यह केवल एक तेज़ कार बनाने के बारे में नहीं है; यह ट्रैफिक को साफ करने के बारे में है ताकि कार वास्तव में चल सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →