← नवीनतम पेपर
💻 computer science

Scalable Inference Architectures for Compound AI Systems: A Production Deployment Study

यह शोध पत्र सेल्सफोर्स में एक मॉड्यूलर, प्लेटफॉर्म-अज्ञेय (प्लेटफॉर्म-एग्नोस्टिक) इन्फरेंस आर्किटेक्चर के प्रोडक्शन डिप्लॉयमेंट अध्ययन को प्रस्तुत करता है जो एजेंटफोर्स (Agentforce) और एपेक्सगुरु (ApexGuru) जैसे कंपाउंड एआई सिस्टम की स्केलेबल, लागत प्रभावी और कम-विलंबता वाली सर्विसिंग को सक्षम बनाता है, जिससे मल्टी-मॉडल फैन-आउट और कैस्केडिंग कोल्ड स्टार्ट जैसी अनूठी चुनौतियों का समाधान करते हुए थ्रूपुट, टेल लेटेंसी और परिचालन लागत में महत्वपूर्ण सुधार प्राप्त हुआ है।

मूल लेखक: Srikanta Prasad S V, Utkarsh Arora

प्रकाशित 2026-04-29
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Srikanta Prasad S V, Utkarsh Arora

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप Agentforce नामक एक व्यस्त, उच्च-स्तरीय रेस्टोरेंट चलाते हैं। अतीत में, इस रेस्टोरेंट में एक विशाल रसोई (एक "स्थिर" सेटअप) थी जहाँ एक मुख्य शेफ सब कुछ करने की कोशिश करता था: सब्जियां काटना, स्टेक ग्रिल करना, डेसर्ट बनाना और बर्तन धोना। यदि रेस्टोरेंट व्यस्त हो जाता, तो रसोई जाम हो जाती। यदि शेफ को आराम करने के लिए ब्रेक लेने की आवश्यकता होती (एक "कोल्ड स्टार्ट"), तो पूरा रेस्टोरेंट खाना परोसना बंद कर देता। और सबसे बुरी बात यह थी कि आपको शेफ का वेतन 24/7 देना पड़ता था, भले ही उस समय कोई खा नहीं रहा हो।

यह पेपर बताता है कि कैसे सेल्सफोर्स ने कंपाउंड AI सिस्टम (Compound AI Systems) को संभालने के लिए अपने "रेस्टोरेंट" को फिर से बनाया। एक बड़ी रसोई के बजाय, उन्होंने एक मॉड्यूलर, ऑन-डिमांड फूड डिलीवरी नेटवर्क बनाया।

यहाँ बताया गया है कि उन्होंने यह कैसे किया, सरल शब्दों में:

1. समस्या: "एक ही आकार के लिए सभी उपयुक्त" (One-Size-Fits-All) रसोई

आधुनिक AI एप्लिकेशन (जैसे Agentforce या ApexGuru) जटिल होते हैं। जब कोई ग्राहक प्रश्न पूछता है, तो सिस्टम केवल एक रोबोट से उत्तर नहीं मांगता। यह विशेषज्ञों की एक टीम की तरह है जो मिलकर काम करती है:

  • विशेषज्ञ A (एम्बेडिंग मॉडल) ग्राहक के इतिहास को देखता है।
  • विशेषज्ञ B (LLM) उत्तर लिखता है।
  • विशेषज्ञ C (SQL एक्सेक्यूटर) डेटाबेस की जांच करता है।
  • विशेषज्ञ D (क्लासिफायर) तय करता है कि ग्राहक वास्तव में क्या चाहता है।

पुराने "स्थिर" सेटअप में, ये सभी विशेषज्ञ एक ही हार्डवेयर पर एक ही कमरे में फंसे हुए थे।

  • बाधा (The Bottleneck): यदि डेटाबेस विशेषज्ञ धीमा था, तो पूरा ऑर्डर विलंबित हो जाता था।
  • बर्बादी (The Waste): आपको इन सभी विशेषज्ञों को 24/7 जागृत और तैयार रखना पड़ता था, भले ही रात के 3 बजे केवल "सब्जी काटने" वाले विशेषज्ञ की आवश्यकता हो।
  • "कोल्ड स्टार्ट" का दुःस्वप्न: यदि रेस्टोरेंट एक घंटे के लिए बंद होता और फिर से खुलता, तो प्रत्येक विशेषज्ञ को जागना पड़ता, अंगड़ाई लेनी पड़ती और अपने औजार तैयार करने पड़ते। ग्राहक को खाना मिलने से पहले सबसे धीमे विशेषज्ञ के जागने का इंतजार करना पड़ता था।

2. समाधान: एक "स्मार्ट डिलीवरी नेटवर्क"

सेल्सफोर्स ने एक नया आर्किटेक्चर बनाया है जो एक स्मार्ट, डायनेमिक डिलीवरी सर्विस की तरह काम करता है।

  • ऑर्डर लेने वाला (प्रेडिक्शन सर्विस): जब कोई ग्राहक ऑर्डर देता है, तो एक स्मार्ट डिस्पैचर ऑर्डर को एक बड़ी रसोई में भेजने के बजाय, उसे हिस्सों में तोड़ देता है और उन्हें उन विशिष्ट विशेषज्ञों के पास भेजता है जो उस काम के लिए सबसे उपयुक्त हैं।
  • स्वतंत्र स्केलिंग (Independent Scaling): यदि 100 लोग "स्टेक" (LLM कॉल्स) ऑर्डर करते हैं, तो सिस्टम तुरंत 100 स्टेक शेफ को काम पर रख लेता है। यदि केवल 5 लोग "सलाद" (एम्बेडिंग कॉल्स) ऑर्डर करते हैं, तो वह केवल 5 सलाद शेफ को ही काम पर रखता है। वे एक ही रसोई में जगह के लिए आपस में नहीं लड़ते।
  • सर्वरलेस (पे-एज़-यू-गो): विशेषज्ञ किसी इमारत में बैठकर ऑर्डर का इंतजार नहीं करते। वे "क्लाउड वर्कर्स" हैं जो केवल तभी आते हैं जब कोई ऑर्डर आता है और काम पूरा होने पर चले जाते हैं। आप केवल उन मिनटों के लिए भुगतान करते हैं जब वे वास्तव में काम करते हैं।

3. "जागने की समस्या" को हल करना (कैस्केडिंग कोल्ड स्टार्ट्स)

पेपर ने एक पेचीदा समस्या की खोज की: एक कंपाउंड सिस्टम में, विशेषज्ञ एक-दूसरे पर निर्भर होते हैं। विशेषज्ञ A को समाप्त करना होगा ताकि विशेषज्ञ B शुरू कर सके।

  • पुराना तरीका: यदि रेस्टोरेंट फिर से खुलता है, तो विशेषज्ञ A जागता है (30 सेकंड), फिर विशेषज्ञ B जागता है (150 सेकंड), फिर विशेषज्ञ C जागता है (20 सेकंड)। ग्राहक कुल 180 सेकंड इंतजार करता है।
  • नया "प्री-वार्मिंग" ट्रिक: सिस्टम इतना स्मार्ट है कि वह रेसिपी जानता है। जैसे ही विशेषज्ञ A को बुलाया जाता है, सिस्टम बैकग्राउंड में विशेषज्ञ B और C को एक साथ जगा देता है।
  • परिणाम: 180 सेकंड इंतजार करने के बजाय, ग्राहक केवल लगभग 65 सेकंड इंतजार करता है। पेपर कहता है कि इसने "जागने" के समय को 65% कम कर दिया।

4. परिणाम: तेज़, सस्ता और सुचारू

वास्तविक ग्राहकों के साथ एक साल से अधिक समय तक इस नए सिस्टम को चलाने के बाद, यहाँ क्या हुआ:

  • गति (Speed): "टेल लेटेंसी" (धीमे ग्राहकों के लिए सबसे खराब स्थिति का प्रतीक्षा समय) 50% गिर गया। जो ऑर्डर पहले 37 सेकंड लेते थे, अब वे लगभग 10-11 सेकंड लेते हैं।
  • क्षमता (Capacity): सिस्टम पुरानी रसोई की तुलना में एक ही समय में 3.9 गुना अधिक ऑर्डर संभाल सकता है।
  • लागत (Cost): क्योंकि उन्होंने खाली बैठे श्रमिकों के लिए भुगतान करना बंद कर दिया, इसलिए उन्होंने लागत में 30-40% की बचत की।
  • विश्वसनीयता (Reliability): यदि एक विशेषज्ञ बीमार हो जाता है (विफल होता है), तो सिस्टम पूरे रेस्टोरेंट को बंद नहीं करता है। यह बस ऑर्डर को उस व्यक्ति के चारों ओर मोड़ देता है (उदाहरण के लिए, "हम डेटाबेस की जांच नहीं कर सकते, इसलिए चलिए एक सामान्य उत्तर दे देते हैं")। जब हिस्से टूट जाते हैं, तब भी रेस्टोरेंट 95% समय खुला रहता है।

5. मुख्य सबक (शेफ के रहस्य)

लेखकों ने इन सिस्टमों को बनाने वालों के लिए कुछ बड़े निष्कर्ष साझा किए:

  1. कोल्ड स्टार्ट्स जुड़ते नहीं, बल्कि गुणा होते हैं। यदि आपके पास कार्यों की एक श्रृंखला है, तो प्रतीक्षा समय बढ़ता जाता है। आपको पूरी श्रृंखला को एक साथ जगाना होगा, एक-एक करके नहीं।
  2. केवल व्यक्तिगत श्रमिकों को नहीं, बल्कि पूरे पाइपलाइन को देखें। एक कार्यकर्ता अपने आप में तेज़ हो सकता है, लेकिन यदि वह किसी और के इंतजार में फंसा हुआ है, तो पूरा ऑर्डर धीमा होगा। आपको ऑर्डर के "बड़े चित्र" को देखने की आवश्यकता है।
  3. हिस्सों का व्यक्तिगत रूप से परीक्षण करें। क्योंकि आपका सिस्टम मॉड्यूलर है, आप "स्टेक शेफ" को हटाए बिना केवल "सलाद शेफ" को एक नए शेफ से बदल सकते हैं। यह उन्हें हफ्तों के बजाय दिनों में अपने AI मॉडल को बेहतर बनाने की अनुमति देता है।
  4. पूर्णता से बेहतर 'ग्रेसफुल डिग्रेडेशन' (क्रमिक गिरावट) है। यदि सिस्टम का एक छोटा हिस्सा विफल हो जाता है, तो पूरी चीज़ क्रैश नहीं होनी चाहिए। कोई भी उत्तर न देने के बजाय थोड़ा कम विस्तृत उत्तर देना बेहतर है।

सारांश

यह पेपर एक कठोर, महंगी, "एक-रसोई" वाली AI व्यवस्था से एक लचीले, "गिग-इकोनॉमी" शैली के नेटवर्क की ओर बढ़ने के बारे में है। प्रत्येक AI टूल को एक अलग, ऑन-डिमांड कार्यकर्ता के रूप में मानकर, जो तुरंत स्केल किया जा सकता है, सेल्सफोर्स ने अपने AI एजेंटों को हजारों एंटरप्राइज उपयोगकर्ताओं के लिए तेज़, सस्ता और बहुत अधिक विश्वसनीय बना दिया है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →