Scalable Inference Architectures for Compound AI Systems: A Production Deployment Study
यह शोध पत्र सेल्सफोर्स में एक मॉड्यूलर, प्लेटफॉर्म-अज्ञेय (प्लेटफॉर्म-एग्नोस्टिक) इन्फरेंस आर्किटेक्चर के प्रोडक्शन डिप्लॉयमेंट अध्ययन को प्रस्तुत करता है जो एजेंटफोर्स (Agentforce) और एपेक्सगुरु (ApexGuru) जैसे कंपाउंड एआई सिस्टम की स्केलेबल, लागत प्रभावी और कम-विलंबता वाली सर्विसिंग को सक्षम बनाता है, जिससे मल्टी-मॉडल फैन-आउट और कैस्केडिंग कोल्ड स्टार्ट जैसी अनूठी चुनौतियों का समाधान करते हुए थ्रूपुट, टेल लेटेंसी और परिचालन लागत में महत्वपूर्ण सुधार प्राप्त हुआ है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप Agentforce नामक एक व्यस्त, उच्च-स्तरीय रेस्टोरेंट चलाते हैं। अतीत में, इस रेस्टोरेंट में एक विशाल रसोई (एक "स्थिर" सेटअप) थी जहाँ एक मुख्य शेफ सब कुछ करने की कोशिश करता था: सब्जियां काटना, स्टेक ग्रिल करना, डेसर्ट बनाना और बर्तन धोना। यदि रेस्टोरेंट व्यस्त हो जाता, तो रसोई जाम हो जाती। यदि शेफ को आराम करने के लिए ब्रेक लेने की आवश्यकता होती (एक "कोल्ड स्टार्ट"), तो पूरा रेस्टोरेंट खाना परोसना बंद कर देता। और सबसे बुरी बात यह थी कि आपको शेफ का वेतन 24/7 देना पड़ता था, भले ही उस समय कोई खा नहीं रहा हो।
यह पेपर बताता है कि कैसे सेल्सफोर्स ने कंपाउंड AI सिस्टम (Compound AI Systems) को संभालने के लिए अपने "रेस्टोरेंट" को फिर से बनाया। एक बड़ी रसोई के बजाय, उन्होंने एक मॉड्यूलर, ऑन-डिमांड फूड डिलीवरी नेटवर्क बनाया।
यहाँ बताया गया है कि उन्होंने यह कैसे किया, सरल शब्दों में:
1. समस्या: "एक ही आकार के लिए सभी उपयुक्त" (One-Size-Fits-All) रसोई
आधुनिक AI एप्लिकेशन (जैसे Agentforce या ApexGuru) जटिल होते हैं। जब कोई ग्राहक प्रश्न पूछता है, तो सिस्टम केवल एक रोबोट से उत्तर नहीं मांगता। यह विशेषज्ञों की एक टीम की तरह है जो मिलकर काम करती है:
- विशेषज्ञ A (एम्बेडिंग मॉडल) ग्राहक के इतिहास को देखता है।
- विशेषज्ञ B (LLM) उत्तर लिखता है।
- विशेषज्ञ C (SQL एक्सेक्यूटर) डेटाबेस की जांच करता है।
- विशेषज्ञ D (क्लासिफायर) तय करता है कि ग्राहक वास्तव में क्या चाहता है।
पुराने "स्थिर" सेटअप में, ये सभी विशेषज्ञ एक ही हार्डवेयर पर एक ही कमरे में फंसे हुए थे।
- बाधा (The Bottleneck): यदि डेटाबेस विशेषज्ञ धीमा था, तो पूरा ऑर्डर विलंबित हो जाता था।
- बर्बादी (The Waste): आपको इन सभी विशेषज्ञों को 24/7 जागृत और तैयार रखना पड़ता था, भले ही रात के 3 बजे केवल "सब्जी काटने" वाले विशेषज्ञ की आवश्यकता हो।
- "कोल्ड स्टार्ट" का दुःस्वप्न: यदि रेस्टोरेंट एक घंटे के लिए बंद होता और फिर से खुलता, तो प्रत्येक विशेषज्ञ को जागना पड़ता, अंगड़ाई लेनी पड़ती और अपने औजार तैयार करने पड़ते। ग्राहक को खाना मिलने से पहले सबसे धीमे विशेषज्ञ के जागने का इंतजार करना पड़ता था।
2. समाधान: एक "स्मार्ट डिलीवरी नेटवर्क"
सेल्सफोर्स ने एक नया आर्किटेक्चर बनाया है जो एक स्मार्ट, डायनेमिक डिलीवरी सर्विस की तरह काम करता है।
- ऑर्डर लेने वाला (प्रेडिक्शन सर्विस): जब कोई ग्राहक ऑर्डर देता है, तो एक स्मार्ट डिस्पैचर ऑर्डर को एक बड़ी रसोई में भेजने के बजाय, उसे हिस्सों में तोड़ देता है और उन्हें उन विशिष्ट विशेषज्ञों के पास भेजता है जो उस काम के लिए सबसे उपयुक्त हैं।
- स्वतंत्र स्केलिंग (Independent Scaling): यदि 100 लोग "स्टेक" (LLM कॉल्स) ऑर्डर करते हैं, तो सिस्टम तुरंत 100 स्टेक शेफ को काम पर रख लेता है। यदि केवल 5 लोग "सलाद" (एम्बेडिंग कॉल्स) ऑर्डर करते हैं, तो वह केवल 5 सलाद शेफ को ही काम पर रखता है। वे एक ही रसोई में जगह के लिए आपस में नहीं लड़ते।
- सर्वरलेस (पे-एज़-यू-गो): विशेषज्ञ किसी इमारत में बैठकर ऑर्डर का इंतजार नहीं करते। वे "क्लाउड वर्कर्स" हैं जो केवल तभी आते हैं जब कोई ऑर्डर आता है और काम पूरा होने पर चले जाते हैं। आप केवल उन मिनटों के लिए भुगतान करते हैं जब वे वास्तव में काम करते हैं।
3. "जागने की समस्या" को हल करना (कैस्केडिंग कोल्ड स्टार्ट्स)
पेपर ने एक पेचीदा समस्या की खोज की: एक कंपाउंड सिस्टम में, विशेषज्ञ एक-दूसरे पर निर्भर होते हैं। विशेषज्ञ A को समाप्त करना होगा ताकि विशेषज्ञ B शुरू कर सके।
- पुराना तरीका: यदि रेस्टोरेंट फिर से खुलता है, तो विशेषज्ञ A जागता है (30 सेकंड), फिर विशेषज्ञ B जागता है (150 सेकंड), फिर विशेषज्ञ C जागता है (20 सेकंड)। ग्राहक कुल 180 सेकंड इंतजार करता है।
- नया "प्री-वार्मिंग" ट्रिक: सिस्टम इतना स्मार्ट है कि वह रेसिपी जानता है। जैसे ही विशेषज्ञ A को बुलाया जाता है, सिस्टम बैकग्राउंड में विशेषज्ञ B और C को एक साथ जगा देता है।
- परिणाम: 180 सेकंड इंतजार करने के बजाय, ग्राहक केवल लगभग 65 सेकंड इंतजार करता है। पेपर कहता है कि इसने "जागने" के समय को 65% कम कर दिया।
4. परिणाम: तेज़, सस्ता और सुचारू
वास्तविक ग्राहकों के साथ एक साल से अधिक समय तक इस नए सिस्टम को चलाने के बाद, यहाँ क्या हुआ:
- गति (Speed): "टेल लेटेंसी" (धीमे ग्राहकों के लिए सबसे खराब स्थिति का प्रतीक्षा समय) 50% गिर गया। जो ऑर्डर पहले 37 सेकंड लेते थे, अब वे लगभग 10-11 सेकंड लेते हैं।
- क्षमता (Capacity): सिस्टम पुरानी रसोई की तुलना में एक ही समय में 3.9 गुना अधिक ऑर्डर संभाल सकता है।
- लागत (Cost): क्योंकि उन्होंने खाली बैठे श्रमिकों के लिए भुगतान करना बंद कर दिया, इसलिए उन्होंने लागत में 30-40% की बचत की।
- विश्वसनीयता (Reliability): यदि एक विशेषज्ञ बीमार हो जाता है (विफल होता है), तो सिस्टम पूरे रेस्टोरेंट को बंद नहीं करता है। यह बस ऑर्डर को उस व्यक्ति के चारों ओर मोड़ देता है (उदाहरण के लिए, "हम डेटाबेस की जांच नहीं कर सकते, इसलिए चलिए एक सामान्य उत्तर दे देते हैं")। जब हिस्से टूट जाते हैं, तब भी रेस्टोरेंट 95% समय खुला रहता है।
5. मुख्य सबक (शेफ के रहस्य)
लेखकों ने इन सिस्टमों को बनाने वालों के लिए कुछ बड़े निष्कर्ष साझा किए:
- कोल्ड स्टार्ट्स जुड़ते नहीं, बल्कि गुणा होते हैं। यदि आपके पास कार्यों की एक श्रृंखला है, तो प्रतीक्षा समय बढ़ता जाता है। आपको पूरी श्रृंखला को एक साथ जगाना होगा, एक-एक करके नहीं।
- केवल व्यक्तिगत श्रमिकों को नहीं, बल्कि पूरे पाइपलाइन को देखें। एक कार्यकर्ता अपने आप में तेज़ हो सकता है, लेकिन यदि वह किसी और के इंतजार में फंसा हुआ है, तो पूरा ऑर्डर धीमा होगा। आपको ऑर्डर के "बड़े चित्र" को देखने की आवश्यकता है।
- हिस्सों का व्यक्तिगत रूप से परीक्षण करें। क्योंकि आपका सिस्टम मॉड्यूलर है, आप "स्टेक शेफ" को हटाए बिना केवल "सलाद शेफ" को एक नए शेफ से बदल सकते हैं। यह उन्हें हफ्तों के बजाय दिनों में अपने AI मॉडल को बेहतर बनाने की अनुमति देता है।
- पूर्णता से बेहतर 'ग्रेसफुल डिग्रेडेशन' (क्रमिक गिरावट) है। यदि सिस्टम का एक छोटा हिस्सा विफल हो जाता है, तो पूरी चीज़ क्रैश नहीं होनी चाहिए। कोई भी उत्तर न देने के बजाय थोड़ा कम विस्तृत उत्तर देना बेहतर है।
सारांश
यह पेपर एक कठोर, महंगी, "एक-रसोई" वाली AI व्यवस्था से एक लचीले, "गिग-इकोनॉमी" शैली के नेटवर्क की ओर बढ़ने के बारे में है। प्रत्येक AI टूल को एक अलग, ऑन-डिमांड कार्यकर्ता के रूप में मानकर, जो तुरंत स्केल किया जा सकता है, सेल्सफोर्स ने अपने AI एजेंटों को हजारों एंटरप्राइज उपयोगकर्ताओं के लिए तेज़, सस्ता और बहुत अधिक विश्वसनीय बना दिया है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।