RouteNLP: Closed-Loop LLM Routing with Conformal Cascading and Distillation Co-Optimization
RouteNLP एक क्लोज्ड-लूप फ्रेमवर्क है जो उच्च गुणवत्ता और कम विलंबता बनाए रखते हुए, एक टियर्ड पोर्टफोलियो में सबसे कुशल मॉडल तक क्वेरी को रूट करने के लिए एक डिफिकल्टी-अवेयर राउटर, कॉन्फॉर्मल-प्रेडिक्शन-आधारित कैस्केडिंग, और एक डिस्टिलेशन-रूटिंग को-ऑप्टिमाइज़ेशन लूप को संयोजित करके LLM सर्विंग लागत को अनुकूलित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशाल, वैश्विक कॉल सेंटर चला रहे हैं। आपके पास दो प्रकार के कर्मचारी हैं: सुपर-एक्सपर्ट्स (जो सब कुछ जानते हैं लेकिन प्रति घंटा 5 प्रति घंटा खर्च करते हैं)।
वर्तमान में, आपकी कंपनी एक बहुत बड़ी गलती कर रही है: आप हर एक फोन कॉल—यहाँ तक कि कोई सिर्फ यह पूछ रहा हो कि "आपके खुलने का समय क्या है?"—को भी सुपर-एक्सपर्ट्स के पास भेज रहे हैं। आप लाखों डॉलर बर्बाद कर रहे हैं, और आपके विशेषज्ञ ऊब रहे हैं और थक रहे हैं।
RouteNLP एक "स्मार्ट डिस्पैचर" सिस्टम की तरह है जिसे इस गड़बड़ी को ठीक करने के लिए डिज़ाइन किया गया है। यह तीन चतुर तरीकों का उपयोग करके काम करता है:
1. स्मार्ट डिस्पैचर (द राउटर)
हर कॉल को महंगे विशेषज्ञ के पास भेजने के बजाय, सिस्टम कॉल की शुरुआत में ही उसे सुन लेता है। यह अनुमान लगाने के लिए एक छोटे, बिजली की तरह तेज़ "ट्राइएज" (तुलनात्मक) दिमाग का उपयोग करता है: "क्या यह एक सरल प्रश्न है या एक जटिल कानूनी संकट?"
- यदि यह सरल है, तो यह उन्हें सीधे एक जूनियर असिस्टेंट के पास भेज देता है।
- यदि यह कठिन लग रहा है, तो यह उन्हें एक मिड-लेवल मैनेजर के पास भेज देता है।
- यदि यह पूरी तरह से एक बुरा सपना है, तभी यह सुपर-एक्सपर्ट को बुलाता है।
2. "सेफ्टी नेट" (कॉन्फॉर्मल कैस्केडिंग)
कभी-कभी, डिस्पैचर गलती कर देता है और एक कठिन प्रश्न को जूनियर असिस्टेंट के पास भेज देता है। ग्राहक को गलत उत्तर मिलने से रोकने के लिए, सिस्टम एक सेफ्टी नेट का उपयोग करता है।
जूनियर असिस्टेंट को प्रशिक्षित किया जाता है कि वह कहे, "मैं इस बारे में 100% निश्चित नहीं हूँ।" जैसे ही उस अनिश्चितता का पता चलता है, सिस्टम तुरंत कॉल को अगले स्तर पर "एस्केलेट" (बढ़ा) देता है। यह बिल्कुल वैसा ही है जैसे एक जूनियर शेफ को यह एहसास होता है कि उसे सूफ़ले (soufflé) बनाना नहीं आता और वह डिश खराब होने से पहले तुरंत पैन को हेड शेफ को सौंप देता है।
3. "ट्रेनिंग लूप" (को-ऑप्टिमाइज़ेशन)
यह सबसे शानदार हिस्सा है। अधिकांश सिस्टम केवल यह मान लेते हैं कि कुछ प्रश्न जूनियर्स के लिए "बहुत कठिन" हैं। RouteNLP ऐसा नहीं करता है।
यह हर उस बार का एक "फेलियर लॉग" (विफलता लॉग) रखता है जब एक जूनियर असिस्टेंट को एक्सपर्ट को कार्य सौंपना पड़ा था। यह उन विफलताओं को देखता है, उन्हें समूहों में बांटता है (जैसे, "हे, ये सभी जूनियर्स टैक्स संबंधी सवालों में संघर्ष कर रहे हैं!"), और फिर एक्सपर्ट का उपयोग जूनियर्स को ठीक उसी तरह के टैक्स सवालों को संभालने के लिए सिखाने के लिए करता है।
यह एक कोच की तरह है जो गेम फिल्म देख रहा है, देख रहा है कि खिलाड़ी ठीक कहाँ लड़खड़ा रहे हैं, और उन सटीक गतिविधियों को ठीक करने के लिए विशिष्ट अभ्यास (ड्रिल्स) करवा रहा है। समय के साथ, जूनियर्स अधिक स्मार्ट होते जाते हैं, जिसका अर्थ है कि आपको महंगे एक्सपर्ट्स को कम से कम बुलाने की आवश्यकता होती है।
परिणाम (द "बॉटम लाइन")
जब उन्होंने इसे एक वास्तविक कंपनी में टेस्ट किया (प्रतिदिन लगभग 5,000 क्वेरी हैंडल करते हुए), तो परिणाम जबरदस्त थे:
- बचत: उन्होंने लागत में 58% की कटौती की। (कल्पना कीजिए कि 84,000 के बिल में बदलना)।
- गति: सिस्टम बहुत तेज़ हो गया क्योंकि अधिकांश लोग "एक्सपर्ट" लाइन में प्रतीक्षा नहीं कर रहे थे।
- गुणवत्ता: भले ही उन्होंने सस्ते "कर्मचारियों" का अधिक उपयोग किया, ग्राहकों को शायद ही फर्क महसूस हुआ। जवाब लगभग उतने ही अच्छे थे जितने कि तब होते यदि उन्होंने हर बार सुपर-एक्सपर्ट्स का उपयोग किया होता।
संक्षेप में: RouteNLP, AI को स्मार्ट और सस्ता बनाने का एक तरीका है, यह सुनिश्चित करके कि आप "महंगे दिमाग" का उपयोग केवल तभी करें जब वास्तव में उसकी आवश्यकता हो, जबकि लगातार "सस्ते दिमागों" को अधिक करने के लिए सिखाते रहें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।