ComplianceGate: Classifier-Gated Multi-Tier LLM Routing for Inference in Regulated Industries
यह शोध पत्र ComplianceGate का प्रस्ताव करता है, जो एक क्लासिफायर-गेटेड मल्टी-टियर रूटिंग आर्किटेक्चर है जो विनियमित उद्योगों में डेटा रेजिडेंसी और लागत दक्षता को लागू करता है, जो किसी भी इन्फरेंस (inference) से पहले जटिलता और PII के लिए प्रश्नों की प्री-स्क्रीनिंग करके उन्हें उपयुक्त आकार के मॉडलों और अनुपालन वाले भौगोलिक स्थानोंों में गतिशील रूप से रूट करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशाल, उच्च-सुरक्षा वाले बैंक का संचालन करते हैं। हर दिन, हजारों लोग मदद मांगने के लिए काउंटर पर आते हैं। कुछ सवाल सरल होते हैं, जैसे "आपके खुलने का समय क्या है?" या "वर्तमान विनिमय दर (exchange rate) क्या है?" अन्य जटिल होते हैं, जैसे "एक बहुराष्ट्रीय निगम के लिए एक नई निवेश रणनीति तैयार करें," या "छिपे हुए जोखिमों के लिए इस कानूनी अनुबंध का विश्लेषण करें।"
पुराने तरीके में (जो पेपर में वर्णित "सिंगल मॉडल" या "MoE" दृष्टिकोण है), आप हर एक व्यक्ति को अपने एक ही, अत्यंत महंगे, अत्यंत बुद्धिमान "मुख्य विशेषज्ञ" (Chief Expert) के पास बैठने के लिए इंतजार करने पर मजबूर करेंगे, जो एक कांच के टॉवर में बैठा है।
- समस्या: भले ही कोई बस यह पूछे कि "आप कब बंद होते हैं?", मुख्य विशेषज्ञ को अपना काम रोकना पड़ता है, अपना पूरा कवच पहनना पड़ता है (मेमोरी में 480GB डेटा लोड करना) और जवाब देना पड़ता है। यह धीमा, महंगा और बर्बादी भरा है।
- अनुपालन जोखिम (Compliance Risk): इससे भी बदतर, कल्पना कीजिए कि एक ग्राहक एक रहस्य (जैसे कि उनका सोशल सिक्योरिटी नंबर) मुख्य विशेषज्ञ को फुसफुसाता है। यदि वह विशेषज्ञ किसी दूसरे देश में स्थित है, तो वह रहस्य अवैध रूप से एक सीमा पार कर गया है, जो कानून का उल्लंघन है।
पेपर का समाधान: "ComplianceGate"
लेखक, अभिषेक डे, ComplianceGate नामक एक नया सिस्टम प्रस्तावित करते हैं। एक विशाल विशेषज्ञ के बजाय, कल्पना कीजिए कि मुख्य दरवाजे पर एक अत्यंत प्रशिक्षित, सुपर-फास्ट सुरक्षा गार्ड खड़ा है।
यह कैसे काम करता है, चरण-दर-चरण:
1. स्मार्ट सुरक्षा गार्ड (द क्लासिफायर)
मुख्य डेस्क तक पहुँचने से पहले ही, एक अत्यधिक प्रशिक्षित "सुरक्षा गार्ड" (एक AI एनकोडर) सवाल को देखता है। यह गार्ड अविश्वसनीय रूप से तेज़ है (केवल 7 मिलीसेकंड लेता है) और इसके दो काम हैं:
- क्या यह एक रहस्य है? क्या प्रश्न में संवेदनशील व्यक्तिगत डेटा (PII) शामिल है?
- यह कितना कठिन है? क्या यह एक सरल प्रश्न है या एक जटिल पहेली?
2. ट्रैफिक डायरेक्टर (द रूटिंग)
गार्ड के मूल्यांकन के आधार पर, प्रश्न को तुरंत सही जगह भेजा जाता है:
परिदृश्य A: सरल प्रश्न (जैसे, "घंटे क्या हैं?")
- पुराना तरीका: मुख्य विशेषज्ञ को भेजा जाता।
- नया तरीका: गार्ड कहता है, "यह आसान है!" और ग्राहक को पास के एक छोटे, तेज़ कियोस्क के पास भेज देता है। कियोस्क तुरंत उत्तर देता है। यह सस्ता है और इसमें बहुत कम ऊर्जा लगती है।
- उपमा: जैसे वाइन चुनने के लिए सोमेलियर (sommelier) को बुलाने के बजाय सोडा के लिए वेंडिंग मशीन का उपयोग करना।
परिदृश्य B: गुप्त प्रश्न (जैसे, "SSN 123 के साथ मेरा बैंक बैलेंस चेक करें...")
- पुराना तरीका: मुख्य विशेषज्ञ को भेजा जाता, जो शायद दूसरे देश में हो।
- नया तरीका: गार्ड तुरंत रहस्य को पहचान लेता है। किसी भी प्रोसेसिंग के होने से पहले ही, गार्ड कहता है, "रुकिए! यह डेटा इमारत से बाहर नहीं जा सकता।" प्रश्न को उसी देश के भीतर एक स्थानीय, सुरक्षित वॉल्ट (vault) में रूट किया जाता है।
- उपमा: जैसे एक वीआईपी क्लब का बाउंसर जो वीआईपी की आईडी देखता है और तुरंत उन्हें इमारत के अंदर एक निजी कमरे में ले जाता है, यह सुनिश्चित करते हुए कि वे कभी बाहर न जाएं जहां उन्हें देखा जा सके।
परिदृश्य C: कठिन प्रश्न (जैसे, "एक नई वित्तीय प्रणाली डिजाइन करें")
- पुराना तरीका: मुख्य विशेषज्ञ को भेजा जाता।
- नया तरीका: गार्ड कहता है, "यह कठिन है।" ग्राहक को मुख्य विशेषज्ञ (बड़े मॉडल) के पास भेजा जाता है ताकि सबसे अच्छा उत्तर मिल सके।
3. "सेफ्टी नेट" (कॉन्फिडेंस-बेस्ड फॉलबैक)
क्या होगा यदि सुरक्षा गार्ड अनिश्चित हो? शायद प्रश्न पेचीदा हो।
- नियम: यदि गार्ड 100% सुनिश्चित नहीं है, तो वे जोखिम नहीं लेते। वे स्वचालित रूप से ग्राहक को सबसे सुरक्षित, सबसे महंगे विकल्प (स्थानीय वॉल्ट या मुख्य विशेषज्ञ) पर भेज देते हैं।
- क्यों? एक सुरक्षित उत्तर के लिए थोड़ा पैसा बर्बाद करना, गलती से कोई रहस्य लीक करने से बेहतर है। पेपर का दावा है कि ऐसा बहुत कम होता है (99.2% सटीकता), इसलिए यह लागत को बहुत कम प्रभावित करता है।
परिणाम: यह क्यों मायने रखता है
पेपर ने 600 वास्तविक दुनिया के सवालों के साथ इस सिस्टम का परीक्षण किया और पाया:
- यह बहुत तेज़ है: सरल सवालों के जवाब 2 से 4 गुना तेज़ी से मिले क्योंकि उन्हें विशाल विशेषज्ञ के जागने का इंतज़ार नहीं करना पड़ा।
- यह बहुत सस्ता है: सरल सवालों को छोटी, सस्ती मशीनों के पास भेजकर, सिस्टम ने लागत में 33% से 52% की बचत की।
- यह बहुत सुरक्षित है: संवेदनशील डेटा कभी भी अपने स्थानीय अधिकार क्षेत्र को पार नहीं कर पाया। सिस्टम ने इसे "संरचनात्मक रूप से असंभव" बना दिया कि रहस्य गलती से सीमाओं को पार कर जाएं।
- यह अनुमानित है: पुराना सिस्टम एक अराजक राजमार्ग की तरह था जहाँ कभी कार 1 सेकंड लेती थी तो कभी 20 सेकंड। नया सिस्टम एक समर्पित लेन की तरह है; सरल सवाल हमेशा लगभग एक ही समय में पूरे होते हैं।
संक्षेप में
पेपर का तर्क है कि हमें "अखरोट तोड़ने के लिए हथौड़े" का उपयोग नहीं करना चाहिए। हर सवाल को एक विशाल, महंगे और संभावित रूप से जोखिम भरे AI मॉडल के माध्यम से भेजने के बजाय, हमें पहले एक स्मार्ट फ़िल्टर का उपयोग करना चाहिए। यह फ़िल्टर आसान सवालों को छोटे, तेज़ सहायकों के पास भेजता है, रहस्यों को सख्ती से स्थानीय रखता है, और केवल तभी भारी खिलाड़ियों को बुलाता है जब वास्तव में आवश्यक हो।
यह दृष्टिकोण AI को विनियमित उद्योगों (जैसे बैंकिंग और स्वास्थ्य सेवा) में डिज़ाइन द्वारा तेज़, सस्ता और कानूनी रूप से अनुपालन योग्य बनाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।