SLMs as Multi-Agent Routers: A Progressive SFT and Reinforcement Learning Approach
यह शोध पत्र एक छोटे भाषा मॉडल का प्रस्ताव करता है जिसे प्रोग्रेसिव सुपरवाइज्ड फाइन-ट्यूनिंग और रीइन्फोर्समेंट लर्निंग के माध्यम से प्रशिक्षित किया गया है ताकि केवल इरादे (intent) के बजाय रिट्रीवल प्रदर्शन के आधार पर क्वेरीज़ को विशिष्ट रिट्रीवल एजेंटों तक गतिशील रूप से रूट किया जा सके, जिससे बड़े भाषा मॉडल बेसलाइन की तुलना में काफी अधिक प्रासंगिकता (NDCG@10 का 0.771) और कम विलंबता (120.1ms) प्राप्त होती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशाल, भविष्यवादी पुस्तकालय में प्रवेश कर रहे हैं जहाँ हर एक किताब एक अलग विशेषज्ञ द्वारा लिखी गई है। वहाँ क्वांटम भौतिकी के लिए एक खंड है, प्राचीन इतिहास के लिए दूसरा, खाना पकाने का एक पूरा विंग है, और यहाँ तक कि मानव जीनोम के रहस्यों को समर्पित एक कमरा भी है। इस पुस्तकालय में, पुस्तकालयाध्यक्ष (लाइब्रेरियन) सुपर-स्मार्ट रोबोट हैं। कुछ चिकित्सा शोध पत्रों को खोजने में जीनियस हैं, जबकि अन्य वित्तीय रिपोर्टों के उस्ताद हैं। समस्या क्या है? आपको नहीं पता कि किस रोबोट से पूछना है। यदि आप वित्त (फाइनेंस) वाले रोबोट से सोंडौघ ब्रेड (sourdough bread) की रेसिपी के बारे में पूछते हैं, तो वह स्टॉक मार्केट से संबंध जोड़ने की कोशिश कर सकता है और आपको एक भ्रमित करने वाला, बेकार उत्तर दे सकता है। यदि आप मेडिकल रोबोट से स्टॉक मार्केट क्रैश के बारे में पूछते हैं, तो वह आपको किसी दुर्लभ बीमारी का निदान करना शुरू कर सकता है।
यह "मल्टी-एजेंट रिट्रीवल" (Multi-Agent Retrieval) की दुनिया है। डिजिटल दुनिया में, हमारे पास कई विशिष्ट AI "एजेंट्स" (सोचिए कि वे उन विशेषज्ञ रोबोटों की तरह हैं) हैं जिन्हें विशिष्ट प्रकार की जानकारी खोजने के लिए डिज़ाइन किया गया है। बड़ी चुनौती "रूटर" (Router) है: वह हिस्सा जो यह तय करता है कि आपके प्रश्न को कौन सा रोबोट मिलेगा। लंबे समय तक, किसी रोबोट को चुनने का सबसे अच्छा तरीका यह था कि उपयोग किए गए शब्दों के आधार पर यह अनुमान लगाया जाए कि प्रश्न किस बारे में है। यदि आपने "स्टॉक्स" कहा, तो सिस्टम ने फाइनेंस रोबोट को चुना। लेकिन यह किताब के कवर से उसे आंकने जैसा है; कभी-कभी "स्टॉक्स" के बारे में प्रश्न वास्तव में किसी कंपनी के इतिहास के बारे में होता है, न कि उसकी वर्तमान कीमत के बारे में, और फाइनेंस रोबोट लक्ष्य चूक सकता है। इस पेपर के लेखक एक स्मार्ट रूटर बनाना चाहते थे जो केवल विषय का अनुमान न लगाए, बल्कि यह देखने के लिए परिणामों से सीखे कि कौन सा रोबोट वास्तव में सबसे उपयुक्त है।
पेपर, जिसका शीर्षक "SLMs as Multi-Agent Routers: A Progressive SFT and Reinforcement Learning Approach" है, इस समस्या का एक चतुर समाधान प्रस्तावित करता है। लेखक तर्क देते हैं कि केवल विषय का अनुमान लगाना पर्याप्त नहीं है क्योंकि यह इस बात को अनदेखा करता है कि चुना गया रोबोट वास्तव में अच्छे उत्तर खोज पाता है या नहीं। इसके बजाय, उन्होंने एक बहुत ही छोटे, सुपर-फास्ट AI मॉडल (जिसे 'स्मॉल लैंग्वेज मॉडल' या SLM कहा जाता है) को एक परम ट्रैफिक पुलिस की तरह काम करने के लिए प्रशिक्षित किया। उन्होंने इसे केवल प्रश्न पढ़ना नहीं सिखाया; उन्होंने इसे अनुभव से सीखना सिखाया।
उन्होंने इसे कैसे किया, यहाँ इसका विवरण दिया गया है, जो एक नए कर्मचारी को सिखाने की तरह है। पहले, उन्होंने "सुपरवाइज्ड फाइन-ट्यूनिंग" (SFT) का उपयोग किया। कल्पना कीजिए कि आप नए कर्मचारी को हजारों उदाहरण दिखा रहे हैं जिनमें प्रश्न और चुनने के लिए "सही" रोबोट दिए गए हैं। इसने मॉडल को एक ठोस आधार दिया, यह सिखाते हुए कि "फाइनेंस" का अर्थ आमतौर पर फाइनेंस रोबोट होता है और "जेनेटिक्स" का अर्थ साइंस रोबोट होता है। हालाँकि, लेखकों ने महसूस किया कि यह पर्याप्त नहीं था। ठीक वैसे ही जैसे एक नया कर्मचारी जो केवल एक हैंडबुक को रट लेता है, वह यह अंतर नहीं बता सकता कि एक ऐसा प्रश्न जो दिखने में एक रोबोट से संबंधित लगता है, वास्तव में दूसरे के लिए बेहतर उपयुक्त हो सकता है।
इसे ठीक करने के लिए, उन्होंने दूसरा चरण जोड़ा: "रीइन्फोर्समेंट लर्निंग" (RL)। यह वह जगह है जहाँ मॉडल एक खेल खेलता है। वह एक रोबोट चुनता है, परिणाम प्राप्त करता है, और फिर एक "जज" (एक अन्य AI) स्कोर करता है कि वे परिणाम कितने अच्छे थे। यदि मॉडल ने गलत रोबोट चुना और खराब परिणाम मिले, तो उसे "सजा" (कम स्कोर) मिली। यदि उसने सही रोबोट चुना या यह महसूस किया कि एक विशिष्ट रोबोट सही फिट नहीं है और एक सामान्य (जनरल) रोबोट की ओर स्विच कर गया, तो उसे "पुरस्कार" मिला। समय के साथ, मॉडल उन पेचीदा मामलों को पहचानने में माहिर हो गया जहाँ एक विशिष्ट रोबोट विफल हो जाएगा, भले ही प्रश्न पूरी तरह से मेल खाता हुआ प्रतीत हो रहा हो।
परिणाम प्रभावशाली थे। उनके द्वारा प्रशिक्षित छोटा मॉडल, जिसमें केवल 0.6 बिलियन पैरामीटर्स हैं (जो उनके साथ तुलना किए गए विशाल मॉडलों की तुलना में बहुत छोटा है), दो बहुत बड़े, महंगे AI मॉडलों (Amazon Nova Lite और Claude Haiku 4.5) की तुलना में बेहतर निर्णय लेने वाला बना। 0 से 1 के मानक पैमाने पर परीक्षण किए जाने पर (जहाँ 1 पूर्ण है), नए रूटर ने औसतन 0.771 का स्कोर प्राप्त किया, जबकि बड़े मॉडलों ने 0.594 और 0.552 का स्कोर किया।
असली जादू तब हुआ जब उन्होंने रूटर का परीक्षण "ट्रिकी" (पेचीदा) प्रश्नों पर किया—वे प्रश्न जहाँ एक विशिष्ट रोबोट विषय को तो सही पकड़ लेगा लेकिन उत्तर गलत देगा। इन विशिष्ट मिसमैच्ड (mismatched) प्रश्नों पर, नए रूटर ने भारी 0.918 का स्कोर किया, जबकि बड़े मॉडल 0.539 और 0.490 के स्कोर के साथ संघर्ष करते रहे। यह साबित करता है कि नया मॉडल यह पता लगाने में सीख गया कि कब एक विशिष्ट एजेंट एक खराब फिट है, एक ऐसा कौशल जिसे बड़े मॉडलों ने मिस कर दिया क्योंकि वे केवल सतही स्तर के विषय को देखते थे।
गति (Speed) भी एक बड़ी जीत थी। वास्तविक दुनिया में, निर्णय के लिए प्रतीक्षा करना निराशाजनक होता है। नया रूटर औसतन 120.1 मिलीसेकंड में अपने निर्णय लेता है। यह Amazon Nova Lite मॉडल (जिसने 683.6 मिलीसेकंड लिया) की तुलना में 82.4% तेज़ है, और Claude Haiku मॉडल (2,457 मिलीसेकंड) की तुलना में आश्चर्यजनक रूप से 95.1% तेज़ है।
संक्षेप में, यह पेपर दिखाता है कि स्मार्ट रूटिंग निर्णय लेने के लिए आपको एक विशाल, धीमे और महंगे दिमाग की आवश्यकता नहीं है। एक छोटे, तेज़ दिमाग को यह सिखाकर कि वह उसके द्वारा उत्पन्न किए गए परिणामों की गुणवत्ता से सीखे, आप एक ऐसा सिस्टम बना सकते हैं जो न केवल सही विशेषज्ञ चुनने में स्मार्ट है, बल्कि बिजली की तरह तेज़ भी है। लेखक सुझाव देते हैं कि यह दृष्टिकोण उस तरीके में क्रांति ला सकता है जिससे हम ऐसे AI सिस्टम बनाते हैं जिन्हें जानकारी को तेज़ी से और सटीकता से खोजने की आवश्यकता होती है, यह सिद्ध करते हुए कि कभी-कभी, सही फीडबैक के साथ प्रशिक्षित एक छोटा मॉडल, अंधेरे में अंदाज़ा लगाने वाले एक विशाल मॉडल से बेहतर होता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।