From Sampled Outcomes to Capability Distributions: Rethinking Supervision for LLM Routing
यह शोधपत्र DARS को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो शोर-युक्त एकल-प्रतिक्रिया पर्यवेक्षण (single-response supervision) को वितरण-जागरूक संकेतों (distribution-aware signals) से बदलकर LLM रूटिंग विश्वसनीयता में सुधार करता है, जो इनपुट विविधताओं और मॉडल जनरेशन की अंतर्निहित स्टोकेस्टिसिटी (stochasticity) दोनों को ध्यान में रखते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक व्यस्त कॉल सेंटर में एक मैनेजर हैं। आपके पास एजेंटों की एक टीम है जिनके कौशल और भुगतान दरें अलग-अलग हैं: कुछ तेज़ और सस्ते हैं लेकिन केवल सरल सवालों के लिए अच्छे हैं, जबकि अन्य महंगे विशेषज्ञ हैं जो जटिल समस्याओं को हल कर सकते हैं। आपका काम एक "राउटर" (एक स्मार्ट सिस्टम) बनाना है जो यह तय करे कि प्रत्येक आने वाली ग्राहक कॉल को किस एजेंट को सौंपा जाए ताकि बिना पैसा बर्बाद किए सर्वोत्तम परिणाम प्राप्त किए जा सकें।
पुराना तरीका: "वन-शॉट" अनुमान (The "One-Shot" Guess)
वर्तमान में, अधिकांश सिस्टम राउटर को प्रशिक्षित करने के लिए प्रत्येक एजेंट से किसी विशिष्ट ग्राहक प्रश्न का केवल एक बार उत्तर देने के लिए कहते हैं।
- समस्या: लार्ज लैंग्वेज मॉडल्स (LLMs) इंसानों की तरह हो सकते हैं जिनका "बुरा दिन" चल रहा हो या जो विचलित हो जाते हैं। भले ही कोई एजेंट एक विशेषज्ञ हो, यदि आप उनसे एक ही सवाल दो बार पूछते हैं, तो वे दो थोड़े अलग उत्तर दे सकते हैं। कभी-कभी वे सही होते हैं; कभी-कभी वे लड़खड़ा जाते हैं।
- दोष: यदि आप केवल उस एक एकल प्रयास को सुनते हैं, तो आपको लग सकता है कि एक विशेषज्ञ वास्तव में बुरा है क्योंकि उसका एक क्षणिक चूक हो गई। या, आपको लग सकता है कि एक सस्ता एजेंट जीनियस है क्योंकि वह एक कोशिश में भाग्यशाली रहा।
- परिणाम: राउटर "शोर वाले" (noisy) डेटा से सीखता है। यह भाग्य के बजाय वास्तविक कौशल के आधार पर निर्णय लेता है, जिससे एक अविश्वसनीय और असंगत प्रणाली बनती है।
नया समाधान: DARS (डिस्ट्रीब्यूशन-अवेयर राउटिंग सुपरविजन)
इस शोध पत्र के लेखक DARS नामक एक नया फ्रेमवर्क प्रस्तावित करते हैं। एक एजेंट से एक बार उत्तर देने के बजाय, DARS उन्हें कई तरीकों से एक ही प्रश्न को कई बार उत्तर देने के लिए कहता है ताकि उनकी क्षमता की एक सच्ची तस्वीर मिल सके।
इसे इस प्रकार समझें:
- प्रश्न को फिर से लिखना (इनपुट पक्ष): कल्पना करें कि आप एक ही ग्राहक प्रश्न को पांच अलग-अलग तरीकों से पूछ रहे हैं (जैसे, "मैं लीकेज को कैसे ठीक करूँ?" बनाम "मेरा सिंक टपक रहा है, मदद करें!")। यह जांचता है कि क्या एजेंट सवाल चाहे जिस भी तरह से पूछा जाए, सुसंगत रहता है।
- प्रश्न का पुन: उत्तर देना (आउटपुट पक्ष): कल्पना करें कि आप एजेंट को उसी प्रश्न का लगातार पांच बार उत्तर देने के लिए कहते हैं। यह जांचता है कि क्या उनके उत्तर स्थिर हैं या वे केवल बेतरतीब ढंग से अनुमान लगा रहे हैं।
इन सभी अलग-अलग प्रयासों को एकत्र करके, DARS केवल एक एकल स्कोर नहीं देखता है। यह एक क्षमता वितरण (capability distribution) बनाता है—एजेंट का एक पूर्ण प्रोफाइल। यह गणना करता है:
- औसत कौशल: वे आमतौर पर कितने अच्छे हैं?
- लागत: उन्हें उपयोग करने में कितनी लागत आती है?
- जोखिम (स्थिरता): उनके उत्तर "शानदार" और "भयानक" के बीच कितना झूलते हैं?
"जोखिम-जागरूक" निर्णय (The "Risk-Aware" Decision)
DARS राउटर को ऐसे एजेंट चुनने के लिए प्रशिक्षित करता है जो न केवल औसत रूप से अच्छे हैं, बल्कि विश्वसनीय भी हैं।
- पुराना राउटर: "एजेंट A ने उस एक कोशिश में परफेक्ट स्कोर प्राप्त किया! चलिए उन्हें इस्तेमाल करते हैं!" (भले ही वे आमतौर पर विफल होते हों)।
- DARS राउटर: "एजेंट A ने एक बार परफेक्ट स्कोर प्राप्त किया, लेकिन अन्य चार बार विफल रहा। यह बहुत जोखिम भरा है। एजेंट B औसत से थोड़ा कम परफेक्ट है, लेकिन वे हर बार सुसंगत हैं। चलिए एजेंट B को इस्तेमाल करते हैं।"
शोध पत्र में क्या पाया गया
शोधकर्ताओं ने तीन अलग-अलग प्रकार के कार्यों पर इसका परीक्षण किया:
- विज्ञान के प्रश्न (GPQA): जैसे कि एक कठिन ट्रिविया क्विज़।
- गणित की समस्याएं (MATH): जैसे समीकरणों को हल करना।
- रीडिंग कॉम्प्रिहेनशन (DROP): जैसे किसी कहानी से विशिष्ट तथ्य ढूंढना।
उन्होंने पाया कि पुराना "वन-शॉट" तरीका बहुत अस्थिर था। विज्ञान के प्रश्नों के लिए, "सर्वश्रेष्ठ" एजेंट लगभग हर बार बदल जाता था क्योंकि वे केवल यादृच्छिक भाग्य (random luck) के कारण ऐसा होता था। नया DARS तरीका राउटर को प्रशिक्षित करने का एक अधिक स्थिर और सटीक तरीका प्रदान करता है।
मुख्य निष्कर्ष:
- सिंगल शॉट भ्रामक हैं: एक उत्तर किसी AI की क्षमता के बारे में पूरी कहानी नहीं बताता।
- विविधता वास्तविक है: AI मॉडल स्वाभाविक रूप से अप्रत्याशित होते हैं, और इसे अनदेखा करने से गलत राउटिंग निर्णय होते हैं।
- अधिक डेटा = बेहतर निर्णय: कई प्रयासों (पुनर्लेखन और पुन: उत्तर) को देखकर, सिस्टम उन एजेंटों पर भरोसा करना सीखता है जो लगातार अच्छे हैं, न कि उन पर जिन्होंने बस एक बार भाग्य आजमाया।
- यह सभी के लिए काम करता है: इस पद्धति ने कई अलग-अलग प्रकार के राउटिंग सिस्टम के प्रदर्शन में सुधार किया, न कि केवल एक विशिष्ट डिज़ाइन में।
संक्षेप में, DARS राउटर को एक एकल भाग्यशाली अनुमान पर जुआ खेलने से रोकता है और उसे प्रदर्शन के एक ठोस, दीर्घकालिक रिकॉर्ड के आधार पर निर्णय लेने के लिए प्रेरित करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।