← नवीनतम पेपर
💬 NLP

Reward-Based Online LLM Routing via NeuralUCB

यह शोध पत्र बड़े भाषा मॉडलों (large language models) के लिए एक NeuralUCB-आधारित ऑनलाइन रूटिंग पॉलिसी प्रस्तावित करता है जो अनुमान लागत (inference cost) और उपयोगिता पुरस्कार (utility reward) के बीच प्रभावी ढंग से संतुलन बनाता है, जो रैंडम और मिन-कॉस्ट बेसलाइनों से बेहतर प्रदर्शन करता है और मैक्स-क्वालिटी संदर्भों (max-quality references) के विरुद्ध प्रतिस्पर्धी प्रदर्शन प्राप्त करता है।

मूल लेखक: Ming-Hua Tsai, Phat Tran

प्रकाशित 2026-04-01
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ming-Hua Tsai, Phat Tran

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक व्यस्त डिजिटल रेस्टोरेंट चला रहे हैं। आपके पास ग्राहकों के लिए व्यंजन तैयार करने के लिए 11 अलग-अलग शेफ (लार्ज लैंग्वेज मॉडल्स, या LLMs) की एक टीम तैयार है।

  • शेफ A एक विश्व प्रसिद्ध सेलिब्रिटी शेफ हैं। वे सबसे स्वादिष्ट और जटिल व्यंजन बनाते हैं, लेकिन उन्हें काम पर रखने के लिए बहुत अधिक खर्च आता है और उन्हें खाना बनाने में लंबा समय लगता है।
  • शेफ B एक तेज़, बजट-अनुकूल लाइन कुक हैं। वे सस्ते और तेज़ हैं, लेकिन यदि आप उनसे कोई जटिल 'सुफ़ले' (soufflé) मांगते हैं, तो वे आपको शायद सिर्फ जला हुआ टोस्ट परोस देंगे।
  • शेफ C से K इनके बीच कहीं आते हैं।

आपका लक्ष्य एक मैनेजर के रूप में यह तय करना है: "इस विशिष्ट ग्राहक के ऑर्डर के लिए, मुझे रसोई में कौन सा शेफ भेजना चाहिए ताकि सबसे कम कीमत में सबसे अच्छा भोजन मिल सके?"

यह ठीक वही है जिसे पेपर "Reward-Based Online LLM Routing via NeuralUCB" हल करने की कोशिश कर रहा है। यहाँ सरल शब्दों में इसका विवरण दिया गया है:

1. समस्या: "अनुमान लगाने का खेल" (The Guessing Game)

अतीत में, प्रबंधकों ने इसे हल करने के दो तरीके आजमाए:

  • "टेस्ट किचन" दृष्टिकोण (सुपरवाइज्ड लर्निंग): खुलने से पहले, उन्होंने सभी 11 शेफों को एक ही व्यंजन बनाने के लिए काम पर रखा, सभी का स्वाद चखा, और लिखा कि कौन सबसे अच्छा था।
    • नुकसान: यह अविश्वसनीय रूप से महंगा और धीमा है। इसके अलावा, यदि टीम में कोई नया शेफ शामिल होता है या ग्राहक अलग-अलग तरह के भोजन का ऑर्डर देने लगते हैं, तो आपको सब कुछ फिर से टेस्ट करना पड़ता है।
  • "अंतर्ज्ञान" दृष्टिकोण (सरल नियम): वे हर चीज़ के लिए सबसे सस्ता शेफ चुन लेते थे, या रैंडमली चुन लेते थे।
    • नुकसान: आप पैसे बचाते हैं, लेकिन खाना (जवाब) अक्सर खराब होता है।

2. समाधान: "स्मार्ट वेटर" (NeuralUCB)

लेखकों ने एक स्मार्ट वेटर बनाया (एक AI एल्गोरिदम जिसे NeuralUCB कहा जाता है) जो काम करते-करते सीखता है। इस वेटर को पहले से हर व्यंजन चखने की आवश्यकता नहीं है। वे "एक्सप्लोर और एक्सप्लॉइट" (Explore and Exploit) नामक रणनीति का उपयोग करते हैं।

इसे एक नए शहर में नए रेस्टोरेंट को आज़माने जैसा समझें:

  • एक्सप्लॉइट (Exploit): आप उस जगह जाते हैं जिसे आप जानते हैं कि वह अच्छी और सस्ती है।
  • एक्सप्लोर (Explore): आप एक नई, थोड़ी जोखिम भरी जगह आज़माते हैं क्योंकि आपने सुना है कि वह अद्भुत हो सकती है, और आप देखना चाहते हैं कि क्या वह अफवाह सच है।

स्मार्ट वेटर इन दोनों के बीच संतुलन बनाने के लिए एक विशेष फॉर्मूला (UCB) का उपयोग करता है:

  • यदि कोई शेफ जाना-माना और बेहतरीन है, तो वेटर वहां ऑर्डर भेजता है।
  • यदि कोई शेफ अज्ञात है या ऑर्डर पेचीदा है, तो वेटर "एक्सप्लोर" कर सकता है और उन्हें आज़मा सकता है ताकि यह देखा जा सके कि क्या वे वास्तव में एक छिपा हुआ रत्न हैं।
  • महत्वपूर्ण बात: वेटर लागत के प्रति जागरूक (cost-aware) है। वे केवल "सबसे अच्छे" भोजन की तलाश नहीं करते; वे सबसे अच्छी वैल्यू की तलाश करते हैं। वे एक साधारण बर्गर ऑर्डर के लिए सेलिब्रिटी शेफ को नहीं बुलाएंगे क्योंकि इसकी लागत जायज नहीं है।

3. वेटर कैसे सीखता है (द "यूटिलिटी" स्कोर)

वेटर केवल यह नहीं पूछता, "क्या यह खाना अच्छा है?" बल्कि वे पूछते हैं, "क्या यह खाना कीमत के हिसाब से अच्छा है?"

वे एक जादूई फॉर्मूले का उपयोग करके "यूटिलिटी स्कोर" की गणना करते हैं:

यूटिलिटी = (स्वाद की गुणवत्ता) × (कम लागत के लिए एक डिस्काउंट)

यदि एक शेफ 100में10/10डिशबनाताहै,तोयूटिलिटीस्कोरकमहोसकताहै।यदिदूसराशेफ100 में 10/10 डिश बनाता है, तो यूटिलिटी स्कोर कम हो सकता है। यदि दूसरा शेफ 5 में 8/10 डिश बनाता है, तो यूटिलिटी स्कोर अधिक हो सकता है। वेटर का काम समय के साथ इस स्कोर को अधिकतम करना है।

4. "गेटिंग" मैकेनिज्म: जोखिम कब लें

इस सिस्टम में एक चतुर सुरक्षा तंत्र है। इसमें एक "गेटिंग ब्रांच" (AI के अंदर एक छोटा निर्णय लेने वाला हिस्सा) है।

  • परिदृश्य A: वेटर बहुत आश्वस्त है। उसे पता है कि इस विशिष्ट ऑर्डर के लिए कौन सा शेफ सबसे अच्छा है। वह बस उस शेफ को चुन लेता है। (सेफ मोड)।
  • परिści B: वेटर अनिश्चित है। ऑर्डर अजीब है, या डेटा धुंधला है। सिस्टम कहता है, "हे, चलिए एक गणना किया गया जोखिम लेते हैं! आइए अधिक सीखने के लिए एक अलग शेफ को आज़माते हैं।" (एक्सप्लोरेशन मोड)।

यह सिस्टम को तब तक पैसे बर्बाद करने से रोकता है जब वह पहले से ही जवाब जानता है, लेकिन यह सुनिश्चित करता है कि जब वह अटक जाए तो वह सीखते रहे।

5. परिणाम: एक सुखद संतुलन

शोधकर्ताओं ने एक विशाल डेटासेट (RouterBench) का उपयोग करके अन्य तरीकों के मुकाबले इस "स्मार्ट वेटर" का परीक्षण किया।

  • रैंडम चॉइस (Random Choice): शेफ चुनने के लिए सिक्का उछालने जैसा। (बहुत खराब परिणाम)।
  • सबसे सस्ता विकल्प (Cheapest Choice): हमेशा बजट शेफ को चुनना। (पैसे बचाते हैं, लेकिन खाना खराब होता है)।
  • सर्वश्रेष्ठ गुणवत्ता वाला विकल्प (Best Quality Choice): हमेशा सेलिब्रिटी शेफ को काम पर रखना। (शानदार खाना, लेकिन रेस्टोरेंट दिवालिया हो जाएगा)।
  • NeuralUCB वेटर: उन्होंने पाया कि वे "गोल्डिलॉक्स" (Goldilocks) ज़ोन में हैं।
    • उन्होंने हमेशा सेलिब्रिटी शेफ को काम पर रखने की तुलना में केवल 33% लागत खर्च की।
    • फिर भी, उन्होंने उच्च-गुणवत्ता वाले उत्तर दिए जो रैंडम या केवल सस्ते विकल्पों की तुलना में बहुत बेहतर थे।

मुख्य निष्कर्ष

यह पेपर हमें दिखाता है कि हमें हर सवाल के लिए सबसे महंगे AI मॉडल की आवश्यकता नहीं है। एक स्मार्ट, सीखने वाले एल्गोरिदम का उपयोग करके जो गुणवत्ता और लागत के बीच संतुलन बनाता है, हम शानदार परिणाम प्राप्त करते हुए भारी मात्रा में पैसा बचा सकते हैं। यह एक व्यक्तिगत खरीदारी सहायक (personal shopper) की तरह है जो जानता है कि कब लग्जरी ब्रांड खरीदना है और कब जेनेरिक स्टोर ब्रांड, जिससे स्टाइल से समझौता किए बिना आपके पैसे बचते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →