RouteJudge: An Open Platform for Reproducible and Preference-Aware LLM Routing
यह शोध पत्र RouteJudge को प्रस्तुत करता है, जो उपयोगकर्ता प्राथमिकता-आधारित युग्म तुलनाओं (pairwise comparisons) के माध्यम से LLM रूटिंग रणनीतियों के मूल्यांकन के लिए एक खुला ऑनलाइन प्लेटफॉर्म है, जिसके साथ ORBIT भी है, जो रूटिंग एल्गोरिदम के विकास, बेंचमार्किंग और एकीकरण को मानकीकृत करने वाला एक मॉड्यूलर टूलबॉक्स है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशाल, हाई-टेक रेस्टोरेंट चला रहे हैं। आपके पास एक बहुत बड़ी रसोई है जिसमें विभिन्न कौशल स्तरों के शेफ कार्यरत हैं: कुछ बिजली की तरह तेज़ हैं लेकिन साधारण व्यंजन बनाते हैं, जबकि अन्य धीमे, महंगे जीनियस हैं जो जटिल उत्कृष्ट कृतियाँ (masterpieces) तैयार कर सकते हैं।
समस्या: "एक ही आकार सबके लिए" वाली गलती
अतीत में, जब लोग AI (जैसे लार्ज लैंग्वेज मॉडल्स) का उपयोग करना चाहते थे, तो वे अक्सर हर एक ऑर्डर के लिए बस "सबसे अच्छा" शेफ (सबसे शक्तिशाली AI) चुन लेते थे। लेकिन यह बर्बादी है। यदि कोई ग्राहक सिर्फ एक त्वरित सैंडविच चाहता है, तो उसे महंगे, धीमे जीनियस शेफ के पास भेजना पैसे और समय की बर्बादी है। यदि वे एक जटिल, 10-कोर्स मील चाहते हैं, तो तेज़ शेफ विफल हो सकता है।
यहीं पर LLM Routing काम आता है। यह एक स्मार्ट होस्ट (मेज़बान) की तरह है जो ग्राहक के ऑर्डर को देखता है और निर्णय लेता है: "ठीक है, इस सरल अनुरोध के लिए, इसे तेज़ शेफ के पास भेजें। इस कठिन अनुरोध के लिए, इसे जीनियस के पास भेजें।"
परीक्षण का पुराना तरीका: "उत्तर कुंजी" का जाल
अब तक, वैज्ञानिक इन "स्मार्ट होस्ट्स" का परीक्षण एक कठोर उत्तर कुंजी (answer key) का उपयोग करके करते थे। वे होस्ट को एक प्रश्न देते, देखते कि उसने किस शेफ को चुना, और फिर देखते कि क्या उस शेफ का उत्तर पहले से लिखे गए "सही" उत्तर से मेल खाता है।
- दोष: वास्तविक जीवन बहुविकल्पीय परीक्षा नहीं है। कभी-कभी किसी प्रश्न के उत्तर देने के कई "सही" तरीके हो सकते हैं। कोई व्यक्ति छोटा और मज़ेदार उत्तर चाहता है; दूसरा लंबा और गंभीर उत्तर चाहता है। पुराने परीक्षण यह नहीं बता पाते थे कि क्या होस्ट ने वास्तव में उस शेफ को चुना जिसे ग्राहक सबसे अधिक पसंद करता।
नया समाधान: RouteJudge
लेखक RouteJudge पेश करते हैं, जो एक लाइव, ओपन-एयर फूड फेस्टिवल की तरह है।
- यह कैसे काम करता है: एक कठोर उत्तर कुंजी की जाँच करने के बजाय, RouteJudge वास्तविक लोगों को भोजन चखने देता है।
- सेटअप: जब कोई ग्राहक एक प्रश्न पूछता है, तो कई अलग-अलग "स्मार्ट होस्ट्स" (रूटिंग रणनीतियाँ) अपनी सिफारिशें करती हैं।
- टेस्टिंग (स्वाद परीक्षण): सिस्टम दो सबसे अच्छी सिफारिशों को लेता है, शेफ और होस्ट के नाम छिपा देता है, और ग्राहक से पूछता है: "इन दोनों में से आपको कौन सा व्यंजन अधिक पसंद आया?"
- स्कोर: यदि ग्राहक को व्यंजन पसंद आता है, तो सिस्टम उस होस्ट को श्रेय देता है जिसने उस शेफ की सिफारिश की थी। यह इस बारे में नहीं है कि किसने "परफेक्ट" उत्तर बनाया; यह इस बारे में है कि किसने वह चुनाव किया जिसे मानव वास्तव में पसंद करता है।
टूलकिट: ORBIT
इन स्मार्ट होस्ट्स को बनाना कठिन है क्योंकि हर कोई उन्हें अलग तरह से बनाता है। इसे ठीक करने के लिए, लेखकों ने ORBIT (ऑप्टिमल रूटिंग एंड बजटेड इन्फरेंस टूलबॉक्स) भी बनाया है।
- उपमा: सोचिए कि ORBIT एक मानकीकृत "किचन किट" या एक सार्वभौमिक रेसिपी बुक है। यह प्रत्येक शोधकर्ता को समान मापने वाले कप, समान सामग्री सूची और समान खाना पकाने के निर्देश प्रदान करता है।
- महत्व: यह सुनिश्चित करता है कि जब शोधकर्ता एक नया "स्मार्ट होस्ट" बनाते हैं, तो वे सभी एक ही नियमों के तहत काम कर रहे हों। यह उन्हें रसोई में (ऑफलाइन) एक नए होस्ट का परीक्षण करने और फिर उन्हें फूड फेस्टिवल (RouteJudge) में भेजने के लिए आसान बनाता है ताकि वे देख सकें कि वास्तविक ग्राहकों की प्रतिक्रिया क्या है।
उन्होंने क्या पाया (एक झलक)
यह पेपर इस नए सिस्टम के शुरुआती परिणाम दिखाता है:
- ऑफलाइन बनाम ऑनलाइन: एक होस्ट जो रसोई में (कागजी परीक्षणों में) बहुत अच्छा दिखता है, वह हमेशा फूड फेस्टिवल में नहीं जीतता। कभी-कभी, सरल और सस्ते रणनीतियाँ जिन्हें इंसान वास्तव में पसंद करते हैं, जटिल और महंगे विकल्पों को मात दे देती हैं।
- लागत मायने रखती है: सिस्टम दिखाता है कि "सबसे अच्छा" शेफ हमेशा सबसे महंगा नहीं होता है। स्मार्टेस्ट होस्ट वह है जो लागत, गति और ग्राहक वास्तव में क्या चाहता है, के बीच संतुलन बनाता है।
सारांश में
यह पेपर AI प्रबंधकों (managers) को टेस्ट करने का एक नया तरीका बनाता है। यह पूछने के बजाय कि, "क्या उन्होंने सही उत्तर चुना?" यह पूछता है कि, "क्या उन्होंने वह उत्तर चुना जिसे मानव वास्तव में पसंद करता है?" यह इन प्रबंधकों को बनाने के लिए एक मानकीकृत टूलकिट (ORBIT) प्रदान करता है और उन्हें वास्तविक मानव प्राथमिकताओं के विरुद्ध टेस्ट करने के लिए एक लाइव प्लेटफॉर्म (RouteJudge) प्रदान करता है, जिससे यह सुनिश्चित होता है कि वास्तविक दुनिया में AI का उपयोग कुशलतापूर्वक और प्रभावी ढंग से किया जाए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।