← नवीनतम पेपर
💻 computer science

RouteJudge: An Open Platform for Reproducible and Preference-Aware LLM Routing

यह शोध पत्र RouteJudge को प्रस्तुत करता है, जो उपयोगकर्ता प्राथमिकता-आधारित युग्म तुलनाओं (pairwise comparisons) के माध्यम से LLM रूटिंग रणनीतियों के मूल्यांकन के लिए एक खुला ऑनलाइन प्लेटफॉर्म है, जिसके साथ ORBIT भी है, जो रूटिंग एल्गोरिदम के विकास, बेंचमार्किंग और एकीकरण को मानकीकृत करने वाला एक मॉड्यूलर टूलबॉक्स है।

मूल लेखक: Guannan Lai, Haoran Hu, Han-Jia Ye

प्रकाशित 2026-06-19
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Guannan Lai, Haoran Hu, Han-Jia Ye

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, हाई-टेक रेस्टोरेंट चला रहे हैं। आपके पास एक बहुत बड़ी रसोई है जिसमें विभिन्न कौशल स्तरों के शेफ कार्यरत हैं: कुछ बिजली की तरह तेज़ हैं लेकिन साधारण व्यंजन बनाते हैं, जबकि अन्य धीमे, महंगे जीनियस हैं जो जटिल उत्कृष्ट कृतियाँ (masterpieces) तैयार कर सकते हैं।

समस्या: "एक ही आकार सबके लिए" वाली गलती
अतीत में, जब लोग AI (जैसे लार्ज लैंग्वेज मॉडल्स) का उपयोग करना चाहते थे, तो वे अक्सर हर एक ऑर्डर के लिए बस "सबसे अच्छा" शेफ (सबसे शक्तिशाली AI) चुन लेते थे। लेकिन यह बर्बादी है। यदि कोई ग्राहक सिर्फ एक त्वरित सैंडविच चाहता है, तो उसे महंगे, धीमे जीनियस शेफ के पास भेजना पैसे और समय की बर्बादी है। यदि वे एक जटिल, 10-कोर्स मील चाहते हैं, तो तेज़ शेफ विफल हो सकता है।

यहीं पर LLM Routing काम आता है। यह एक स्मार्ट होस्ट (मेज़बान) की तरह है जो ग्राहक के ऑर्डर को देखता है और निर्णय लेता है: "ठीक है, इस सरल अनुरोध के लिए, इसे तेज़ शेफ के पास भेजें। इस कठिन अनुरोध के लिए, इसे जीनियस के पास भेजें।"

परीक्षण का पुराना तरीका: "उत्तर कुंजी" का जाल
अब तक, वैज्ञानिक इन "स्मार्ट होस्ट्स" का परीक्षण एक कठोर उत्तर कुंजी (answer key) का उपयोग करके करते थे। वे होस्ट को एक प्रश्न देते, देखते कि उसने किस शेफ को चुना, और फिर देखते कि क्या उस शेफ का उत्तर पहले से लिखे गए "सही" उत्तर से मेल खाता है।

  • दोष: वास्तविक जीवन बहुविकल्पीय परीक्षा नहीं है। कभी-कभी किसी प्रश्न के उत्तर देने के कई "सही" तरीके हो सकते हैं। कोई व्यक्ति छोटा और मज़ेदार उत्तर चाहता है; दूसरा लंबा और गंभीर उत्तर चाहता है। पुराने परीक्षण यह नहीं बता पाते थे कि क्या होस्ट ने वास्तव में उस शेफ को चुना जिसे ग्राहक सबसे अधिक पसंद करता।

नया समाधान: RouteJudge
लेखक RouteJudge पेश करते हैं, जो एक लाइव, ओपन-एयर फूड फेस्टिवल की तरह है।

  • यह कैसे काम करता है: एक कठोर उत्तर कुंजी की जाँच करने के बजाय, RouteJudge वास्तविक लोगों को भोजन चखने देता है।
  • सेटअप: जब कोई ग्राहक एक प्रश्न पूछता है, तो कई अलग-अलग "स्मार्ट होस्ट्स" (रूटिंग रणनीतियाँ) अपनी सिफारिशें करती हैं।
  • टेस्टिंग (स्वाद परीक्षण): सिस्टम दो सबसे अच्छी सिफारिशों को लेता है, शेफ और होस्ट के नाम छिपा देता है, और ग्राहक से पूछता है: "इन दोनों में से आपको कौन सा व्यंजन अधिक पसंद आया?"
  • स्कोर: यदि ग्राहक को व्यंजन पसंद आता है, तो सिस्टम उस होस्ट को श्रेय देता है जिसने उस शेफ की सिफारिश की थी। यह इस बारे में नहीं है कि किसने "परफेक्ट" उत्तर बनाया; यह इस बारे में है कि किसने वह चुनाव किया जिसे मानव वास्तव में पसंद करता है।

टूलकिट: ORBIT
इन स्मार्ट होस्ट्स को बनाना कठिन है क्योंकि हर कोई उन्हें अलग तरह से बनाता है। इसे ठीक करने के लिए, लेखकों ने ORBIT (ऑप्टिमल रूटिंग एंड बजटेड इन्फरेंस टूलबॉक्स) भी बनाया है।

  • उपमा: सोचिए कि ORBIT एक मानकीकृत "किचन किट" या एक सार्वभौमिक रेसिपी बुक है। यह प्रत्येक शोधकर्ता को समान मापने वाले कप, समान सामग्री सूची और समान खाना पकाने के निर्देश प्रदान करता है।
  • महत्व: यह सुनिश्चित करता है कि जब शोधकर्ता एक नया "स्मार्ट होस्ट" बनाते हैं, तो वे सभी एक ही नियमों के तहत काम कर रहे हों। यह उन्हें रसोई में (ऑफलाइन) एक नए होस्ट का परीक्षण करने और फिर उन्हें फूड फेस्टिवल (RouteJudge) में भेजने के लिए आसान बनाता है ताकि वे देख सकें कि वास्तविक ग्राहकों की प्रतिक्रिया क्या है।

उन्होंने क्या पाया (एक झलक)
यह पेपर इस नए सिस्टम के शुरुआती परिणाम दिखाता है:

  1. ऑफलाइन बनाम ऑनलाइन: एक होस्ट जो रसोई में (कागजी परीक्षणों में) बहुत अच्छा दिखता है, वह हमेशा फूड फेस्टिवल में नहीं जीतता। कभी-कभी, सरल और सस्ते रणनीतियाँ जिन्हें इंसान वास्तव में पसंद करते हैं, जटिल और महंगे विकल्पों को मात दे देती हैं।
  2. लागत मायने रखती है: सिस्टम दिखाता है कि "सबसे अच्छा" शेफ हमेशा सबसे महंगा नहीं होता है। स्मार्टेस्ट होस्ट वह है जो लागत, गति और ग्राहक वास्तव में क्या चाहता है, के बीच संतुलन बनाता है।

सारांश में
यह पेपर AI प्रबंधकों (managers) को टेस्ट करने का एक नया तरीका बनाता है। यह पूछने के बजाय कि, "क्या उन्होंने सही उत्तर चुना?" यह पूछता है कि, "क्या उन्होंने वह उत्तर चुना जिसे मानव वास्तव में पसंद करता है?" यह इन प्रबंधकों को बनाने के लिए एक मानकीकृत टूलकिट (ORBIT) प्रदान करता है और उन्हें वास्तविक मानव प्राथमिकताओं के विरुद्ध टेस्ट करने के लिए एक लाइव प्लेटफॉर्म (RouteJudge) प्रदान करता है, जिससे यह सुनिश्चित होता है कि वास्तविक दुनिया में AI का उपयोग कुशलतापूर्वक और प्रभावी ढंग से किया जाए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →