← नवीनतम पेपर
🤖 machine learning

The Routing Plateau: Understanding and Breaking the Accuracy Limits of LLM Routers

यह शोध पत्र एक "रूटिंग प्लेटो" (routing plateau) की पहचान करता है जहाँ विविध LLM रूटिंग विधियाँ एक समान, उप-इष्टतम सटीकता पर अभिसरित हो जाती हैं क्योंकि एक पूर्वानुमान क्षमता संबंधी बाधा (predictability bottleneck) मौजूद है जो इंस्टेंस-विशिष्ट संकेतों के बजाय वैश्विक रुझानों को प्राथमिकता देती है, और यह सुझाव देता है कि इन सीमाओं को पार करने के लिए बड़े डेटासेट, मजबूत एनकोडर और एंड-टू-एंड फाइन-ट्यूनिंग महत्वपूर्ण हैं।

मूल लेखक: Yifan Lu, Qiyue Zhang, Shenrun Zhang, Zhibo Yu, Zhuang Wang, Hanjie Chen, Jiarong Xing

प्रकाशित 2026-06-09
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yifan Lu, Qiyue Zhang, Shenrun Zhang, Zhibo Yu, Zhuang Wang, Hanjie Chen, Jiarong Xing

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक व्यस्त रेस्टोरेंट चला रहे हैं जिसमें शेफ का एक मेनू है, जो एक तेज़, किफायती लाइन कुक से लेकर एक विश्व प्रसिद्ध, महंगे सेलिब्रिटी शेफ तक फैला हुआ है। आपका लक्ष्य हर ग्राहक को एक बेहतरीन व्यंजन परोसना है जबकि लागत को कम रखना है। ऐसा करने के लिए, आप एक मेट्र डी' (maitre d') (रौटर) को काम पर रखते हैं जिसका काम यह देखना है कि प्रत्येक ग्राहक का ऑर्डर क्या है और फिर यह तय करना है कि किस शेफ को खाना बनाना चाहिए।

यदि ऑर्डर सरल है (जैसे "ग्रिल्ड चीज़"), तो मेट्र डी' इसे लाइन कुक के पास भेज देता है। यदि यह जटिल है (जैसे "एक 12-कोर्स मॉलिक्यूलर गैस्ट्रोनॉमी टेस्टिंग"), तो वे इसे सेलिब्रिटी शेफ के पास भेज देते हैं।

यह शोध करता है कि इन डिजिटल "मेट्र डी'ज़" ने वास्तव में बड़े भाषा मॉडल (LLMs) को प्रबंधित करने में अपना काम कितनी अच्छी तरह से किया है।

बड़ी खोज: "ट्रैफिक जाम" (द रूटिंग प्लेटो)

शोधकर्ताओं ने 21 अलग-अलग प्रकार के मेट्र डी'ज़ (रूटिंग विधियों) का 5 अलग-अलग रेस्टोरेंट परिदृश्यों (बेंचमार्क) में परीक्षण किया। उन्हें उम्मीद थी कि उन्हें एक स्पष्ट विजेता दिखाई देगा: कुछ मेट्र डी' अन्य की तुलना में बहुत बेहतर होने चाहिए, है ना?

आश्चर्यजनक रूप से, उन्हें एक "ट्रैफिक जाम" मिला।

चाहे मेट्र डी' कितना भी शानदार क्यों न हो—चाहे वे जटिल AI का उपयोग कर रहे हों, सरल गणित का, या डीप लर्निंग का—वे सभी एक ही प्रदर्शन सीमा में फंस गए।

  • छत (The Ceiling): सबसे अच्छा मेट्र डी भी ऑर्डर को लगभग 80-90% बार सही कर पाता है।
  • अंतराल (The Gap): एक "परफेक्ट मेट्र डी'" है (जिसे ओरेकल कहा जाता है) जो शेफ द्वारा खाना बनाने से पहले ही उत्तर जानता है। यह पूर्ण संस्करण लगभग 100% बार सही होता है।
  • वास्तविकता: सभी वास्तविक दुनिया के मेट्र डी' प्रदर्शन के एक संकीर्ण बैंड में फंसे हुए हैं, जो पूर्ण संस्करण से बहुत नीचे है। इससे कोई फर्क नहीं पड़ता कि आप एक फैंसी नए एल्गोरिदम का उपयोग करते हैं या एक साधारण "पिछली बार जब हमने इसे देखा था उसे देखने" वाले तरीके (kNN) का; वे सभी एक ही स्थान पर समाप्त होते हैं।

वे क्यों फंसे हुए हैं? "जनरलिस्ट" का जाल

पेपर बताता है कि ये मेट्र डी' पूर्वानुमेयता के अवरोध (predictability bottleneck) से जूझ रहे हैं।

कल्पना कीजिए कि मेट्र डी' अनुमान लगाने की कोशिश कर रहा है कि कौन सा शेफ सफल होगा। किसी विशिष्ट ऑर्डर के लिए विशिष्ट सामग्रियों और विशिष्ट शेफ के मूड को बारीकी से देखने के बजाय, वे सामान्य सांख्यिकी को देख रहे हैं।

  • वे सोचते हैं: "शेफ A आमतौर पर कुल मिलाकर सबसे अच्छा होता है, इसलिए मैं सब कुछ शेफ A को भेज दूंगा।"
  • वे सोचते हैं: "शेफ B आमतौर पर बुरा होता है, इसलिए मैं कभी भी कुछ भी शेफ B को नहीं भेजूँगा।"

समस्या: कभी-कभी, "आमतौर पर बुरा" होने वाला शेफ वास्तव में एक बहुत ही विशिष्ट, अजीब सामग्री को संभालने के लिए एकमात्र व्यक्ति होता है जो एक विशिष्ट ऑर्डर में होती है। क्योंकि मेट्र डी' केवल "औसत" प्रदर्शन को देख रहा है, वह इन विशेष मामलों को चूक जाता है। वे आसान ऑर्डर्स को सही करते हैं, लेकिन वे सभी कठिन, पेचीदा ऑर्डर्स पर बिल्कुल एक ही तरह से विफल होते हैं।

"एरर स्वैप" (त्रुटि विनिमय) की घटना

शोधकर्ताओं ने पाया कि विभिन्न मेट्र डी' अलग-अलग निर्णय लेते हैं। एक मेट्र डी कठिन ऑर्डर को शेफ C को भेज सकता है, जबकि दूसरा उसे शेफ D को भेज सकता है।

  • पकड़: जब एक मेट्र डी एक ऑर्डर को सही करता है जिसे दूसरे ने मिस कर दिया था, तो दूसरा मेट्र डी एक अलग ऑर्डर को सही करता है जिसे पहले वाले ने मिस किया था।
  • परिणाम: उनकी गलतियाँ एक-दूसरे को रद्द कर देती हैं। यह जार में जेलीबीन की संख्या का अनुमान लगाने वाले लोगों के समूह जैसा है; कुछ उच्च अनुमान लगाते हैं, कुछ कम, लेकिन समूह का औसत व्यक्तिगत अनुमानों से काफी बेहतर नहीं होता है। वे केवल त्रुटियों का आदान-प्रदान कर रहे हैं, वास्तव में कुल स्कोर में सुधार नहीं कर रहे हैं।

इस ट्रैफिक जाम को कैसे तोड़ें

पेपर पूछता है: "क्या हम इन मेट्र डी'ज़ को बेहतर प्रदर्शन करने के लिए प्रेरित कर सकते हैं?" उन्होंने यह देखने के लिए तीन लीवरों का परीक्षण किया कि क्या वे प्रदर्शन को ट्रैफिक जाम से आगे धकेल सकते हैं:

  1. अधिक प्रशिक्षण डेटा (अधिक अभ्यास): उन्होंने मेट्र डी को 10 गुना अधिक अभ्यास ऑर्डर दिए (30,000 से बढ़कर 300,000)।
  2. बेहतर आँखें (मजबूत एनकोडर्स): उन्होंने मेट्र डी को बेहतर चश्मा दिया (बड़े, अधिक शक्तिशाली AI मॉडल) ताकि वे ग्राहक के ऑर्डर को अधिक स्पष्ट रूप से पढ़ सकें।
  3. अनुकूलित प्रशिक्षण (एंड-टू-एंड फाइन-ट्यूनिंग): केवल मेनू को याद करने के बजाय, उन्होंने मेट्र डी को विशेष रूप से ऑर्डर्स को शेफ के साथ मिलाने के लिए अपनी मस्तिष्क संरचना को समायोजित करके सीखना सिखाया।

परिणाम:
जब उन्होंने तीनों रणनीतियों को मिलाया, तो मेट्र डी' बेहतर हुए! उन्होंने अपनी सटीकता में लगभग 2.13 प्रतिशत अंक का सुधार किया।

  • अच्छी खबर: यह एक वास्तविक सुधार है। इसने वास्तविक मेट्र डी और पूर्ण मेट्र डी के बीच के अंतर को लगभग 14.6% तक कम कर दिया।
  • बुरी खबर: वे अभी भी पूर्ण स्तर पर नहीं हैं। अभी भी एक बड़ा अंतर बाकी है।

मुख्य निष्कर्ष

पेपर निष्कर्ष निकालता है कि AI मॉडल को रूट करने के वर्तमान तरीके एक दीवार से टकरा गए हैं। वे "औसत" पैटर्न को पहचानने में बहुत अच्छे हैं लेकिन व्यक्तिगत अनुरोधों के अद्वितीय, पेचीदा विवरणों को पकड़ने में बहुत खराब हैं।

अगली पीढ़ी के बेहतर सिस्टम बनाने के लिए, हम केवल मौजूदा एल्गोरिदम को थोड़ा बदलकर काम नहीं चला सकते। हमें आवश्यकता है:

  • समृद्ध डेटा जो सिस्टम को विशिष्ट, कठिन मामलों के बारे में सिखाए।
  • अनुरोधों के "सामग्री" को देखने के नए तरीके, न कि केवल अनुरोध के सामान्य प्रकार को।
  • ऐसे सिस्टम जो एक-एक करके शेफ का निर्णय लेने के बजाय, पूरे पूल को एक साथ देख सकें।

तब तक, हमारे डिजिटल मेट्र डी' ट्रैफिक जाम में फंसे रहेंगे, एक अच्छा काम करेंगे लेकिन पूर्णता तक पहुँचने में असमर्थ होंगे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →