← नवीनतम पेपर
💬 NLP

Expected Reward Prediction, with Applications to Model Routing

यह शोध पत्र एक ऐसी विधि प्रस्तुत करता है जो किसी प्रतिक्रिया को उत्पन्न करने से पहले, एक दिए गए प्रॉम्प्ट पर एक LLM द्वारा प्राप्त किए जाने वाले अपेक्षित रिवॉर्ड (reward) की भविष्यवाणी करती है, यह प्रदर्शित करते हुए कि यह सरल भविष्यवाणी एक कुशल और विस्तार योग्य मॉडल रूटिंग प्रोटोकॉल को सक्षम बनाती है जो रिवॉर्ड और कम्प्यूटेशनल लागत के बीच संतुलन को अनुकूलित करके श्रेणी-आधारित बेसलाइन से बेहतर प्रदर्शन करती है।

मूल लेखक: Kenan Hasanaliyev, Silas Alberti, Jenny Hamer, Dheeraj Rajagopal, Kevin Robinson, Jasper Snoek, Victor Veitch, Alexander Nicholas D'Amour

प्रकाशित 2026-03-24
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kenan Hasanaliyev, Silas Alberti, Jenny Hamer, Dheeraj Rajagopal, Kevin Robinson, Jasper Snoek, Victor Veitch, Alexander Nicholas D'Amour

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, हाई-टेक कॉल सेंटर के मैनेजर हैं। आपके पास AI असिस्टेंट्स (Large Language Models) की एक टीम है जिनके पास अलग-अलग कौशल स्तर और अलग-अलग "प्रति घंटा दर" (hourly rates) हैं। कुछ जूनियर असिस्टेंट हैं जो सस्ते और तेज़ हैं लेकिन गलतियाँ कर सकते हैं। अन्य सीनियर एक्सपर्ट्स हैं जो धीमे और महंगे हैं लेकिन आमतौर पर काम सही करते हैं।

हर बार जब किसी ग्राहक का सवाल (एक प्रॉम्प्ट) आता है, तो आपको यह तय करना होता है: मुझे यह कॉल किस असिस्टेंट को भेजनी चाहिए?

पुराना तरीका: अंदाज़ा लगाना या सब कुछ चेक करना

परंपरागत रूप से, यह निर्णय लेने के लिए, आपको शायद:

  1. सवाल की श्रेणी के आधार पर अंदाज़ा लगाना पड़ता था (जैसे, "गणित के सवालों को गणित के विशेषज्ञ के पास भेजें")।
  2. या, आपको हर एक असिस्टेंट से उत्तर लिखने के लिए कहना पड़ता था, उन सभी के उत्तरों को पढ़ना पड़ता था, सबसे अच्छा वाला चुनना पड़ता था, और उस काम के लिए भुगतान करना पड़ता था जिसका आपने उपयोग भी नहीं किया। यह अविश्वसनीय रूप से बर्बादी भरा और धीमा था।

नया तरीका: "क्रिस्टल बॉल" (Expected Reward Prediction)

यह पेपर एक चतुर तकनीक पेश करता है जिसे Expected Reward Prediction (ERP) कहा जाता है। इसे एक क्रिस्टल बॉल की तरह समझें जो किसी भी असिस्टेंट द्वारा उत्तर देने से पहले ही ग्राहक के सवाल को देखकर यह अनुमान लगा सकती है कि वह विशिष्ट असिस्टेंट कैसा प्रदर्शन करेगा।

यह कैसे काम करता है, इसके सरल चरण यहाँ दिए गए हैं:

1. "स्कोरकार्ड" (Reward Models)

सबसे पहले, कल्पना करें कि आपके पास एक सख्त जज (एक Reward Model) है जो बातचीत को सुनता है और उत्तर कितना मददगार है, इसके आधार पर 0 से 100 तक का स्कोर देता है।

  • पुरानी समस्या: जज उत्तर लिखे जाने के बाद उसे स्कोर देता है।
  • नई अंतर्दृष्टि: लेखकों ने महसूस किया कि जज की स्कोरिंग प्रणाली इतनी सुसंगत है कि आप केवल सवाल को देखकर यह अनुमान लगा सकते हैं कि एक असिस्टेंट औसतन कितना स्कोर प्राप्त करेगा।

2. "सरल गणित" (Linear Probes)

आप सोच सकते हैं कि इसके लिए एक बहुत ही जटिल AI मस्तिष्क की आवश्यकता होगी। आश्चर्यजनक रूप से, लेखकों ने पाया कि एक बहुत ही सरल गणितीय सूत्र (एक लीनियर मॉडल) पूरी तरह से काम करता है।

  • उपमा: मान लीजिए कि आपके पास सवाल का एक मानचित्र (एक "एम्बेडिंग") है। आप बस उस मानचित्र पर एक सीधी रेखा खींचते हैं। वह रेखा जहाँ टकराती है, वह बताती है, "यदि असिस्टेंट A उत्तर देता है, तो वे संभवतः 85/100 स्कोर करेंगे। यदि असिस्टेंट B उत्तर देता है, तो वे 40/100 स्कोर करेंगे।"
  • यह मौसम के पूर्वानुमान को देखने जैसा है। आपको यह जानने के लिए कि आपको छाते की आवश्यकता है या नहीं, हर एक बारिश की बूंद का सिमुलेशन करने की आवश्यकता नहीं है; आपको बस बैरोमीटर देखना है।

3. "स्मार्ट डिस्पैचर" (Model Routing)

अब, आपके पास आपकी क्रिस्टल बॉल है। जब कोई कॉल आती है:

  1. क्रिस्टल बॉल भविष्यवाणी करती है: "जूनियर असिस्टेंट 60 स्कोर करेगा। सीनियर एक्सपर्ट 95 स्कोर करेगा।"
  2. डिस्पैचर लागत की जाँच करता है: "जूनियर की लागत 1है।सीनियरकीलागत1 है। सीनियर की लागत 10 है।"
  3. निर्णय: यदि सवाल सरल है, तो क्रिस्टल बॉल कहती है कि जूनियर ठीक करेगा (स्कोर 80)। डिस्पैचर पैसे बचाने के लिए कॉल को जूनियर के पास भेज देता है। यदि सवाल कठिन है, तो क्रिस्टल बॉल कहती है कि जूनियर विफल हो जाएगा (स्कोर 20), इसलिए यह कॉल को सीनियर के पास भेज देता है।

यह एक बड़ी बात क्यों है?

  • यह तेज़ है: आपको यह जानने के लिए कि कौन सबसे अच्छा है, सभी से उत्तर जेनरेट करने की आवश्यकता नहीं है। आप बस एक त्वरित गणना करते हैं।
  • यह लचीला है: यदि आप कल एक नया असिस्टेंट रखते हैं, तो आप बस क्रिस्टल बॉल को सिखा सकते हैं कि वे आमतौर पर कैसा प्रदर्शन करते हैं। आपको पूरा सिस्टम फिर से प्रशिक्षित करने या उनकी तुलना आपस में करने की आवश्यकता नहीं है।
  • यह "कैटेगरी" नियम को मात देता है: कभी-कभी एक "गणित विशेषज्ञ" गणित के एक विशिष्ट प्रकार के सवाल में खराब हो सकता है, लेकिन एक "जनरलिस्ट" उसमें बहुत अच्छा हो सकता है। क्रिस्टल बॉल बारीकियों को देख लेती है; एक साधारण नियम जैसे "गणित को गणित विशेषज्ञ के पास भेजें" ऐसा नहीं कर पाता।

"Zooter" कनेक्शन

पेपर में "Zooter" नामक एक जटिल प्रणाली का उल्लेख है जो ऐसा ही कुछ करती है लेकिन इसे बनाना बहुत कठिन है। लेखक दिखाते हैं कि Zooter वास्तव में इसलिए काम करता है क्योंकि वह गुप्त रूप से बिल्कुल वही करने की कोशिश कर रहा है जो यह सरल क्रिस्टल बॉल करती है: अपेक्षित स्कोर (expected score) की भविष्यवाणी करना। इस सरल पद्धति का उपयोग करके, आप 10% प्रयास के साथ 90% लाभ प्राप्त करते हैं।

निष्कर्ष (The Bottom Line)

यह पेपर यह सिद्ध करता है कि हम किसी कार्य को करने के लिए AI कितना अच्छा होगा, यह केवल सवाल को पढ़कर ही अनुमान लगा सकते हैं, बिना AI के वास्तव में काम करने का इंतज़ार किए। यह हमें उच्च-गुणवत्ता वाले उत्तर प्राप्त करते हुए भारी मात्रा में पैसा और समय बचाने के लिए कार्यों को सही AI तक तुरंत रूट करने की अनुमति देता है।

संक्षेप में: पाँच शेफ से खाना बनाने के लिए पूछने के बजाय कि कौन सबसे अच्छा है, आप बस रेसिपी को देखते हैं और तुरंत जान जाते हैं कि उस विशिष्ट व्यंजन के लिए सही शेफ कौन सा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →