← नवीनतम पेपर
🤖 AI

Pandora's AI Model Routing Box: Efficient Allocation with Costly Value Estimation

यह शोध पत्र "पेंडोराज़ राउटर" (Pandora's Router) प्रस्तुत करता है, जो एक ऐसा ढांचा है जो विषम विशेषज्ञों के बीच एआई (AI) प्रश्नों को कुशलतापूर्वक रूट करने के लिए शास्त्रीय पेंडोराज़ बॉक्स समस्या को लागू करता है, जिससे मूल्य अनुमान की लागत और आवंटन गुणवत्ता में संभावित लाभ के बीच इष्टतम संतुलन बनाकर यह प्रदर्शित किया जाता है कि यह दृष्टिकोण महंगे एस्टिमेटर के उपयोग को काफी कम करते हुए व्यापक अनुमान प्रदर्शन के बराबर प्रदर्शन करता है।

मूल लेखक: Adam Fisch, Shubhendu Trivedi, Fantine Huot, William W. Cohen, Michael Kaisers, Mirella Lapata, Kate Larson, Jacob Eisenstein

प्रकाशित 2026-08-25
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Adam Fisch, Shubhendu Trivedi, Fantine Huot, William W. Cohen, Michael Kaisers, Mirella Lapata, Kate Larson, Jacob Eisenstein

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आर्टिफिशियल इंटेलिजेंस के तेजी से फैलते परिदृश्य में, एक नई चुनौती उभरी है जो स्मार्ट मशीनें बनाने के बारे में कम और उन्हें समझदारी से प्रबंधित करने के बारे में अधिक है। आज, संगठन हर समस्या को हल करने के लिए एक एकल, अखंड मस्तिष्क पर निर्भर नहीं हैं। इसके बजाय, वे विशिष्ट मॉडलों के एक विविध पारिस्थितिकी तंत्र को तैनात करते हैं: कुछ छोटे, तेज़ और सस्ते हैं, जिन्हें सरल कार्यों के लिए डिज़ाइन किया गया है; अन्य विशाल, धीमे और महंगे हैं, जो जटिल तर्क या गहन विश्लेषण के लिए आरक्षित हैं। ऐसे मॉडल भी हैं जो बाहरी उपकरणों, जैसे कि सर्च इंजन या विशेष डेटाबेस से लैस हैं, जो सटीकता में सुधार कर सकते हैं लेकिन अपने स्वयं के मूल्य टैग भी जोड़ते हैं। इन प्रणालियों को चलाने वाले किसी भी व्यक्ति के लिए केंद्रीय प्रश्न यह है कि किसी विशिष्ट कार्य के लिए किस उपकरण का उपयोग करने का निर्णय कैसे लिया जाए। यदि आप एक विशाल, महंगे मॉडल को एक साधारण क्वेरी भेजते हैं, तो आप पैसा बर्बाद करते हैं। यदि आप एक सस्ते, सरल मॉडल को एक कठिन, सूक्ष्म समस्या भेजते हैं, तो आपको एक खराब उत्तर मिलता है। लक्ष्य हर अनुरोध को उस विशेषज्ञ के पास भेजना है जिसके सफल होने की संभावना सबसे अधिक हो और लागत भी सबसे कम हो।

हालाँकि, यह निर्णय लेना मुफ्त नहीं है। यह जानने के लिए कि किसी दिए गए प्रश्न के लिए कौन सा मॉडल सबसे अच्छा है, एक प्रणाली को पहले यह अनुमान लगाना होगा कि प्रत्येक मॉडल द्वारा प्रदान किए जाने वाले उत्तर की गुणवत्ता क्या होगी। यह अनुमान लगाने की प्रक्रिया स्वयं दो प्रकार की होती है। एक "सस्ता" अनुमान सामान्य पैटर्न के आधार पर प्रश्न को देखकर अनुमान लगा सकता है, जो तेज़ है लेकिन अक्सर शोर भरा और अविश्वसनीय होता है। एक "महंगा" अनुमान वास्तव में कार्य के एक आंशिक संस्करण को चला सकता है या सटीक भविष्यवाणी प्राप्त करने के लिए एक अधिक शक्तिशाली मॉडल से परामर्श कर सकता है, लेकिन इसमें समय और पैसा लगता है। यह दुविधा एक क्लासिक ट्रेडऑफ़ है: क्या आप अपना चुनाव करने से पहले एक बेहतर अनुमान प्राप्त करने के लिए भुगतान करते हैं, या आप केवल उस सस्ती जानकारी के आधार पर अनुमान लगाते जो आपके पास पहले से है? यदि आप बहुत बार भुगतान करते हैं, तो जांच करने की लागत आपकी बचत को खा जाती है। यदि आप बहुत कम बार जांच करते हैं, तो आप गलत रूटिंग निर्णय लेते हैं।

Google DeepMind के शोधकर्ताओं ने इस समस्या को अर्थशास्त्र के एक प्रसिद्ध पहेली "पंडोरा बॉक्स" (Pandora's Box) के रूप में फ्रेम करके इसका समाधान निकाला है। कल्पना कीजिए कि एक व्यक्ति के सामने कई सीलबंद बॉक्स रखे हैं, जिनमें से प्रत्येक में अज्ञात मूल्य का छिपा हुआ पुरस्कार है। व्यक्ति को पुरस्कारों का सामान्य वितरण पता है लेकिन किसी भी एक बॉक्स की विशिष्ट सामग्री का पता नहीं है। बॉक्स के अंदर क्या है यह देखने के लिए, उसे बॉक्स खोलने के लिए एक शुल्क देना होगा। लक्ष्य उस पुरस्कार का अधिकतम मूल्य प्राप्त करना है जो उसे अंततः मिलता है, घटा हुआ कुल शुल्क जो बॉक्स खोलने में खर्च हुआ है। दशकों पहले खोजा गया इष्टतम रणनीति (optimal strategy), प्रत्येक बॉक्स के लिए एक "रिजर्वेशन प्राइस" (reservation price) की गणना करने में शामिल है—एक विशिष्ट मूल्य सीमा जो व्यक्ति को बताती है कि क्या बॉक्स खोलने का संभावित लाभ शुल्क की लागत से अधिक है। यदि वर्तमान सबसे अच्छा विकल्प पहले से ही इस सीमा से बेहतर है, तो पूरे बॉक्स को छोड़ देना ही समझदारी है।

शोधकर्ताओं ने इस तर्क को AI मॉडल रूटिंग पर लागू किया, प्रत्येक उपलब्ध AI मॉडल को एक सीलबंद बॉक्स के रूप में माना। "सस्ता" मूल्य अनुमान प्रारंभिक अनुमान है, जबकि "महंगा" अनुमान बॉक्स को खोलकर वास्तविक क्षमता को देखने की क्रिया है। उन्होंने एक प्रणाली विकसित की जिसे वे "पंडोरा राउटर" (Pandora's Router) कहते हैं, जो प्रत्येक मॉडल और प्रत्येक आने वाले प्रश्न के लिए रिजर्वेशन प्राइस की गणना करता है। प्रणाली गतिशील रूप से निर्णय लेती है कि क्या अधिक सटीक जांच चलाने की अतिरिक्त लागत जायज है। यदि सस्ता अनुमान यह सुझाव देता है कि एक मॉडल सबसे अच्छा होने की संभावना है, या यदि जांच की लागत बहुत अधिक है, तो राउटर महंगे चेक को छोड़ देता है और एक विकल्प चुन लेता है। यदि सस्ता अनुमान अनिश्चित है और जांच की लागत कम है, तो राउटर बेहतर अनुमान प्राप्त करने के लिए भुगतान करता है।

इस दृष्टिकोण का परीक्षण करने के लिए, टीम ने तीन बहुत अलग वास्तविक दुनिया के परिदृश्यों में प्रयोग चलाए। पहला गणितीय तर्क से संबंधित था, जहाँ मॉडलों को एक तेज़, बुनियादी सॉल्वर और एक धीमे, अधिक शक्तिशाली सॉल्वर के बीच चयन करना था जो विस्तारित चरण-दर-चरण तर्क कर सकता था। दूसरा परिदृश्य 'रिट्रीवल-ऑगमेंटेड जनरेशन' (retrieval-augmented generation) पर केंद्रित था, जहाँ प्रणाली को यह तय करना था कि क्या उसे एक ऐसे मॉडल का उपयोग करना चाहिए जो केवल अपने आंतरिक ज्ञान पर निर्भर करता है या एक ऐसे मॉडल का जो पहले दस्तावेजों के डेटाबेस को खोजने के लिए भुगतान करता है। तीसरा एक बड़े पैमाने का बेंचमार्क था जिसमें सौ से अधिक विभिन्न भाषा मॉडल शामिल थे, जो छोटे से लेकर विशाल तक थे, जहाँ प्रणाली को सामान्य ज्ञान के प्रश्नों की एक विस्तृत श्रृंखला के लिए सही मॉडल चुनना था।

परिणामों ने दिखाया कि पंडोरा राउटर ने लागत और सटीकता के बीच के ट्रेडऑफ़ को सफलतापूर्वक संभाला। उन स्थितियों में जहाँ महंगा चेक चलाना सस्ता था, प्रणाली ने इसे बार-बार क्वेरी किया, जिससे प्रदर्शन लगभग उस प्रणाली के समान रहा जो हर बार हर मॉडल की जांच करती है। लेकिन जैसे-जैसे जांच की लागत बढ़ती गई, राउटर अधिक चयनात्मक होता गया, और जब सस्ता अनुमान पर्याप्त रूप से आत्मविश्वासी था, तो उसने महंगे चेक को छोड़ दिया। इसने सिस्टम को उच्च-गुणवत्ता वाले रूटिंग निर्णय बनाए रखने में मदद की और साथ ही बहुत कम पैसा खर्च किया। वास्तव में, तीनों डोमेन में, राउटर ने व्यापक जांच की गुणवत्ता के बराबर प्रदर्शन किया जबकि महंगे अनुमानों को बहुत कम बार क्वेरी किया, प्रभावी रूप से उस 'स्वीट स्पॉट' को खोजा जहाँ सूचना की लागत उस निर्णय के मूल्य के बराबर थी जिसे वह सक्षम करती है।

शोधकर्ताओं ने इस समस्या के एक अधिक विकेंद्रीकृत संस्करण की भी खोज की, जिसे उन्होंने "पंडोरा बिडर" (Pandora's Bidder) कहा। इस सेटअप में, एक केंद्रीय प्रबंधक द्वारा सभी निर्णय लेने के बजाय, व्यक्तिगत AI मॉडल स्वयं बोली लगाने वाले (bidders) के रूप में कार्य करते हैं। प्रत्येक मॉडल देखता है कि सबसे अच्छी प्रतिस्पर्धी पेशकश की कीमत क्या है और उसे यह तय करना होता है कि क्या वह काम जीतने के लिए अपने स्वयं के संसाधनों में निवेश करने के लिए स्व-मूल्यांकन (self-assessment) करेगा। यह एक ऐसे बाजार को दर्शाता है जहाँ विशेषज्ञ खुद तय करते हैं कि अनुबंध स्वीकार करने से पहले अपने स्वयं के अनुमानों को परिष्कृत करने में प्रयास करना सार्थक है या नहीं। अध्ययन में पाया गया कि जब प्रतिस्पर्धी अनुमान सटीक थे, तो इस विकेंद्रीकृत तर्क ने दक्षता में सुधार किया। हालाँकि, जब प्रतिस्पर्धी अनुमान शोर भरे या अविश्वसनीय थे, तो रणनीतिक मॉडल कभी-कभी अपने स्वयं के स्वार्थ में इस तरह से कार्य करते थे जिससे समग्र प्रणाली के प्रदर्शन को नुकसान पहुँचा, जो व्यक्तिगत लाभ और सामूहिक दक्षता के बीच उस तनाव को उजागर करता है जो केंद्रीकृत संस्करण में मौजूद नहीं है।

अंततः, यह कार्य प्रदर्शित करता है कि AI मॉडलों का मूल्यांकन कैसे किया जाए, यह स्वयं एक जटिल अनुकूलन समस्या (optimization problem) है। मूल्य अनुमान को एक मुफ्त या निश्चित चरण के बजाय एक महंगी गतिविधि के रूप में मानकर, शोधकर्ताओं ने एक ऐसा ढांचा तैयार किया जो AI के उपयोग की आर्थिक वास्तविकताओं के अनुकूल है। प्रणाली न तो सस्ते अनुमानों पर अंधविश्वास करती है और न ही महंगे अनुमानों के लिए अंधाधुंध भुगतान करती है; इसके बजाय, यह सटीक क्षण की गणना करती है जब अधिक जानने का मूल्य जानने की कीमत से अधिक होता है। यह दृष्टिकोण विषम (heterogeneous) AI प्रणालियों को प्रबंधित करने के लिए एक व्यावहारिक मार्ग प्रदान करता है, यह सुनिश्चित करता है कि अनावश्यक जांच पर संसाधनों को बर्बाद किए बिना सही काम के लिए सही उपकरण का उपयोग किया जाए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →