Online Pandora's Box for Contextual LLM Cascading
यह शोध पत्र आउटपुट-मध्यस्थता फीडबैक को मॉडल करने और आयाम-निर्भर संचयी रिग्रेट (cumulative regret) प्राप्त करने के लिए GMM अनुमान के साथ एक पैरामीट्रिक रिजर्वेशन इंडेक्स दृष्टिकोण का उपयोग करते हुए, आउटपुट-मध्यस्थता फीडबैक को मॉडल करके और एक पैरामीट्रिक रिजर्वेशन इंडेक्स दृष्टिकोण को UCB-शैली की कॉन्फिडेंस बाउंड्स के साथ नियोजित करके, लार्ज लैंग्वेज मॉडल (LLM) API को अनुकूल रूप से चुनने के लिए एक ऑनलाइन कॉन्टेक्स्टुअल पेंडोरा बॉक्स (Pandora's Box) फ्रेमवर्क प्रस्तावित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक कंपनी में मैनेजर हैं जिसे दैनिक समस्याओं की एक श्रृंखला को हल करने की आवश्यकता है। प्रत्येक समस्या को हल करने के लिए, आपके पास एक "टूलबॉक्स" है जिसमें कई अलग-अलग AI सहायक (APIs) शामिल हैं। कुछ सहायक सस्ते हैं लेकिन औसत दर्जे का उत्तर दे सकते हैं; कुछ महंगे हैं लेकिन आमतौर पर शानदार उत्तर देते हैं।
चुनौती यह है: आप तय कैसे करेंगे कि किस सहायक से पूछना है, और कब पूछना बंद करना है?
यदि आप केवल सस्ते वाले से पूछते हैं, तो आपको एक बुरा उत्तर मिल सकता है और उसे ठीक करने में समय बर्बाद हो सकता है। यदि आप तुरंत महंगे वाले से पूछते हैं, तो आप उन आसान समस्याओं के लिए पैसा बर्बाद करते हैं जिन्हें सस्ते वाले ने हल कर लिया होता। यदि आप सभी से पूछते हैं, तो आप दिवालिया हो जाएंगे।
यह शोध पत्र, जिसका शीर्षक "Online Pandora's Box for Contextual LLM Cascading" है, एलेक्जेंड्रे बेलोनी, यान चेन और येहुआ वे द्वारा लिखा गया है, इस सटीक समस्या को हल करने के लिए एक स्मार्ट, गणितीय रणनीति प्रस्तावित करता है। वे अपनी रणनीति को COSMOS कहते हैं।
यहाँ उनके विचार का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:
1. "पंडोरा बॉक्स" गेम में एक ट्विस्ट
क्लासिक "पंडोरा बॉक्स" कहानी में, आपके पास कई बॉक्स होते हैं। आप एक बॉक्स खोल सकते हैं यह देखने के लिए कि उसके अंदर क्या है (इनाम/रिवॉर्ड) और खोलने के शुल्क के रूप में एक फीस चुकाते हैं। आप सबसे अच्छा खजाना खोजने का प्रयास करते हैं जबकि खोलने के शुल्क पर कम से कम खर्च करते हैं।
इस पेपर में ट्विस्ट:
वास्तविक दुनिया में AI के मामले में, एक बॉक्स खोलने (एक AI से पूछने) का मतलब तुरंत यह जानना नहीं है कि उत्तर "अच्छा" है या नहीं।
- चरण 1 (क्वेरी/पूछताछ): आप एक AI से पूछते हैं। वह एक ड्राफ्ट उत्तर देता है और आपसे शुल्क लेता है। आप ड्राफ्ट देखते हैं, लेकिन अभी तक यह नहीं जानते कि वह वास्तव में ग्राहक की समस्या को हल करेगा या नहीं।
- चरण 2 (चयन): आपको अब तक एकत्र किए गए ड्राफ्टों में से एक को चुनना होगा और उसे ग्राहक को भेजना होगा। केवल तभी आपको पता चलेगा कि वह एक सफलता (इनाम) थी या विफलता।
यह पेचीदा है क्योंकि आप ड्राफ्ट देखने के लिए भुगतान कर रहे हैं, लेकिन आपको केवल उस एक के लिए क्रेडिट मिलता है जिसे आप अंततः चुनते हैं।
2. "रिजर्वेशन इंडेक्स" (जादुई संख्या)
लेखक सुझाव देते हैं कि हर संभव उत्तर को याद करने (जो असंभव है) के बजाय, आपको प्रत्येक विशिष्ट स्थिति के लिए प्रत्येक AI को एक "रिजर्वेशन इंडेक्स" देना चाहिए।
इस इंडेक्स को एक "Worth-It Score" (कितना सार्थक है) के रूप में सोचें।
- यदि "AI सहायक A" के लिए स्कोर उच्च है, तो इसका अर्थ है: "भले ही सहायक A एक औसत दर्जे का उत्तर दे, फिर भी उन्हें पूछना सार्थक है क्योंकि वे आमतौर पर विश्वसनीय होते हैं।"
- यदि स्कोर कम है, तो इसका अर्थ है: "जब आपके पास कोई अन्य विकल्प न हो, तब तक उनसे परेशान न हों।"
पेपर एक गणितीय नियम (जो एक प्रसिद्ध अर्थशास्त्री वीत्ज़मैन पर आधारित है) का उपयोग करके इस स्कोर की गणना करता है। नियम कहता है: पहले उस AI से पूछें जिसका स्कोर सबसे अधिक है। यदि उनके द्वारा दिया गया उत्तर अगले सबसे अच्छे AI के स्कोर से बेहतर है, तो रुक जाएं और वह उत्तर चुनें। यदि नहीं, तो अगले वाले से पूछें।
3. सीखने की समस्या: "स्कोर का अनुमान लगाना"
समस्या यह है कि शुरुआत में, मैनेजर को वास्तविक "Worth-It Scores" का पता नहीं होता है। उन्हें काम करते हुए इन्हें सीखना पड़ता है।
- वे ठीक से नहीं जानते कि एक विशेष प्रकार के प्रश्न के लिए एक AI कितना अच्छा है।
- वे यह भी नहीं जानते कि एक AI कितना शुल्क लेगा (क्योंकि लागत इस बात पर निर्भर करती है कि उत्तर कितना लंबा है)।
लेखकों का समाधान एक लर्निंग एल्गोरिदम है जिसे COSMOS कहा जाता है। यह एक स्मार्ट खोजकर्ता (explorer) की तरह काम करता है:
- आशावाद (Optimism): यह मान लेता है कि स्कोर वास्तव में होने की तुलना में थोड़े बेहतर हैं। यह सिस्टम को विभिन्न AI को आज़माने के लिए प्रोत्साहित करता है ताकि यह देखा जा सके कि वे वास्तव में कितने अच्छे हैं (एक्सप्लोरेशन)।
- सुधार (Correction): जैसे-जैसे सिस्टम अधिक प्रश्न पूछता है और परिणाम देखता है, यह अपने "Worth-It Scores" को अधिक सटीक बनाने के लिए उन्हें अपडेट करता है।
- दो-भाग वाली लर्निंग:
- यह सीखता है कि अंतिम उत्तर की गुणवत्ता (इनाम) की भविष्यवाणी कैसे की जाए।
- यह प्रत्येक AI के लिए रिजर्वेशन इंडेक्स (कितना सार्थक होने की संभावना है) को सीखता है।
4. परिणाम: पैसा और समय बचाना
यह पेपर गणितीय रूप से सिद्ध करता है कि यह रणनीति बहुत अच्छी तरह से काम करती है। लंबे समय में (मान लीजिए, दैनिक अनुरोधों के एक वर्ष में), कुल "रिग्रेट" (वह पैसा और गुणवत्ता जो एक आदर्श विकल्प न चुनने के कारण खो दी गई) बहुत धीरे-धीरे बढ़ता है।
विशेष रूप से, वे दिखाते हैं कि उनकी विधि इतनी कुशल है कि वह बिना लागत को अनियंत्रित किए हजारों अनुरोधों को संभाल सकती है। यह इनके बीच का सही संतुलन (sweet spot) ढूंढ लेती है:
- बहुत सस्ता: खराब उत्तर मिलना जिन्हें ठीक करने की आवश्यकता होती है।
- बहुत महंगा: आसान कार्यों पर पैसा बर्बाद करना।
- बिल्हीं सही: सही कीमत पर, सही समय पर, सही AI से पूछना।
सारांश
कल्पना कीजिए कि आप एक केस को सुलझाने के लिए जासूसों की एक टीम को काम पर रख रहे हैं।
- पुराना तरीका: या तो आप तुरंत सबसे महंगे जासूस को काम पर रखते हैं (साधारण सुरागों पर पैसा बर्बाद करना) या सबसे सस्ते जासूस को (एक बुरा समाधान जोखिम में डालना)।
- COSMOS का तरीका: आपके पास जासूसों की एक सूची है। प्रत्येक सुराग के लिए, आपके पास एक "पूर्वाभास" (रिजर्वेशन इंडेक्स) है कि कौन सा जासूस बुलाने लायक है। आप उस जासूस को बुलाते हैं जिसके पास सबसे अच्छा पूर्वाभास है। यदि उनकी रिपोर्ट पर्याप्त अच्छी है, तो आप रुक जाते हैं। यदि नहीं, तो आप सूची में अगले व्यक्ति को बुलाते हैं।
- जादू: सिस्टम हर दिन स्मार्ट होता जाता है। यह सीखता है कि कौन से जासूस वास्तव में किस प्रकार के सुरागों के लिए अच्छे हैं, जिससे यह सुनिश्चित होता है कि आप कभी भी एक खराब रिपोर्ट के लिए भुगतान न करें और कभी भी एक बेहतरीन रिपोर्ट को हाथ से न जाने दें।
लेखकों का मुख्य दावा यह है कि इस विशिष्ट गणितीय ढांचे का उपयोग करके, कंपनियां AI टूल्स का बहुत अधिक कुशलता से उपयोग कर सकती हैं, जिससे उच्च गुणवत्ता बनाए रखते हुए महत्वपूर्ण धन की बचत होती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।