Multi-Armed Bandits With Machine Learning-Generated Surrogate Rewards
यह शोधपत्र मशीन लर्निंग-असिस्टेड अपर कॉन्फिडेंस बाउंड (MLA-UCB) एल्गोरिदम प्रस्तुत करता है, जो ऑफलाइन सहायक डेटा से पूर्व-प्रशिक्षित मशीन लर्निंग मॉडलों द्वारा उत्पन्न पक्षपाती सरोगेट रिवार्ड्स का लाभ उठाकर मल्टी-आर्म्ड बैंडिट समस्याओं में संचयी रिग्रेट (cumulative regret) को महत्वपूर्ण रूप से कम करता है और सरोगेट एवं वास्तविक रिवार्ड्स के बीच सहप्रसरण (covariance) के पूर्व ज्ञान की आवश्यकता के बिना भी एसिम्प्टोटिक ऑप्टिमैलिटी (asymptotic optimality) प्राप्त करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक फूड ट्रक के मैनेजर हैं जिसके पास पाँच अलग-अलग मेनू आइटम (जिन्हें हम "Arms" कहेंगे) हैं। आपको नहीं पता कि इनमें से सबसे लोकप्रिय कौन सा है। आपका लक्ष्य अगले कुछ महीनों में अधिक से अधिक आइटम बेचना है।
यह जानने के लिए, आपको उन्हें आज़माना होगा। लेकिन इसमें एक पेच है:
- Exploration (अन्वेषण): आपको यह देखने के लिए नए, अजीब आइटम्स को भी आज़माना होगा कि वे कैसे हैं।
- Exploitation (दोहन): आप उस आइटम को बेचना चाहते हैं जिसे आप अभी सबसे अच्छा मानते हैं ताकि पैसा कमाया जा सके।
यह Multi-Armed Bandit (MAB) समस्या है। यह वही गणित है जो नेटफ्लिक्स को फिल्में रिकमेंड करने या डॉक्टर द्वारा नई दवाओं के परीक्षण करने के पीछे काम करता है।
पुराना तरीका: "अनुमान और जाँच" (Guess and Check)
पारंपरिक रूप से, आप किसी मेनू आइटम के बारे में तभी जान पाते हैं जब आप वास्तव में उसे बेचते हैं। यदि आप जानना चाहते हैं कि क्या "स्पाइसी टैकोस" लोकप्रिय हैं, तो आपको ग्राहकों को उन्हें परोसना होगा और उनकी प्रतिक्रिया का इंतज़ार करना होगा। यह धीमा, महंगा और जोखिम भरा है। यदि आप एक खराब टैको परोसते हैं, तो आप एक ग्राहक खो देते हैं।
नया विचार: "क्रिस्टल बॉल" (Surrogate Rewards)
यह पेपर एक नई सुपरपावर पेश करता है: Machine Learning (ML) Surrogate Rewards।
कल्पना कीजिए कि आपके पास एक क्रिस्टल बॉल (एक AI मॉडल) है जो किसी ग्राहक की प्रोफाइल (आयु, स्थान, पिछले ऑर्डर) के आधार पर यह भविष्यवाणी कर सकता है कि उन्हें एक टैको कितना पसंद आएगा, इससे पहले कि आप उन्हें वास्तव में परोसें।
- पेच: क्रिस्टल बॉल एकदम सटीक नहीं है। यह पक्षपाती (biased) हो सकती है। शायद यह सोचता है कि "स्पाइसी टैकोस" हर किसी के लिए अद्भुत हैं, जबकि वास्तव में, केवल आधे लोग ही उन्हें पसंद करते हैं। यह रैंकिंग (यह सोचने में कि आइटम A नंबर 1 है जबकि आइटम B वास्तव में नंबर 1 है) के मामले में भी पूरी तरह गलत हो सकता है।
- अवसर: भले ही क्रिस्टल बॉल गलत हो, लेकिन यह वास्तविकता के साथ सह-संबंधित (correlated) हो सकती है। यदि बॉल कहती है कि "स्पाइसी टैकोस" लोकप्रिय हैं, तो वे शायद कुछ हद तक लोकप्रिय हैं। यह रैंडम शोर (noise) नहीं है; यह एक शोर भरा संकेत (noisy signal) है।
सिर्फ क्रिस्टल बॉल का उपयोग करने की समस्या
यदि आप आँख बंद करके क्रिस्टल बॉल का पालन करते हैं, तो आप गलत आइटम चुनकर हमेशा के लिए फंस सकते हैं क्योंकि बॉल पक्षपाती हो सकती है।
यदि आप क्रिस्टल बॉल को अनदेखा करते हैं और केवल वास्तविक बिक्री डेटा का उपयोग करते हैं, तो आप बहुत धीमी गति से आगे बढ़ रहे होंगे।
समाधान: MLA-UCB (स्मार्ट मैनेजर)
लेखकों ने MLA-UCB (Machine Learning-Assisted Upper Confidence Bound) नामक एक एल्गोरिदम बनाया है। इसे एक स्मार्ट मैनेजर के रूप में समझें जो क्रिस्टल बॉल से धोखा खाए बिना उसका उपयोग करना जानता है।
यहाँ स्मार्ट मैनेजर कैसे काम करता है:
"डबल-चेक" सिस्टम:
मैनेजर के पास हर आइटम के लिए जानकारी के दो स्रोत हैं:- क्रिस्टल बॉल (Offline Data): दिन शुरू होने से पहले की गई भविष्यवाणियों का एक विशाल ढेर।
- वास्तविक बिक्री (Online Data): जैसे-जैसे दिन बीतता है, ग्राहकों से मिलने वाला वास्तविक फीडबैक।
"बायस करेक्शन" (पक्षपात सुधार) का तरीका:
मैनेजर देखता है कि क्रिस्टल बॉल लगातार एक निश्चित मात्रा में गलत (bias) होती है। लेकिन, क्योंकि क्रिस्टल बॉल और वास्तविक बिक्री एक साथ चलती हैं (correlation), मैनेजर क्रिस्टल बॉल का उपयोग वास्तविक बिक्री पर फोकस को तेज करने के लिए कर सकता है।- उपमा: कल्पना कीजिए कि एक शोर भरे कमरे में फुसफुसाहट सुनने की कोशिश कर रहे हैं। क्रिस्टल बॉल आपके दोस्त की तरह है जो आपके कान में वही बात फुसफुसा रहा है। भले ही आपका दोस्त थोड़ा बेसुरा हो, अपने स्वयं के कानों और अपने दोस्त की आवाज़ दोनों को सुनने से आपको संदेश को केवल अपने कानों के मुकाबले बहुत तेज़ी से और अधिक स्पष्टता से समझने में मदद मिलती है।
"कॉन्फिडेंस" मीटर:
एल्गोरिदम प्रत्येक आइटम के लिए एक "कॉन्फिडेंस स्कोर" की गणना करता है।- यदि क्रिस्टल बॉल और वास्तविक बिक्री सहमत होते हैं, तो आत्मविश्वास बढ़ जाता है, और मैनेजर उस आइटम को टेस्ट करने में समय बर्बाद करना बंद कर देता है।
- यदि वे असहमत होते हैं, तो मैनेजर को पता चल जाता है कि क्रिस्टल बॉल उस विशिष्ट आइटम के लिए पक्षपाती है, और वह वास्तविक बिक्री पर अधिक भरोसा करता है, लेकिन फिर भी डेटा के "शोर" (noise) को कम करने के लिए क्रिस्टल बॉल का उपयोग करता है।
यह एक बड़ी बात क्यों है?
- यह तब भी काम करता है जब AI गलत होता है: आपको यह जानने की ज़रूरत नहीं है कि AI किस तरह से पक्षपाती है। आपको बस यह जानने की ज़रूरत है कि वह वास्तविकता से कुछ हद तक संबंधित है।
- यह समय और पैसा बचाता है: वास्तविक दुनिया में, "वास्तविक बिक्री" डेटा प्राप्त करना महंगा है (जैसे, किसी नई दवा के लिए क्लिनिकल ट्रायल चलाना, या लाखों उपयोगकर्ताओं को एक नया विज्ञापन दिखाना)। "क्रिस्टल बॉल" डेटा (ऐतिहासिक डेटा, सिमुलेशन) सस्ता और प्रचुर मात्रा में उपलब्ध है। यह एल्गोरिदम महंगे काम की गति बढ़ाने के लिए सस्ते डेटा का उपयोग करने में मदद करता है।
- यह "बैच" निर्णयों को संभालता है: कभी-कभी आप एक बार में एक आइटम का परीक्षण नहीं कर सकते; आपको एक साथ आइटम्स के पूरे समूह (बैच) का परीक्षण करना होता है। पेपर दिखाता है कि यह तरीका तब भी काम करता है जब डेटा पूरी तरह से "नॉर्मल" (Gaussian) न हो।
पेपर से वास्तविक दुनिया के उदाहरण
AI मॉडल का चयन करना: एक कंपनी ग्राहक सेवा के लिए सबसे अच्छा लार्ज लैंग्वेज मॉडल (LLM) चुनना चाहती है। महंगे, प्रोप्राइटरी मॉडल्स (जैसे GPT-4) को प्रति क्वेरी टेस्ट करना पैसे खर्च करता है।
- ट्रिक: वे प्रश्नों के लिए एक "सरोगेट स्कोर" उत्पन्न करने के लिए एक मुफ्त, ओपन-सोर्स मॉडल (जैसे Llama) का उपयोग करते हैं। भले ही ओपन-सोर्स मॉडल उतना स्मार्ट न हो, लेकिन उनके उत्तर महंगे मॉडल के उत्तरों के साथ सह-संबंधित होते हैं। एल्गोरिदम का उपयोग यह जल्दी से पता लगाने के लिए किया जाता है कि कौन सा महंगा मॉडल सबसे अच्छा है, जिससे हजारों डॉलर की बचत होती है।
वीडियो सिफारिशें (Recommendations): एक वीडियो ऐप उपयोगकर्ता को सबसे अच्छा वीडियो दिखाना चाहता है।
- ट्रिक: वे वीडियो दिखाने से पहले जुड़ाव (engagement) की भविष्यवाणी करने के लिए यूजर प्रोफाइल और वीडियो मेटाडेटा का उपयोग करते हैं (surrogate reward)। भले ही भविष्यवाणी एकदम सही न हो, फिर भी यह एल्गोरिदम को यह सीखने में मदद करती है कि वास्तव में कौन से वीडियो आकर्षक हैं, जिससे उपयोगकर्ता को बार-बार उबाऊ वीडियो दिखाने की संख्या कम हो जाती है।
निचोड़ (The Bottom Line)
यह पेपर हमें AI भविष्यवाणियों की शक्ति का उपयोग बेहतर और तेज़ निर्णय लेने के लिए करना सिखाता है, भले ही वे भविष्यवाणियाँ त्रुटिपूर्ण हों। यह एक थोड़े धुंधले नक्शे के होने जैसा है: यदि आप जानते हैं कि उस धुंधलेपन को कैसे समझना है, तो आप बिना देखे चलने की तुलना में अपने गंतव्य तक बहुत तेज़ी से पहुँच सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।