← नवीनतम पेपर
🤖 machine learning

Cross-Domain Off-Policy Evaluation and Learning for Contextual Bandits

यह शोध पत्र एक नवीन क्रॉस-डोमेन ऑफ-पॉलिसी इवैल्यूएशन एंड लर्निंग फ्रेमवर्क प्रस्तावित करता है जो फ्यू-शॉट डेटा, डिटरमिनिस्टिक लॉगिंग पॉलिसीज़ और नई क्रियाओं जैसी महत्वपूर्ण चुनौतियों से निपटने के लिए लक्ष्य और स्रोत दोनों डोमेन के ऐतिहासिक डेटासेट का लाभ उठाता है, जिससे उन परिदृश्यों में प्रभावी पॉलिसी इवैल्यूएशन और ऑप्टिमाइज़ेशन सक्षम होता है जहाँ मौजूदा विधियाँ उच्च विचरण (हाई वेरिएंस) या सीमित अन्वेषण (लिमिटेड एक्सप्लोरेशन) के कारण विफल हो जाती हैं।

मूल लेखक: Yuta Natsubori, Masataka Ushiku, Yuta Saito

प्रकाशित 2026-07-27
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuta Natsubori, Masataka Ushiku, Yuta Saito

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जहाज के कप्तान हैं जो एक तूफानी समुद्र में रास्ता खोजने की कोशिश कर रहे हैं, लेकिन आपने वास्तव में पहले कभी इस विशिष्ट मार्ग पर यात्रा नहीं की है। आपके पास अपने वर्तमान जहाज की पिछली यात्राओं का एक मानचित्र (जिसे "लॉग किया गया डेटा" कहा जाता है) है, लेकिन वह मानचित्र अधूरा है। शायद आपके पुराने कप्तान बहुत सावधान थे और केवल शांत जल में ही चले थे, जिससे खतरनाक चट्टानें अनमैप (uncharted) रह गईं। या शायद, मानचित्र पूरी तरह से गायब है क्योंकि जहाज पूरे महासागर की खोज करने के लिए बहुत छोटा था। कंप्यूटर विज्ञान की दुनिया में, विशेष रूप से मशीन लर्निंग नामक एक क्षेत्र में, यह एक सामान्य समस्या है जिसे कॉन्टेक्स्टुअल बैंडिट्स (Contextual Bandits) कहा जाता है। यह इस बारे में है कि कंप्यूटर कैसे निर्णय लेना सीखते हैं—जैसे कि कोई फिल्म सुझाना, दवा का सुझाव देना, या विज्ञापन दिखाना—बिना वास्तविक दुनिया में हर विकल्प को आज़माए (जो महंगा या जोखिम भरा हो सकता है)।

इसे हल करने के लिए, वैज्ञानिक ऑफ-पॉलिसी इवैल्यूएशन (Off-Policy Evaluation - OPE) नामक तकनीक का उपयोग करते हैं। OPE को निर्णय लेने के लिए एक "फ्लाइट सिम्युलेटर" के रूप में सोचें। वास्तविक लोगों पर नई रणनीति का परीक्षण करने के बजाय (जो जोखिम भरा है), आप पुराने डेटा का उपयोग करके कंप्यूटर के माध्यम से इसे देखते हैं कि यह कैसा प्रदर्शन करता। समस्या यह है कि अधिकांश सिम्युलेटर तब टूट जाते हैं जब पुराना डेटा बहुत उबाऊ होता है (कप्तान ने केवल एक ही काम किया) या जब नई रणनीति उन चीज़ों को आज़माना चाहती है जो पुराने कप्तान ने कभी नहीं की थीं। यदि पुराने डेटा में किसी विशिष्ट क्रिया का कोई रिकॉर्ड नहीं है, तो सिम्युलेटर अनुमान नहीं लगा सकता कि क्या होगा, जिससे गलत अनुमान या पूर्ण विफलता हो सकती है। यह पेपर इस कठिन परिदृश्य को संबोधित करता जहाँ पुराना डेटा या तो बहुत सीमित है, या बहुत कठोर है, या इसमें महत्वपूर्ण नए विकल्प पूरी तरह से गायब हैं।

यहाँ हकुहोडो डीवाई होल्डिंग्स (Hakuhodo DY Holdings) और कॉर्नेल यूनिवर्सिटी के शोधकर्ताओं के विचार को देखें, जो इस टूटे हुए सिम्युलेटर को ठीक करने के लिए एक चतुर नया तरीका प्रस्तावित करते हैं। वे अपने विचार को क्रॉस-डोमेन ऑफ-पॉलिसी इवैल्यूएशन एंड लर्निंग (Cross-Domain Off-Policy Evaluation and Learning) कहते हैं। कल्पना कीजिए कि आप एक नए, अज्ञात महासागर में सर्फिंग करना सीखने की कोशिश कर रहे हैं (लक्ष्य डोमेन/target domain), लेकिन आपके स्थानीय समुद्र तट (स्रोत डोमेन/source domain) में लहरों का पैटर्न अलग है। यदि आप केवल अपने स्थानीय समुद्र तट को देखते हैं, तो आप एक विशाल लहर को देखकर भ्रमित हो सकते हैं जो वहां कभी नहीं हुई थी। लेकिन, क्या होगा यदि आप एक पड़ोसी महासागर में सर्फिंग के वीडियो को भी देख सकें जिसमें समान लहरें हैं? भले ही पानी थोड़ा अलग हो, लहर का भौतिक विज्ञान (physics) समान हो सकता है।

लेखक सुझाव देते हैं कि केवल अपनी वर्तमान स्थिति के उबाऊ या अधूरे डेटा तक सीमित रहने के बजाय, आप अन्य समान स्थितियों (अन्य "डोमेन") से अंतर्दृष्टि उधार ले सकते हैं। उन्होंने महसूस किया कि हालांकि हर अस्पताल, देश या उपयोगकर्ता समूह अद्वितीय है, वे अक्सर अंतर्निहित पैटर्न साझा करते हैं। उदाहरण के लिए, एक उपचार दो अलग-अलग अस्पतालों में समान रूप से काम कर सकता है, भले ही रोगियों की जनसांख्यिकी थोड़ी भिन्न हो। यह पेपर एक नई विधि पेश करता है जिसे COPE (Cross-domain Off-Policy Evaluation) कहा जाता है। यह "रिवॉर्ड" (अच्छा परिणाम) को दो भागों में विभाजित करके काम करता है: एक साझा भाग (shared part) जो समान समूहों में आम है (जैसे लहर का सामान्य भौतिक विज्ञान) और एक अद्वितीय भाग (unique part) जो केवल आपके समूह के लिए विशिष्ट है (जैसे स्थानीय हवा)।

अन्य डोमेनों के डेटा का उपयोग करके "साझा भाग" को समझने के बाद, COPE उन कार्यों के रिक्त स्थानों को भर सकता है जिन्हें आपके विशिष्ट डेटा में कभी आज़माया नहीं गया था। यह एक पड़ोसी शहर के मानचित्र का उपयोग करके अपने शहर की एक ऐसी सड़क का लेआउट पता लगाने जैसा है जिसे आपके अपने मानचित्र ने बनाना भूल गया था। शोधकर्ताओं ने वास्तविक दुनिया के डेटा (एक वीडियो-शेयरिंग ऐप, KuaiRec) पर इसका परीक्षण किया और पाया कि जब लक्ष्य डेटा कम था, या जब पुराना डेटा बहुत कठोर (deterministic) था, या जब वहां बिल्कुल नए विकल्प मौजूद थे, तो उनकी विधि पुराने तरीकों की तुलना में बहुत अधिक सटीक थी। उन्होंने दिखाया कि कई स्रोतों से डेटा को जोड़कर, लेकिन उनके अंतरों का सावधानीपूर्वक हिसाब रखकर, वे नए नीतियों का मूल्यांकन और सीखना बहुत अधिक प्रभावी ढंग से कर सकते हैं।

अपने प्रयोगों में, उन्होंने ऐसे परिदृश्य बनाए जहाँ नए कार्यों ने कुल संभावित विकल्पों का 80% तक हिस्सा बनाया, या जहाँ पुराना डेटा इतना सीमित था कि प्रति क्रिया केवल एक डेटा पॉइंट था। इन कठिन मामलों में, उनकी नई विधि ने मानक दृष्टिकोणों की तुलना में त्रुटियों को काफी कम कर दिया। उन्होंने यह भी दिखाया कि यह केवल "मूल्यांकन" (एक रणनीति की जांच करना) के लिए नहीं, बल्कि "सीखने" (सर्वश्रेष्ठ रणनीति खोजना) के लिए भी काम करता है। यह पेपर सुझाव देता है कि विभिन्न डेटा स्रोतों को अलग-थलग द्वीपों के बजाय एक जुड़े हुए परिवार के रूप में मानकर, हम स्मार्ट, सुरक्षित और अधिक अनुकूल निर्णय लेने वाली प्रणालियाँ बना सकते हैं, विशेष रूप से उन स्थितियों में जहाँ हमारे पास शून्य से सीखने के लिए पर्याप्त डेटा नहीं है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →