Cross-Head Attention Uplift Network with Inverse Propensity Score under Unobserved Confounding
यह शोध पत्र क्रॉस-हेड अटेंशन अपलिफ्ट नेटवर्क (CHAUN) और रोबस्ट एडवर्सरियल इनवर्स प्रोपेंसिटी स्कोर (RA-IPS) पद्धति का प्रस्ताव करता है ताकि इंटर-ग्रुप सहसंबंधों को गतिशील रूप से मॉडल करके और अनऑब्जर्व्ड कन्फाउंडर्स से होने वाले पूर्वाग्रह को कम करके व्यक्तिगत उपचार प्रभाव अनुमान को बढ़ाया जा सके, जिससे सार्वजनिक और प्रोडक्शन दोनों डेटासेट पर महत्वपूर्ण प्रदर्शन सुधार प्राप्त हुआ है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशाल ऑनलाइन स्टोर चला रहे हैं। आप उन ग्राहकों को एक विशेष कूपन भेजना चाहते हैं जो केवल तभी कुछ खरीदेंगे यदि उन्हें कूपन मिले। यदि आप इसे सभी को भेजते हैं, तो आप उन लोगों पर पैसा बर्बाद करते हैं जो वैसे भी खरीदारी कर लेते। यदि आप इसे नहीं भेजते हैं, तो आप बिक्री के अवसर खो देते हैं। यही अपलिफ्ट मॉडलिंग (Uplift Modeling) का सार है: यह पता लगाना कि वास्तव में किसे उस "धक्के" (nudge) की आवश्यकता है ताकि वे कार्रवाई करें।
हालाँकि, वास्तविक दुनिया के डेटा का उपयोग करके इसे हल करने की दो बड़ी समस्याएँ हैं:
"ग्रुप हग" (Group Hug) की समस्या: जिन लोगों को आप उपचार देते हैं (कूपन भेजते हैं) और जिन्हें आप नहीं देते (कंट्रोल ग्रुप), वे अक्सर बहुत अलग होते हैं। लेकिन उनके व्यवहार आपस में गुप्त रूप से जुड़े हुए भी होते हैं। मौजूदा मॉडल या तो इन कनेक्शनों को देखने के लिए बहुत कठोर हैं या फिर "कूपन प्रभाव" को "व्यक्तित्व प्रभाव" से अलग करने में बहुत अव्यवस्थित हैं।
"हिडन पपेट" (Hidden Puppet) की समस्या: वास्तविक दुनिया में, हम अपने ग्राहकों के बारे में सब कुछ नहीं जानते। कुछ छिपे हुए कारक (जैसे ग्राहक का मूड, किसी प्रतिस्पर्धी की गुप्त सेल, या विज्ञापन प्रणाली में कोई गड़बड़ी) होते हैं जो यह तय करते हैं कि किसे कूपन मिलेगा और कौन खरीदारी करेगा। हम इन्हें अनऑब्जर्व्ड कॉन्फाउंडर्स (Unobserved Confounders) कहते हैं। ये अदृश्य कठपुतली चलाने वालों (puppet masters) की तरह काम करते हैं जो धागों को खींचते हैं, जिससे ऐसा लग सकता है कि कूपन ने काम किया जबकि उसने नहीं किया, या इसके विपरीत।
यह पेपर इन समस्याओं को हल करने के लिए दो नए उपकरण पेश करता है: CHAUN और RA-IPS।
1. CHAUN: "क्रॉस-हेड अटेंशन" (Cross-Head Attention) नेटवर्क
एक मानक AI मॉडल को एक ऐसे छात्र के रूप में सोचें जो दो अलग-अलग परीक्षाओं की तैयारी कर रहा है: एक "अगर मुझे कूपन मिला तो क्या होगा?" के लिए और दूसरी "अगर मुझे कूपन नहीं मिला तो क्या होगा?" के लिए। आमतौर पर, ये छात्र अलग-थलग रहकर पढ़ाई करते हैं।
CHAUN एक स्टडी ग्रुप की तरह है जहाँ दोनों छात्रों को एक-दूसरे से फुसफुसाकर बात करने की अनुमति दी जाती है।
- सेटअप: इसमें दो "हेड्स" (एक ट्रीटमेंट ग्रुप के लिए, एक कंट्रोल ग्रुप के लिए) हैं जो एक ही बुनियादी जानकारी (ग्राहक की प्रोफाइल) से सीखते हैं।
- जादू: यह क्रॉस-हेड अटेंशन (Cross-Head Attention) नामक तंत्र का उपयोग करता है। कल्पना कीजिए कि "ट्रीटमेंट स्टूडेंट" "कंट्रोल स्टूडेंट" के नोट्स देख रहा है और कह रहा है, "अरे, तुम इस हिस्से को समझने में अच्छे हो, मुझे भी वह विचार उधार लेने दो।"
- परिणाम: केवल अनुमान लगाने के बजाय, मॉडल दोनों दृष्टिकोणों को गतिशील रूप से मिलाता है। यह समूहों के बीच की समानताओं (ग्रुप हग) को सीखता है, जबकि अभी भी अनूठे अंतरों को स्पष्ट रखता है। यह इसे वास्तव में यह पहचानने में बहुत बेहतर बनाता है कि किसे कूपन की आवश्यकता है।
2. RA-IPS: "रोबस्ट" (Robust) सुरक्षा जाल
अब, "हिडन पपेट" (अनऑब्जर्व्ड कॉन्फाउंडर्स) के बारे में बात करते हैं।
आमतौर पर, सांख्यिकीविद इस समस्या को ठीक करने के लिए इनवर्स प्रोपेंसिटी स्कोर (Inverse Propensity Score - IPS) नामक उपकरण का उपयोग करते हैं। IPS को एक तराजू के रूप में समझें जो उपचारित और कंट्रोल समूहों के भार को संतुलित करने का प्रयास करता है ताकि वे एक निष्पक्ष, रैंडमाइज्ड प्रयोग की तरह दिखें।
- दोष: मानक IPS यह मानता है कि हमें पता है कि ग्राहक को कूपन क्यों मिला। लेकिन वास्तव में, हमारे पास "हिडन पपेट" वेरिएबल्स की जानकारी नहीं होती। यदि हम मानक तराजू का उपयोग करते हैं, तो यह जो हम देख रहे हैं उसके लिए तो पूरी तरह संतुलित हो सकता है, लेकिन जो हम नहीं देख पा रहे हैं, उसके लिए पूरी तरह असंतुलित हो सकता है।
RA-IPS इस तराजू का एक "पैरानॉयड" (paranoid) संस्करण है।
- रणनीति: यह मानने के बजाय कि हम छिपे हुए पपेट के सटीक भार को जानते हैं, RA-IPS कहता है, "ठीक है, छिपा हुआ पपेट हमारी सोच से थोड़ा अधिक या कम जोर लगा सकता है। आइए सबसे खराब स्थिति (worst-case scenario) को मान लें।"
- एडवरसेरियल गेम (Adversarial Game): यह अपने आप के विरुद्ध एक खेल खेलता है। यह उन छिपे हुए वेरिएबल्स की सबसे खतरनाक, सबसे खराब व्यवस्था खोजने की कोशिश करता है जो एक उचित सीमा के भीतर हैं। फिर, यह उस सबसे खराब स्थिति से बचने के लिए अपने मॉडल को समायोजित करता है।
- परिणाम: भले ही वहां छिपे हुए पपेट मास्टर्स हों जिन्हें हम देख नहीं सकते, RA-IPS एक ऐसा मॉडल बनाता है जो उनसे धोखा न खाए। यह सुनिश्चित करता है कि जो "कूपन प्रभाव" हम गणना करते हैं वह वास्तविक है, न कि केवल छिपे हुए वेरिएबल्स के कारण पैदा हुआ एक भ्रम।
प्रमाण (The Proof in the Pudding)
लेखकों ने बड़े ई-कॉमर्स प्लेटफॉर्म्स (जैसे Criteo और Lazada) और एक निजी प्रोडक्शन डेटासेट पर इन उपकरणों का परीक्षण किया।
- CHAUN ने लगभग हर अन्य मौजूदा मॉडल को पीछे छोड़ दिया। कुछ मामलों में, इसने पिछले सर्वोत्तम तरीकों की तुलना में सही ग्राहकों को खोजने की क्षमता में 25.6% तक सुधार किया।
- RA-IPS ने साबित किया कि जब छिपे हुए वेरिएबल्स मौजूद होते हैं, तो यह मानक तरीकों की तुलना में बायस (bias) को ठीक करने में काफी बेहतर (लगभग 5.4%) है।
मुख्य निष्कर्ष (The Bottom Line)
यह पेपर केवल यह नहीं कहता कि "हमारे पास एक बेहतर एल्गोरिदम है।" यह कहता है:
- CHAUN दो समूहों के लोगों से सीखने का एक स्मार्ट तरीका है, जिसमें उन्हें एक-दूसरे से "बात" करने की अनुमति दी जाती है, जिससे वे पैटर्न पकड़ पाते हैं जो अन्य मॉडल छोड़ देते हैं।
- RA-IPS एक सुरक्षा तंत्र है जो यह स्वीकार करता है कि "हम सब कुछ नहीं जानते," और एक ऐसा मॉडल बनाता है जो सटीक रहता है, भले ही अदृश्य कारक उसे धोखा देने की कोशिश कर रहे हों।
साथ मिलकर, वे एक ऐसी प्रणाली बनाते हैं जो सही लोगों को लक्षित करने में अधिक सटीक है और वास्तविक दुनिया में काम करने वाले छिपे हुए बलों के प्रति अधिक ईमानदार है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।