← नवीनतम पेपर
📊 statistics

Causal Bandit Over Unknown Graphs: Upper Confidence Bounds With Backdoor Adjustment

यह शोध पत्र अज्ञात ग्राफ वाले कॉज़ल बैंडिट समस्याओं के लिए बैकडोर-एडजस्टमेंट अपर कॉन्फिडेंस बाउंड (BA-UCB) एल्गोरिदम का प्रस्ताव करता है, जो वैध बैकडोर एडजस्टमेंट सेटों की पहचान करने के लिए क्रमिक प्रेक्षण संबंधी और प्रयोगात्मक डेटा का लाभ उठाता है, जिससे मौजूदा तरीकों की तुलना में बेहतर रिग्रेट बाउंड्स और भुजाओं (arms) की संख्या पर कम निर्भरता प्राप्त होती है।

मूल लेखक: Yijia Zhao, Qing Zhou

प्रकाशित 2026-04-07
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yijia Zhao, Qing Zhou

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक किसान हैं जो यह पता लगाने की कोशिश कर रहे हैं कि कौन सा एकल बदलाव आपकी फसलों को सबसे बड़ा बना देगा। आपके पास एक बगीचा है जिसमें कई चर (variables) हैं: तापमान, मिट्टी की नमी, उर्वरक का प्रकार और धूप। आप जानते हैं कि ये चीजें फसल को प्रभावित करती हैं, लेकिन आप यह नहीं जानते कि वे वास्तव में कैसे परस्पर क्रिया (interact) करती हैं।

यह कॉज़ल बैंडिट प्रॉब्लम (Causal Bandit Problem) है। आपको सबसे अच्छे परिणाम को खोजने के लिए निर्णयों (हस्तक्षेपों) की एक श्रृंखला लेनी होगी, लेकिन हर बार जब आप कुछ बदलते हैं (जैसे गर्मी बढ़ाना), तो उसमें समय और पैसा खर्च होता है। आप संसाधनों को बर्बाद किए बिना जितनी जल्दी हो सके सबसे अच्छी रणनीति सीखना चाहते हैं।

पुराना तरीका: अंधेरे में अनुमान लगाना

पारंपरिक रूप से, किसान (या कंप्यूटर एल्गोरिदम) बस एक-एक करके चीजें आजमाते थे।

  • "चलो थोड़ा और पानी देते हैं।" (परिणामों का इंतज़ार करें।)
  • "चलो थोड़ी और धूप देते हैं।" (परिणामों का इंतज़ार करें।)
  • "चलो थोड़ा कम उर्वरक देते हैं।" (परिणामों का इंतज़ार करें।)

यह 100 लीवर वाली स्लॉट मशीन खेलने जैसा है, जहाँ आप यह देखने के लिए हर लीवर को बेतरतीब ढंग से खींच रहे हैं कि कौन सा सबसे अधिक भुगतान करता है। यह काम तो करता है, लेकिन यह धीमा और महंगा है क्योंकि आपको निश्चित होने के लिए हर लीवर को कई बार खींचना पड़ता है।

नया विचार: "बैकडोर" शॉर्टकट

इस शोध पत्र के लेखक, झाओ और झोउ, एक स्मार्ट तरीका प्रस्तावित करते हैं जिसे BA-UCB (बैकडोर-एडजस्टमेंट अपर कॉन्फिडेंस बाउंड) कहा जाता है।

इसका असली रहस्य यह है: आपके पास पहले से ही एक विशाल लाइब्रेरी में पुराना, मुफ्त डेटा मौजूद है।
कल्पना कीजिए कि आपके पास 10 साल के ऐतिहासिक मौसम और फसल रिकॉर्ड (अवलोकन संबंधी डेटा/Observational Data) हैं जहाँ आपने कुछ भी बदला नहीं था, बस जो स्वाभाविक रूप से हुआ उसे देखा था। आपके पास नए प्रयोग (प्रायोगिक डेटा/Experimental Data) चलाने के लिए एक छोटा बजट भी है।

समस्या यह है: आपको "नियम पुस्तिका" (Causal Graph) का ज्ञान नहीं है। आप नहीं जानते कि "गर्मी" से "सूखी मिट्टी" होती है या "सूखी मिट्टी" से "गर्मी" होती है। नियम पुस्तिका के बिना, आप यह अनुमान आसानी से नहीं लगा सकते कि यदि आप कुछ बदलते हैं तो क्या होगा।

जादुई ट्रिक: "बैकडोर" खोजना

सांख्यिकी (Statistics) में, बैकडोर एडजस्टमेंट (Backdoor Adjustment) की एक अवधारणा है। इसे इस तरह सोचें:
यदि आप जानना चाहते हैं कि क्या उर्वरक से बड़ी फसल होती है, लेकिन बारिश दोनों को प्रभावित करती है (मिट्टी को गीला भी करती है और फसलों में भी मदद करती है), तो बारिश एक "कन्फाउंडर" (confounder) है। यदि आप केवल डेटा देखते हैं, तो आपको लग सकता है कि उर्वरक बहुत अच्छा है, लेकिन वास्तव में वह काम बारिश कर रही है।

इसे ठीक करने के लिए, आपको "बारिश" को स्थिर रखकर "बैकडोर को ब्लॉक" करने की आवश्यकता है। लेकिन यदि आपको नियम पुस्तिका का ज्ञान नहीं है, तो आप कैसे जानेंगे कि किन चरों को स्थिर रखना है?

BA-UCB इसे दो चीजें एक साथ करके हल करता है:

  1. जासूस (The Detective): यह पुराने डेटा और नए प्रयोगात्मक डेटा को एक साथ देखता है और अनुमान लगाता है कि कौन से चर वे "बैकडोर" (कन्फाउंडर्स) हैं जिन्हें ब्लॉक करने की आवश्यकता है।
  2. आशावादी (The Optimist): यह प्रत्येक विचार के लिए एक "कॉन्फिडेंस स्कोर" बनाता है। यदि पुराना डेटा और नया डेटा इस बात से सहमत है कि "उर्वरक + बारिश को रोकना = बड़ी फसल," तो स्कोर बढ़ जाता है। यदि वे असहमत हैं, तो स्कोर कम रहता है, और एल्गोरिदम आगे की जांच जारी रखता है।

उपमा: जासूस और प्रयोगशाला

कल्पना कीजिए कि आप एक अपराध सुलझाने की कोशिश कर रहे हैं (सबसे अच्छी फसल रणनीति खोजना) एक जासूस हैं।

  • मानक विधि (UCB): आप केवल अपने स्वयं के नए प्रयोगों पर भरोसा करते हैं। आप एक संदिग्ध का इंटरव्यू लेते हैं, फिर दूसरे का, फिर एक और का। इसमें बहुत समय लगता है।
  • BA-UCB विधि: आपके पास पुराने पुलिस रिपोर्टों का एक विशाल ढेर (अवलोकन संबंधी डेटा) है। आप अभी तक अपराधी को नहीं जानते, इसलिए आप रिपोर्टों को बस पढ़ नहीं सकते।
    • इसके बजाय, आप एक छोटा प्रयोग चलाते हैं (जैसे, "क्या होगा यदि हम सामने का दरवाजा बंद कर दें?")।
    • फिर आप पुराने रिकॉर्ड देखते हैं और पूछते हैं: "यदि हम सामने का दरवाजा बंद कर देते हैं, तो क्या 10 साल पहले का डेटा अब जो मैं देख रहा हूँ उससे मेल खाता है?"
    • यदि पुराना डेटा और नया डेटा मेल खाता है, तो आपको विश्वास हो जाता है कि आपने सही सुराग ढूंढ लिया है।
    • यदि वे आपस में टकराते हैं, तो आप जानते हैं कि आपने एक चर (एक "बैकडोर") मिस कर दिया है और आप तलाश जारी रखते हैं।

यह एक बड़ी बात क्यों है?

  1. यह सस्ता है: यह 90% भारी काम करने के लिए मुफ्त, पुराने डेटा का उपयोग करता है, जिससे आपका महंगा प्रयोगात्मक बजट बच जाता है।
  2. यह तेज़ है: क्योंकि यह एक समय में एक चर के बजाय एक साथ सभी डेटा से सीखता है, यह बहुत तेज़ी से सबसे अच्छा समाधान खोज लेता है, खासकर जब आपके पास चुनने के लिए कई चर हों।
  3. इसे मानचित्र की आवश्यकता नहीं है: पिछले अधिकांश तरीकों के लिए यह आवश्यक था कि आपके पास पहले से ही बना हुआ "मानचित्र" (Causal Graph) हो। यह विधि गाड़ी चलाते समय ही मानचित्र खुद तैयार कर लेती है।
  4. यह छिपे हुए दुश्मनों को संभालता है: भले ही वहां "छिपे हुए कन्फाउंडर्स" (ऐसे चर जिन्हें आप देख नहीं सकते, जैसे कि एक गुप्त भूमिगत जल स्रोत) हों, यह एल्गोरिदम स्मार्ट है; यह समझ जाता है कि कब वह पुराने डेटा का उपयोग नहीं कर सकता और शुद्ध रूप से नए प्रयोगों पर निर्भर रहने के लिए स्विच कर देता है, ताकि यह कभी धोखा न खाए।

परिणाम

अपने कंप्यूटर सिमुलेशन में, इस नए BA-UCB एल्गोरिदम ने मानक तरीकों की तुलना में बहुत कम गलतियाँ (कम 'रिग्रेट') कीं। इसने बहुत तेज़ी से सबसे अच्छी खेती की रणनीति खोजी, कम पैसा खर्च किया, और इसे पहले से ही बगीचे के गुप्त नियमों को जानने की आवश्यकता नहीं थी।

संक्षेप में: यह एक स्मार्ट, अनुकूलन योग्य (adaptive) लर्निंग सिस्टम है जो जानता है कि मुफ्त ऐतिहासिक डेटा को महंगे नए प्रयोगों के साथ कैसे मिलाना है ताकि सबसे अच्छे निर्णय लिए जा सकें, भले ही उसे अभी पूरी कहानी का ज्ञान न हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →