← नवीनतम पेपर
📊 statistics

Adaptive Policy Learning Under Unknown Network Interference

यह शोध पत्र एक थॉम्पसन सैंपलिंग एल्गोरिदम प्रस्तावित करता है जो अज्ञात नेटवर्क हस्तक्षेप गतिकी (network interference dynamics) को संयुक्त रूप से सीखता है और गिब्स सैंपलर के माध्यम से व्यक्तिगत स्तर के उपचार आवंटन को अनुकूलित करता है, जिससे उप-रैखिक (sublinear) बेयसियन रिग्रेट प्राप्त होता है और अनुकूली प्रयोग सेटिंग्स में सटीक डाउनस्ट्रीम कारण प्रभाव अनुमान सक्षम होता है।

मूल लेखक: Aidan Gleich, Eric Laber, Alexander Volfovsky

प्रकाशित 2026-05-13
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Aidan Gleich, Eric Laber, Alexander Volfovsky

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बड़े सोशल क्लब के मैनेजर हैं। आपके पास अपने सदस्यों को "ट्रीट्स" (जैसे मुफ्त कॉफी या डिस्काउंट) देने के लिए एक सीमित बजट है। आपका लक्ष्य क्लब को जितना संभव हो सके उतना खुश और लाभदायक बनाना है।

यहाँ एक पेच है: आपको ठीक-ठीक पता नहीं है कि कौन किससे बात करता है। वास्तव में, आपको यह भी नहीं पता कि एक व्यक्ति को ट्रीट देने से उसके दोस्तों पर कोई प्रभाव पड़ता है या नहीं। शायद अगर आप एलिस को एक ट्रीट देते हैं, तो उसका दोस्त बॉब सिर्फ जुड़ाव के कारण खुश हो जाता है। या शायद दोनों को ट्रीट देने से उनका प्रभाव एक-दूसरे को खत्म कर देता है। इसे इंटरफेरेंस (interference) कहा जाता है।

लंबे समय तक, इस समस्या को हल करने की कोशिश करने वाले वैज्ञानिकों को एक बड़ा अनुमान लगाना पड़ता था: "आइए मान लेते हैं कि हमें पहले से ही दोस्ती का नक्शा पता है," या "आइए हम पूरे समूहों को एक साथ ट्रीट देते हैं ताकि हमें व्यक्तियों की चिंता न करनी पड़े।" लेकिन वास्तविक दुनिया में, आपके पास अक्सर वह नक्शा नहीं होता, और पूरे समूहों को ट्रीट देना अक्षम होता है।

यह पेपर इस स्थिति को संभालने का एक नया, स्मार्ट तरीका पेश करता है। इसे एक जासूस की तरह समझें जो खेल खेलते हुए नक्शा सीख रहा है।

समस्या: "अंधा" मैनेजर

आमतौर पर, यदि आप यह पता लगाना चाहते हैं कि ट्रीट देने का सबसे अच्छा तरीका क्या है, तो आपको दो चीजों की आवश्यकता होती है:

  1. नक्शा (The Map): कौन किससे दोस्त है?
  2. रणनीति (The Strategy): खुशी को अधिकतम करने के लिए किसे ट्रीट मिलना चाहिए?

मौजूदा तरीके ऐसे थे जैसे एक मैनेजर जो या तो:

  • ऐसा नाटक करता था जैसे उसके पास पहले से ही नक्शा मौजूद है (जो कि शायद ही कभी सच होता है)।
  • व्यक्तिगत रणनीति छोड़ने के बजाय बड़े, अनाड़ी समूहों को ट्रीट देता था।
  • यदि क्लब बहुत बड़ा हो जाता (एक दर्जन से अधिक लोग), तो वह घबरा जाता था।

समाधान: "गिब्स" जासूस

लेखकों (एडन ग्लिच, एरिक लैबर और अलेक्जेंडर वोल्फोवस्की) ने एक नया एल्गोरिदम बनाया है जिसे वे Gibbs-TS कहते हैं। एक जासूस की कल्पना करें जो एक ही समय में दो काम करता है:

  1. वह खेल खेलता है: वह कुछ ट्रीट देता है, देखता है कि क्लब कैसी प्रतिक्रिया देता है, और "हैप्पीनेस स्कोर" की गणना करता है।
  2. वह नक्शे को अपडेट करता है: प्रतिक्रियाओं के आधार पर, वह अनुमान लगाता है कि कौन किससे दोस्त है। यदि एलिस को एक ट्रीट मिलता है और बॉब अचानक अधिक खुश दिखाई देता है, तो जासूस सोचता है, "आहा! एलिस और बॉब शायद दोस्त हैं।"

वे गिब्स सैंपलर (Gibbs sampler) नामक एक गणितीय ट्रिक का उपयोग करते हैं। इसे एक "क्या होगा अगर" (what-if) मशीन के रूप में समझें। मशीन अपने दिमाग में हजारों छोटे-छोटे सिमुलेशन चलाती है:

  • परिदृश्य A: क्या होगा अगर एलिस और बॉब दोस्त हैं? ट्रीट कैसे काम करते?
  • परिदृश्य B: क्या होगा अगर वे दोस्त नहीं हैं? वह कैसा दिखेगा?

इन परिदृश्यों को बार-बार चलाकर, मशीन धीरे-धीरे सच्चाई तक पहुँचती है। यह दोस्ती का एक सर्वश्रेष्ठ-अनुमानित नक्शा (best-guess map) बनाती है और साथ ही साथ ट्रीट बांटने की सर्वश्रेष्ठ रणनीति भी तय करती है।

यह एक बड़ी बात क्यों है

पेपर का दावा है कि यह तरीका तीन तरीकों से एक बड़ा अपग्रेड है:

1. यह नक्शा भी सीखता है और खेल भी जीतता है।
अधिकांश अन्य तरीके या तो यह मानकर खेल जीतने की कोशिश करते हैं कि नक्शा ज्ञात है, या वे खेल की परवाह किए बिना केवल नक्शा बनाने की कोशिश करते हैं। यह तरीका दोनों काम एक साथ करता है। यह एक ऐसे जीपीएस की तरह है जो सड़क के हालात जानने के लिए घर पहुँचने का इंतज़ार करने के बजाय, ड्राइविंग करते समय ही सड़क के हालात सीख लेता है।

2. यह बड़े नेटवर्क पर काम करता है।
पिछले तरीके केवल बहुत छोटे समूहों (लगभग 12 लोग) को संभाल सकते थे। यह नया तरीका सैकड़ों या हजारों लोगों वाले नेटवर्क पर काम करता है। लेखकों ने भारत के एक गाँव और अमेरिका के एक स्कूल के वास्तविक डेटा पर इसका परीक्षण किया, और यह बहुत अच्छा रहा।

3. यह एक "बोनस रिपोर्ट" बनाता है।
चूंकि यह एल्गोरिदम दोस्ती के नक्शे को सीख लेता है, इसलिए यह आपको केवल यह नहीं बताता कि किसे ट्रीट देना है; बल्कि यह आपको नेटवर्क का एक पुनर्निर्मित नक्शा (reconstructed map) भी देता है। यह उन वैज्ञानिकों के लिए मूल्यवान है जो यह अध्ययन करना चाहते हैं कि प्रभाव (influence) कैसे फैलता है (जैसे कि कैसे एक अफवाह या बीमारी समूह में फैलती है)।

परिणाम: कम पछतावा, अधिक खुशी

प्रयोगों की दुनिया में, "रिग्रेट" (regret) एक फैंसी शब्द है जिसका अर्थ है "छूटे हुए अवसर"। यदि आपने गलत व्यक्ति को ट्रीट दिया, तो आपके पास "रिग्रेट" है क्योंकि आप किसी और को देकर अधिक खुशी ला सकते थे।

  • पुराने तरीके: जब उन्होंने इस तथ्य को नजरअंदाज किया कि लोग एक-दूसरे को प्रभावित करते हैं, तो उन्होंने बड़ी गलतियाँ कीं (लीनियर रिग्रेट)। वे वही गलतियाँ बार-बार करते रहे।
  • यह नया तरीका: इसने गलतियाँ कीं, लेकिन यह जल्दी सीख गया। इसका "रिग्रेट" बहुत धीरे बढ़ा (सबलीनियर)। आमने-सामने के परीक्षणों में, इस नए तरीके ने अगले सबसे अच्छे प्रतिस्पर्धी की तुलना में 10 गुना कम गलतियाँ कीं।

निचोड़

यह पेपर एक ऐसा टूल प्रस्तुत करता है जो शोधकर्ताओं को उन वास्तविक सामाजिक नेटवर्क में प्रयोग चलाने की अनुमति देता है जहाँ वे लोगों के बीच के संबंधों को नहीं जानते हैं। यह लोगों के बीच के कनेक्शन को चलते-फिरते सीखता है और साथ ही साथ लोगों की मदद करने का सबसे अच्छा तरीका भी खोजता है।

लेखकों ने गणितीय रूप से सिद्ध किया कि यह दृष्टिकोण कुशल है और कंप्यूटर सिमुलेशन एवं वास्तविक दुनिया के डेटा के माध्यम से दिखाया कि यह पिछले तरीकों की तुलना में बहुत बेहतर काम करता है। उन्होंने यह भी नोट किया कि जो नक्शा यह बनाता है, उसका उपयोग बाद में यह बताने के लिए किया जा सकता है कि लोग एक-दूसरे को कैसे प्रभावित करते हैं।

संक्षेप में, यह एक स्मार्ट, स्व-शिक्षण प्रणाली है जो बिना किसी पूर्व-निर्मित नक्शे के, लोगों को मदद करने का सबसे अच्छा तरीका समझते हुए, छिपे हुए सामाजिक जाल को समझ लेती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →