← नवीनतम पेपर
📈 economics

Partial Identification under Missing Data Using Weak Shadow Variables from Pretrained Models

यह शोध पत्र एक आंशिक पहचान ढांचे (partial identification framework) का प्रस्ताव करता है जो 'मिसिंग नॉट एट रैंडम' (MNAR) डेटा के तहत जनसंख्या मात्राओं पर तीक्ष्ण सीमाएँ (sharp bounds) प्राप्त करने के लिए प्रीट्रेंड मॉडल्स से प्राप्त परिणाम भविष्यवाणियों को "कमजोर छाया चर" (weak shadow variables) के रूप में उपयोग करता है, जिससे शास्त्रीय विधियों की मजबूत धारणाओं या पूर्णता स्थितियों की आवश्यकता के बिना महत्वपूर्ण अंतराल न्यूनीकरण और वैध कवरेज प्राप्त होता है।

मूल लेखक: Hongyu Chen, David Simchi-Levi, Ruoxuan Xiong

प्रकाशित 2026-06-09
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hongyu Chen, David Simchi-Levi, Ruoxuan Xiong

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप सभी ग्राहकों की औसत संतुष्टि (average satisfaction) का पता लगाने की कोशिश कर रहे हैं जिन्होंने कस्टमर सर्विस चैटबॉट का उपयोग किया है। आपके पास बातचीत की एक सूची है, लेकिन समस्या यह है कि केवल कुछ ही लोगों ने रेटिंग दी है।

वास्तविक दुनिया में, वे लोग जो अत्यधिक खुश या अत्यधिक क्रोधित होते हैं, वही समीक्षा छोड़ने की सबसे अधिक संभावना रखते हैं। जिन लोगों का अनुभव "ठीक-ठाक" रहा, वे आमतौर पर बस चैट बंद करके चले जाते हैं। यह एक समस्या पैदा करता है: यदि आप केवल उन रेटिंग्स का औसत निकालते हैं जो आपके पास हैं, तो आपको एक पक्षपाती (skewed) परिणाम प्राप्त होगा। यह वैसा ही है जैसे किसी शहर के औसत कद का अनुमान लगाने के लिए केवल उन लोगों को मापना जो बास्केटबॉल टीम में हैं (बहुत लंबे) और उन लोगों को जो जिम्नास्टिक क्लब में हैं (बहुत छोटे), जबकि बाकी सभी को अनदेखा कर दिया गया है।

इसे सांख्यिकीविद Missing Not At Random (MNAR) कहते हैं। डेटा इसलिए गायब है क्योंकि वह स्वयं उत्तर से जुड़ा हुआ है।

पुराना तरीका बनाम नया तरीका

पुराना तरीका ("अनुमान लगाने का खेल"):
पारंपरिक रूप से, इसे ठीक करने के लिए, शोधकर्ताओं को बहुत बड़े, जोखिम भरे अनुमान लगाने पड़ते थे। वे कहते थे, "मैं मान लेता हूँ कि गायब लोग बिल्कुल खुश लोगों जैसे ही हैं," या "मैं मान लेता हूँ कि गायब लोग बिल्कुल क्रोधित लोगों जैसे ही हैं।" यदि उनका अनुमान गलत निकला, तो उनका अंतिम उत्तर पूरी तरह से गलत होगा। यह एक पहेली को हल करने जैसा है जिसके आधे टुकड़े गायब हैं और आप केवल यह अनुमान लगा रहे हैं कि चित्र कैसा दिखता होगा।

नया तरीका ("सुरक्षित क्षेत्र"):
यह शोध पत्र एक स्मार्ट दृष्टिकोण प्रस्तावित करता है जिसे Partial Identification कहा जाता है। एक एकल संख्या का अनुमान लगाने के बजाय, वे एक Safe Zone (एक सीमा/रेंज) की गणना करते हैं।

  • उदाहरण: यह कहने के बजाय कि "औसत संतुष्टि 4.2 है," वे कहते हैं, "हम निश्चित रूप से जानते हैं कि औसत 3.8 और 4.6 के बीच है।"
  • यह रेंज गणितीय रूप से गारंटी देती है कि इसमें सही उत्तर मौजूद होगा, चाहे डेटा कैसे भी वितरित क्यों न हो, जब तक कि हम अपने नियमों का पालन करते हैं।

गुप्त हथियार: "कमजोर छाया" (The "Weak Shadow")

लेखकों ने महसूस किया कि भले ही हमारे पास रेटिंग नहीं है, लेकिन अक्सर हमारे पास उस बातचीत के बारे में अन्य जानकारी होती है। शायद हमारे पास चैट का ट्रांसक्रिप्ट, दिन का समय, या उपयोगकर्ता की समस्या का प्रकार है।

वे Large Language Models (LLMs) (जैसे कि AI जिससे आप अभी बात कर रहे हैं) का उपयोग इन ट्रांसक्रिप्ट्स को पढ़ने और यह भविष्यवाणी करने के लिए करते हैं कि रेटिंग क्या रही होगी।

हालाँकि, वे जानते हैं कि AI पूर्ण नहीं है। AI का अनुमान थोड़ा गलत हो सकता है। इसलिए, वे AI के अनुमान को "सत्य बताने वाले" के रूप में नहीं देखते हैं। इसके बजाय, वे इसे एक Weak Shadow Variable (कमजोर छाया चर) के रूप में देखते हैं।

उपमा: सिल्हूट (The Silhouette)
कल्पल्पना कीजिए कि आप एक अंधेरे कमरे में हैं, और आप वस्तु (सही रेटिंग) को देख नहीं सकते। लेकिन आपके पास एक टॉर्च (AI) है जो दीवार पर एक छाया डालती है।

  • छाया स्वयं वस्तु नहीं है।
  • छाया थोड़ी धुंधली या विकृत हो सकती है।
  • लेकिन, छाया वस्तु के अनुरूप होनी चाहिए। यदि वस्तु एक लंबा फूलदान है, तो उसकी छाया एक चपटे पैनकेक जैसी नहीं दिख सकती।

शोध पत्र की विधि इस "छाया" का उपयोग करके संभावनाओं को सीमित करने के लिए करती है। भले ही छाया धुंधली हो, लेकिन यह बताती है, "वस्तु निश्चित रूप से इतनी छोटी नहीं है, और यह निश्चित रूप से इतनी बड़ी भी नहीं है।" यह उन्हें बिना सटीक उत्तर जाने भी "Safe Zone" को काफी कम करने की अनुमति देता है।

वे इसे कैसे काम करते हैं ( "सॉफ्ट" गणित)

आमतौर पर, जब आप इन छायाओं को गणित में उपयोग करने की कोशिश करते हैं, तो यदि डेटा अव्यवस्थित है या नमूना छोटा है, तो समीकरण टूट जाते हैं और "No Solution" (कोई समाधान नहीं) देते हैं।

लेखकों ने एक Local Penalized Estimator का आविष्कार किया है।

  • उपमा: कल्पना कीजिए कि आप एक डगमगाती मेज पर ब्लॉकों का ढेर संतुलित करने की कोशिश कर रहे हैं। यदि आप उन्हें पूरी तरह से संतुलित करने की कोशिश करते हैं (सटीक गणित), तो एक मामूली झटका भी सब कुछ गिरा देगा।
  • उनका समाधान: वे ब्लॉकों के नीचे थोड़ा सा "मृदु गोंद" (penalty) लगा देते हैं। यह उन्हें थोड़ा डगमगाने की अनुमति देता है बिना गिरे। यह सुनिश्चित करता है कि उन्हें हमेशा एक परिणाम मिले, भले ही डेटा अव्यवस्थित या छोटा हो।

वे एक आत्मविश्वास अंतराल (confidence interval) बनाने के लिए एक विशेष तकनीक जिसे Subsampling (डेटा के कई छोटे हिस्से लेना) कहा जाता है, का भी उपयोग करते हैं। यह एक बड़े झटके के बजाय छोटे, यादृच्छिक झटकों के साथ स्टैक की स्थिरता की जांच करने जैसा है, जिससे यह सुनिश्चित होता है कि उनका "Safe Zone" सांख्यिकीय रूप से विश्वसनीय है।

उन्होंने क्या पाया (परिणाम)

उन्होंने वास्तविक ग्राहक सेवा चैट पर इसका परीक्षण किया:

  1. AI की छाया काम करती है: यहाँ तक कि सरल AI भविष्यवाणियाँ (जैसे "क्या उपयोगकर्ता की समस्या हल हुई? हाँ/नहीं") बेहतरीन छाया के रूप में कार्य करती हैं।
  2. संकीर्ण क्षेत्र (Narrower Zones): इन AI छायाओं का उपयोग करके, वे "Safe Zone" को 83% तक कम करने में सक्षम रहे।
    • AI के बिना: "औसत 1 और 5 के बीच कहीं है।" (बहुत उपयोगी नहीं)।
    • AI के साथ: "औसत 3.8 और 4.2 के बीच है।" (बहुत अधिक उपयोगी!)।
  3. पुराने तरीकों से बेहतर: उनकी विधि पारंपरिक अनुमान लगाने के तरीकों (जैसे Heckman मॉडल) की तुलना में अधिक सटीक और मजबूत थी, भले ही AI भविष्यवाणियां पूरी तरह से सटीक न हों।

निष्कर्ष

यह शोध पत्र हमें खतरनाक अनुमान लगाए बिना गायब डेटा को संभालने के लिए एक उपकरण प्रदान करता है। गायब उत्तरों की "कमजोर छाया" डालने के लिए AI का उपयोग करके, हम सत्य को एक बहुत ही सटीक और विश्वसनीय सीमा तक सीमित कर सकते हैं। यह एक "अंधेरे अनुमान" को एक "गणित आधारित, सुरक्षित दांव" में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →