← नवीनतम पेपर
📊 statistics

Prediction decomposition for causal analysis

यह शोध पत्र एक पूर्वानुमान अपघटन ढांचा (prediction decomposition framework) प्रस्तावित करता है जो काउंटरफैक्चुअल उपचार प्रभावों (counterfactual treatment effects) के लिए एक बेहतर संरचनात्मक प्रॉक्सी के रूप में 'इन-यूनिट-अक्रॉस-टाइम' (within-unit-across-time) पूर्वानुमान सटीकता की पहचान करता है, जो मशीन लर्निंग भविष्यवाणियों का उपयोग करके कारण अनुमान (causal inference) को बेहतर बनाने के लिए एक नया नैदानिक मीट्रिक और मॉडल-चयन रणनीति प्रदान करता है।

मूल लेखक: Ofir Reich

प्रकाशित 2026-04-14✓ Author reviewed
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ofir Reich

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने नहीं लिखा है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ एक सरल भाषा, उपमाओं और रूपकों का उपयोग करके शोध पत्र (paper) की व्याख्या दी गई है।

बड़ी समस्या: "एक अच्छा भविष्यवक्ता, एक बुरा जासूस है"

कल्पना कीजिए कि आप एक रहस्य सुलझाने की कोशिश कर रहे हैं एक जासूस के रूप में: क्या एक नए उर्वरक (fertilizer) ने फसलों को लंबा करने में मदद की?

आपके पास मक्के का एक विशाल खेत है, लेकिन आप हर एक पौधे को माप नहीं सकते (यह बहुत महंगा है)। इसलिए, आप सीधे कुछ पौधों के छोटे से नमूने (sample) को मापते हैं। फिर, आप एक सुपर-स्मार्ट AI (मशीन लर्निंग) को प्रशिक्षित करते हैं ताकि वह सैटेलाइट तस्वीरों को देखकर आपके द्वारा मापे गए पौधों के आधार पर अन्य पौधों की ऊंचाई का अनुमान लगा सके।

जाल:
AI पौधों की ऊंचाई का अनुमान लगाने में एक शानदार भविष्यवक्ता (predictor) बन जाता है। यह मिट्टी, मौसम के इतिहास और स्थान को देखता है, और कहता है, "यह पौधा 5 फीट लंबा है, और वह वाला 4 फीट का है।" यह अपने टेस्ट स्कोर में A+ प्राप्त करता है।

लेकिन यहाँ एक पेंच है: AI एक जासूस बनने में बहुत बुरा है।

यदि आप AI को यह देखने के लिए डेटा देते हैं कि क्या उर्वरक ने काम किया, तो वह कह सकता है, "कोई बदलाव नहीं!" क्यों? क्योंकि AI ने सीखा कि "अच्छी मिट्टी" वाले पौधे स्वाभाविक रूप से लंबे होते हैं, और "खराब मिट्टी" वाले पौधे स्वाभाविक रूप से छोटे होते हैं। इसने स्थिर अंतरों (static differences) को मापने का सीखा (कि कौन लंबा है बनाम कौन छोटा है)। इसने गतिशील परिवर्तनों (dynamic changes) को मापने का नहीं सीखा (कि उर्वरक डालने पर क्या होता है)।

इसलिए, भले ही AI ऊंचाई का अनुमान लगाने में बहुत अच्छा हो, वह उर्वरक के प्रभाव को पूरी तरह से पहचानने में विफल रहता है।

शोध पत्र का समाधान: भविष्यवाणी को तीन भागों में तोड़ना

लेखक, ओफिर रीच (Ofir Reich), AI के "मस्तिष्क" को तीन अलग-अलग सामग्रियों में तोड़ने का एक तरीका प्रस्तावित करते हैं। AI की भविष्यवाणी को तीन फलों से बने एक स्मूदी (smoothie) के रूप में सोचें:

  1. "आप कौन हैं" वाला फल (Between-Unit): यह स्थिर चीज़ें हैं। जहाँ आप रहते हैं, आपका पारिवारिक इतिहास, आपकी मिट्टी का प्रकार। AI आमतौर पर इसमें बहुत अच्छा होता है। वह जानता है कि एक अमीर पड़ोस में रहने वाला व्यक्ति एक गरीब पड़ोस में रहने वाले व्यक्ति की तुलना में अधिक पैसा खर्च करता है।
  2. "प्राकृतिक बहाव" वाला फल (Within-Unit): यह है कि चीजें समय के साथ स्वाभाविक रूप से कैसे बदलती हैं। शायद आपने इस महीने अधिक खर्च किया क्योंकि यह आपका जन्मदिन है, या बारिश के कारण मक्का थोड़ा बढ़ गया। यह जीवन का "शोर" (noise) है।
  3. "जादुई प्रभाव" वाला फल (Counterfactual Treatment): यह हस्तक्षेप (intervention) के कारण होने वाला विशिष्ट परिवर्तन है (उर्वरक, नकद हस्तांतरण, दवा)।

खोज:
पेपर का तर्क है कि कुल सटीकता (पूरा स्मूदी) इस बात का आकलन करने का एक बुरा तरीका है कि क्या आपका AI आपके प्रयोग के लिए काम करेगा।

  • एक AI स्मूदी के स्वाद का 99% सटीक अनुमान लगा सकता है क्योंकि उसने "आप कौन हैं" वाले फल को सही ढंग से पकड़ लिया है।
  • लेकिन यदि इसमें "जादुई प्रभाव" वाले फल का शून्य भी हिस्सा है, तो वह आपके प्रयोग में विफल हो जाएगा।

गुप्त सामग्री: "टाइम-ट्रैवल" टेस्ट

हम यह कैसे जान सकते हैं कि AI के पास "जादुई प्रभाव" वाला फल है या नहीं, बिना वास्तव में पूरी आबादी पर प्रयोग चलाए?

लेखक पैनल डेटा (Panel Data) (एक ही लोगों/प्लॉट्स का दो अलग-अलग समय का डेटा, जैसे पहले और बाद का) का उपयोग करके एक चतुर ट्रिक का सुझाव देते हैं।

उपमा: "पहले और बाद का" दर्पण
कल्पना कीजिए कि आप एक रोबोट को यह समझने के लिए सिखाने की कोशिश कर रहे हैं कि जब आप एक्सीलेटर दबाते हैं तो कार कैसे तेज होती है।

  • गलत दृष्टिकोण: आप रोबोट को एक फेरारी और एक ट्रैक्टर की तस्वीर दिखाते हैं। रोबोट सीखता है: "Ferraris तेज़ होती हैं, Tractors धीमे होते हैं।" वह भविष्यवाणी सही करता है! लेकिन यदि आप उससे पूछते हैं, "अगर मैं ट्रैक्टर पर एक्सीलेटर दबाऊं तो क्या होगा?" तो उसे कुछ पता नहीं होता, क्योंकि उसने केवल कारों के बीच के अंतर को सीखा है, न कि एक्सीलेटर दबाने की क्रिया को।
  • पेपर का दृष्टिकोण: आप रोबोट को दोपहर 1:00 बजे और फिर 1:05 बजे एक ही ट्रैक्टर दिखाते हैं।
    • यदि रोबोट 1:05 बजे 1:00 बजे की तुलना में एक अलग गति की भविष्यवाणी करता है, तो इसका मतलब है कि वह उन चीजों पर ध्यान दे रहा है जो समय के साथ बदलती हैं (जैसे एक्सीलेटर दबाने के बाद इंजन का रेस लेना)।
    • यदि रोबोट दोनों बार एक ही भविष्यवाणी देता है — बस यह कहते हुए कि "यह एक ट्रैक्टर है, यह धीमा है" — तो वह परीक्षण में विफल हो जाता है, क्योंकि वह केवल इस बात पर ध्यान दे रहा है कि वाहन क्या है, न कि उसके साथ क्या हो रहा है

मेट्रिक (The "Diff-vs-Diff" Slope):
पेपर एक विशिष्ट परीक्षण प्रस्तावित करता है:

  1. उन लोगों को लें जिन्हें उपचार (treatment) नहीं मिला (कंट्रोल ग्रुप)।
  2. देखें कि समय 1 से समय 2 तक उनका वास्तविक परिणाम कैसे बदला।
  3. देखें कि AI के अनुमानित परिणाम समय 1 से समय 2 तक कैसे बदले।
  4. परीक्षण: क्या AI की भविष्यवाणियां वास्तविक परिवर्तनों के साथ तालमेल बिठाती हैं?
  • यदि AI परिवर्तनों की अच्छी भविष्यवाणी करता है: तो इसका मतलब है कि वह जीवन के "बहाव" (drift) के प्रति संवेदनशील है। लेखक का तर्क है कि यह एक मजबूत संकेत है कि वह "जादुई प्रभाव" (उपचार) के प्रति भी संवेदनशील होगा।
  • यदि AI परिवर्तनों को अनदेखा करता है: तो इसका मतलब है कि AI केवल यह याद कर रहा है कि कौन अमीर है और कौन गरीब। वह उपचार का पता लगाने में विफल रहेगा।

यह क्यों मायने रखता है

अतीत में, शोधकर्ता उस AI को चुनते थे जिसका R-Squared (कुल सटीकता) सबसे अधिक होता था।

  • पेपर कहता है: ऐसा करना बंद करें! एक उच्च R-Squared अक्सर केवल यह दर्शाता है कि AI "अमीर बनाम गरीब" (Between-Unit) को पहचानने में अच्छा है।
  • नया नियम: उस AI को चुनें जो समय के साथ होने वाले परिवर्तनों (Within-Unit) की भविष्यवाणी करने में सबसे अच्छा है, भले ही उसकी कुल सटीकता थोड़ी कम हो।

"जादुई" समाधान (एक चेतावनी के साथ)

यदि आपको एक ऐसा AI मिलता है जो परिवर्तनों की भविष्यवाणी करने में अच्छा है (उच्च "Within-Unit" स्कोर), तो पेपर सुझाव देता है कि आप अपने परिणामों को ठीक करने के लिए इसका उपयोग कर सकते हैं।

  • यदि AI परिवर्तनों का पता लगाने में केवल 80% अच्छा है, तो आप अपने परिणामों को सही उत्तर प्राप्त करने के लिए गणितीय रूप से "खींच" (stretch) सकते हैं।
  • चेतावनी: यह केवल तभी काम करता है जब आप यह मान लें कि "प्राकृतिक परिवर्तनों की भविष्यवाणी करना" "उपचार परिवर्तनों की भविष्यवाणी करने" के समान है। लेखक का मानना है कि यह आमतौर पर सच होता है (उदाहरण के लिए, यदि कोई मॉडल जानता है कि बोनस मिलने पर किसी व्यक्ति के खर्च करने के तरीके में क्या बदलाव आता है, तो वह यह भी जानता है कि नकद हस्तांतरण मिलने पर उसमें क्या बदलाव आता है), लेकिन यह एक धारणा है जिसे जांचा जाना चाहिए।

एक वाक्य में सारांश

सिर्फ अपने AI से यह न पूछें, "आप उत्तर का अनुमान कितनी अच्छी तरह लगा सकते हैं?" उससे पूछें, "आप परिवर्तन का अनुमान कितनी अच्छी तरह लगा सकते हैं?" क्योंकि यदि वह परिवर्तन का अनुमान नहीं लगा सकता, तो वह निश्चित रूप से आपके प्रयोग के प्रभाव का अनुमान नहीं लगा सकता।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →