← नवीनतम पेपर
🤖 AI

CausalReasoningBenchmark: A Real-World Benchmark for Disentangled Evaluation of Causal Identification and Estimation

यह शोध पत्र CausalReasoningBenchmark प्रस्तुत करता है, जो 173 प्रश्नों का एक वास्तविक दुनिया का डेटासेट है जिसे कारण संबंधी अनुमान (causal inference) के पहचान और अनुमान चरणों को अलग-अलग मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि वर्तमान बड़े भाषा मॉडल संख्यात्मक गणना की तुलना में अनुसंधान डिजाइन के सूक्ष्म विवरणों के साथ अधिक संघर्ष करते हैं।

मूल लेखक: Ayush Sawarni, Jiyuan Tan, Vasilis Syrgkanis

प्रकाशित 2026-05-15
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Ayush Sawarni, Jiyuan Tan, Vasilis Syrgkanis

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रहस्य सुलझाने के लिए एक जासूस को काम पर रख रहे हैं: "क्या इस विशिष्ट क्रिया ने उस विशिष्ट परिणाम को जन्म दिया?"

लंबे समय तक, जब हमने AI जासूसों का परीक्षण किया, तो हमने केवल उनके अंतिम उत्तर को देखा। यदि AI कहता, "इस क्रिया ने परिणाम में 5% की वृद्धि की," और वह संख्या सत्य के करीब थी, तो हमने उन्हें एक स्वर्ण स्टार (गोल्ड स्टार) दे दिया।

पुराने तरीके के साथ समस्या
इस शोध पत्र के लेखक तर्क देते हैं कि यह एक छात्र को केवल उनके गणित के अंतिम उत्तर के आधार पर ग्रेड देने जैसा है, बिना उनका काम (वर्क) चेक किए।

  • चरण 1 (पहचान/Identification): यह जासूस का तर्क है। उन्हें यह समझना होगा कि कैसे केस को सुलझाना है। क्या उन्हें एक गवाह की आवश्यकता है? एक छिपे हुए कैमरे की? उंगलियों के निशान के एक विशिष्ट प्रकार की? यह "अनुसंधान डिजाइन" (रिसхर्च डिजाइन) है।
  • चरण 2 (अनुमान/Estimation): यह जासूस का गणित है। एक बार जब वे योजना जान लेते हैं, तो वे अंतिम प्रतिशत प्राप्त करने के लिए संख्याओं की गणना करते हैं।

यदि AI गणित सही कर लेता है लेकिन गलत तर्क का उपयोग करता है (उदाहरण के लिए, वे सोचते हैं कि एक गवाह विश्वसनीय है जबकि वास्तव में वह झूठ बोल रहा है), तो अंतिम संख्या संयोग से ठीक लग सकती है, लेकिन तर्क दोषपूर्ण है। पुराने बेंचमार्क यह अंतर नहीं कर पाते थे कि एक जीनियस जासूस ने गणना में गलती की है या एक भ्रमित जासूस भाग्यवश सही नंबर तक पहुँच गया है।

नया समाधान: CausalReasoningBenchmark
लेखकों ने एक नया "प्रतियोगिता/परीक्षा" बनाया जिसे CausalReasoningBenchmark कहा जाता है। केवल एक नंबर पूछने के बजाय, वे AI से अपने काम को दो अलग-अलग भागों में दिखाने के लिए कहते हैं:

  1. ब्लूप्रिंट (खाका): एक संरचित योजना जो रणनीति का नाम बताती है (जैसे, "हम रिग्रेशन डिसकंटिन्यूटी डिजाइन का उपयोग करेंगे"), विशिष्ट चर (variables) (जैसे, "ट्रीटमेंट", "आउटकम", और "कंट्रोल्स"), और उस रणनीति के विशिष्ट नियम।
  2. गणना: वास्तविक संख्या और त्रुटि मार्जिन (error margin)।

उन्होंने इन दोनों भागों को अलग-अलग ग्रेड किया।

डेटा कहाँ से आया
इस परीक्षा को वास्तविक बनाने के लिए, उन्होंने फर्जी, मनगढ़ंत डेटा का उपयोग नहीं किया। वे वास्तविक दुनिया में गए और 173 प्रश्न एकत्र किए जो निम्नलिखित से थे:

  • 79 वास्तविक, सहकर्मी-समीक्षित (peer-reviewed) शोध पत्र (मुख्य रूप से राजनीति विज्ञान से)।
  • 3 प्रसिद्ध पाठ्यपुस्तकें जो कारण संबंधी अनुसंधान (causal research) करने के तरीकों पर आधारित हैं।

इसका अर्थ है कि AI को वास्तविक दुनिया के जटिल डेटा, अधूरी जानकारी और जटिल अध्ययन डिजाइनों से जूझना पड़ा, ठीक वैसे ही जैसे एक वास्तविक शोधकर्ता को करना पड़ता है।

उन्होंने क्या पाया (परिणाम)
उन्होंने इस परीक्षा पर एक बहुत ही स्मार्ट AI (GPT-5.3) का परीक्षण किया। यहाँ क्या हुआ:

  • "बड़ी तस्वीर" आसान थी: AI समाधान की सामान्य श्रेणी का अनुमान लगाने में अच्छा था। लगभग 79% बार, इसने सही ढंग से कहा, "ओह, यह एक इंस्ट्रुमेंटल वेरिएबल अध्ययन है!" या "यह एक डिफरेंस-इन-डिफरेंसेस अध्ययन है!"
  • "बारीक विवरण" कठिन था: जब ब्लूप्रिंट के विशिष्ट विवरण भरने के लिए कहा गया, तो स्कोर गिरकर केवल 34% रह गया।

विफलता का सादृश्य (Analogy)
इसे एक ऐसे शेफ के रूप में सोचें जो जानता है कि वह "इटालियन पास्ता" (रणनीति) बना रहा है, लेकिन फिर नमक डालना भूल जाता है, गलत प्रकार के आटे का उपयोग करता है, और गलती से डेजर्ट (मिठाई) का कोई घटक मिला देता है (पहचान संबंधी त्रुटियां)।

  • AI कह सकता था, "मैं पास्ता बना रहा हूँ।"
  • लेकिन जब उसे सामग्री सूचीबद्ध करने के लिए कहा गया, तो वह अक्सर महत्वपूर्ण चीजों को छोड़ देता था या ऐसी चीजें शामिल कर देता था जो व्यंजन को बर्बाद कर दें (जैसे, "पोस्ट-ट्रीटमेंट वेरिएबल्स", जो कि ऐसे गार्निश की तरह हैं जिसे वास्तव में सॉस के अंदर पकाया गया था, जिससे स्वाद बदल गया)।

यह क्यों मायने रखता है
यह शोध पत्र दिखाता है कि कारण संबंधी तर्क (causal reasoning) में AI के लिए सबसे बड़ी बाधा गणित करना (अनुमान लगाना) नहीं है। बाधा डिजाइन को समझना है। AI उन चरों के बीच अंतर करने में संघर्ष करता है जो एक समस्या पैदा करते हैं और वे चर जो केवल समस्या का एक दुष्प्रभाव (side effect) हैं।

निष्कर्ष (Bottom Line)
यह नया बेंचमार्क AI को "दिखावा करने" (faking it) से रोकने का एक उपकरण है। ब्लूप्रिंट और गणित को अलग-अलग ग्रेड करके, लेखक अब देख सकते हैं कि AI कहाँ विफल होता है। उन्होंने पाया कि जबकि AI संख्याओं में बेहतर हो रहा है, उसे अभी भी यह सीखने की आवश्यकता है कि जांच की योजना बनाने में एक बेहतर जासूस कैसे बना जाए। यह डेवलपर्स को ऐसे स्मार्ट सिस्टम बनाने में मदद करता है जो केवल नंबरों का अनुमान नहीं लगाते, बल्कि वास्तव में समझते हैं कि वे नंबर क्यों सत्य हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →