CausaLab: A Scalable Environment for Interactive Causal Discovery Toward AI Scientists
CausaLab एक कृत्रिम प्रयोगशाला सेटिंग में अंतर्निहित संरचनात्मक कारण मॉडलों (structural causal models) को पुनः प्राप्त करने की आवश्यकता के माध्यम से LLM एजेंटों की कारण खोज (causal discovery) क्षमताओं का मूल्यांकन करने के लिए एक स्केलेबल, संवादात्मक वातावरण पेश करता है, जो भविष्य कहनेवाला सटीकता (predictive accuracy) और वास्तविक कारण समझ के बीच एक महत्वपूर्ण अंतर को प्रकट करता है और हस्तक्षेप डिजाइन (intervention design) तथा समयपूर्व रुकने (premature stopping) की कमजोरियों को उजागर करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ CausaLab पेपर का हिंदी अनुवाद दिया गया है:
मुख्य विचार: "AI वैज्ञानिक" बनाम "कॉज़ल पैरट" (कारण बताने वाला तोता)
कल्पना कीजिए कि आप एक AI को वैज्ञानिक बनाना चाहते हैं। अधिकांश वर्तमान परीक्षण AI से ऐसे प्रश्न पूछते हैं जैसे, "क्या धूम्रपान से कैंसर होता है?" AI इसका उत्तर "हाँ" दे सकता है क्योंकि उसने अपने ट्रेनिंग डेटा में यह तथ्य पढ़ा है। लेकिन क्या उसने इसे खुद समझा है, या उसने बस उत्तर को रट लिया है? इसे "कॉज़ल पैरट" (Causal Parrot) समस्या कहा जाता है: AI स्मार्ट सुनाई देता है लेकिन वह केवल वही दोहरा रहा होता है जो उसने सुना है, न कि वास्तव में यह समझ रहा होता है कि दुनिया कैसे काम करती है।
CausaLab एक नया वीडियो गेम है जिसे इन "तोतों" को रोकने और असली वैज्ञानिकों का परीक्षण करने के लिए डिज़ाइन किया गया है। सवालों पूछने के बजाय, यह AI को एक आभासी प्रयोगशाला (वर्चुअल लैब) में डाल देता है जहाँ उसे बिना किसी चीट शीट के, शून्य से यह खोजना होता है कि चीजें कैसे काम करती हैं।
खेल: द क्रिस्टल लैब (The Crystal Lab)
CausaLab को जादुई क्रिस्टल वाले एक मिस्ट्री बॉक्स गेम के रूप में समझें।
- सेटअप: कंप्यूटर (जो "गेम मास्टर" है) गुप्त रूप से नियमों का एक सेट (एक "कॉज़ल मैप") बनाता है जो बताता है कि एक क्रिस्टल के विभिन्न गुण—जैसे उसका तापमान, आकार या विकिरण—उसके रेजोनेंस फ्रीक्वेंसी (उसकी गूँज या कंपन की दर) को कैसे प्रभावित करते हैं। AI इन नियमों को नहीं जानता।
- सुराग: AI को पुराने मापों की एक नोटबुक (अवलोकन/Observations) दी जाती है जो दिखाती है कि अतीत में क्रिस्टल के साथ क्या हुआ था।
- प्रयोग: AI के पास सीमित संख्या में "जादुई छड़ियाँ" (हस्तक्षेप/Interventions) होती हैं। वह इन छड़ियों का उपयोग करके एक टेस्ट क्रिस्टल के किसी एक गुण को बदल सकता है (जैसे, "तापमान को 50 डिग्री करें") और देख सकता है कि फ्रीक्वेंसी पर क्या प्रभाव पड़ता है।
- लक्ष्य: AI को छिपे हुए नियमों को समझना होगा, उन्हें लिखना होगा, और फिर एक नए क्रिस्टल की फ्रीक्वेंसी की भविष्यवाणी करनी होगी जिसे उसने पहले कभी नहीं देखा है।
ट्विस्ट: जीतने के दो तरीके
अधिकांश परीक्षणों में, यदि AI नए क्रिस्टल के लिए सही नंबर का अनुमान लगा लेता है, तो उसे एक गोल्ड स्टार मिलता है। CausaLab कहता है, "एक मिनट रुकिए।"
यह पेपर एक स्प्लिट-स्क्रीन स्कोर पेश करता है:
- स्कोर A (भविष्यवाणी): क्या आपने सही फ्रीक्वेंसी नंबर का अनुमान लगाया?
- स्कोर B (तंत्र/मैकेनिज्म): क्या आपने वास्तव में उन सही नियमों को समझा जो उस नंबर तक ले गए?
उपमा: कल्पना कीजिए कि एक छात्र गणित की परीक्षा दे रहा है।
- स्कोर A सही उत्तर प्राप्त करना है: "उत्तर 42 है।"
- स्कोर B काम करने का तरीका दिखाना है: "मैंने 20 + 22 जोड़ा।"
- समस्या: AI "42" का उत्तर अनुमान लगाकर या किसी शॉर्टकट का उपयोग करके प्राप्त कर सकता है, लेकिन यदि वह गलत गणित (स्कोर B) लिखता है, तो उसने वास्तव में सबक नहीं सीखा है। CausaLab इन "किस्मत वाले अंदाजों" को पकड़ लेता है।
उन्होंने क्या पाया: AI अनुमान लगाने में अच्छा है, तर्क करने में बुरा
शोधकर्ताओं ने इस लैब में शीर्ष AI मॉडल्स (जैसे GPT-5.2-high और अन्य) का परीक्षण किया। यहाँ क्या हुआ:
1. "किस्मत वाले अंदाजे" का अंतर (The "Lucky Guess" Gap)
AI अंतिम नंबर की भविष्यवाणी करने में आश्चर्यजनक रूप से अच्छा था (कुछ मामलों में 92% सटीकता)। हालाँकि, जब इसे वेरिएबल्स के बीच संबंध का नक्शा बनाने के लिए कहा गया, तो यह बुरी तरह विफल रहा (केवल 47% सटीकता)।
- रूपक: AI एक मौसम विज्ञानी की तरह है जो सही भविष्यवाणी करता है कि कल बारिश होगी, लेकिन उसे यह नहीं पता कि यह ठंडी हवा के कारण है, तूफान के कारण, या केवल स्थानीय आर्द्रता के कारण। उसने परिणाम तो सही बताया लेकिन कारण को मिस कर गया।
2. "कुछ न करना" बनाम "कुछ करना" का जाल
- केवल देखना (अवलोकन/Observation): यदि AI केवल पुराने डेटा को देखता है बिना कुछ बदले, तो वह अक्सर अंतिम नंबर सही बता देता है, लेकिन वह नियमों को नहीं समझ पाता।
- केवल प्रयोग करना (हस्तक्षेप/Intervention): यदि AI पहले डेटा देखे बिना तुरंत चीजें बदलना शुरू कर देता है, तो वह भ्रमित हो जाता है और नंबर और नियम दोनों में विफल रहता है।
- सही तरीका (The Sweet Spot): सबसे अच्छी रणनीति एक मिश्रण थी। पहले डेटा देखें ताकि एक अंदाज़ा मिल सके, फिर उन अंदाजों को परखने के लिए "जादुई छड़ियों" का उपयोग करें। इससे AI को वास्तव में नियम सीखने में मदद मिली।
3. "जल्दी हार मान लेने" की समस्या (The "Give Up Too Soon" Problem)
पेपर ने पाया कि कई AI एजेंट इसलिए विफल नहीं हुए क्योंकि उनके पास "जादुic छड़ियाँ" (बजट) खत्म हो गई थीं, बल्कि इसलिए क्योंकि उन्होंने बहुत जल्दी रुकना शुरू कर दिया।
- रूपक: एक जासूस की कल्पना करें जो अपराध सुलझा रहा है। उसे एक सुराग मिलता है, वह हत्यारे का अनुमान लगाता है, और बिना यह जांचे कि संदिग्ध का कोई एलीबाई (Alibi) है या नहीं, तुरंत उसे गिरफ्तार कर लेता है। AI अक्सर एक थ्योरी बनाता है, आत्मविश्वासी हो जाता है, और परीक्षण करना बंद कर देता है, भले ही उसकी थ्योरी उस सबूत के साथ फिट न बैठती हो जो उसने पहले ही इकट्ठा कर लिया है।
- समाधान: जब शोधकर्ताओं ने AI को मजबूर किया कि वह अंतिम अनुमान लगाने से पहले रुककर पूछे, "क्या मेरी वर्तमान थ्योरी वास्तव में उस डेटा की व्याख्या करती है जो मैंने अभी देखा है?", तो AI पहेली को हल करने में बहुत बेहतर हो गया।
निष्कर्ष
CausaLab दिखाता है कि जबकि वर्तमान AI मॉडल परिणामों की भविदन करने में बेहतरीन हैं (जैसे एक तोता तथ्यों को दोहराता है), वे प्रकृति के अंतर्निहित नियमों को खोजने (जैसे एक वैज्ञानिक प्रयोग करता है) के लिए अभी भी संघर्ष कर रहे हैं।
वे आपको बता सकते हैं कि क्या होने वाला है, लेकिन वे अक्सर यह नहीं समझा पाते कि वह क्यों होने वाला है या किसी चीज़ को बदलने के लिए सिस्टम को कैसे बदला जाए। वास्तविक "AI वैज्ञानिक" बनाने के लिए, हमें केवल अंतिम उत्तर की जाँच करने वाले परीक्षणों से आगे बढ़कर यह परीक्षण करने की आवश्यकता है कि क्या AI वास्तव में दुनिया का सही मानसिक मॉडल (Mental Model) बना सकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।