← नवीनतम पेपर
💬 NLP

Towards a Universal Causal Reasoner

यह शोध पत्र UniCo को पेश करता है, जो एक डेटा जनरेशन फ्रेमवर्क है जो पर्ल की कॉज़ल लैडर (Pearl's Causal Ladder) के across उच्च-गुणवत्ता वाला, विविध कॉज़ल प्रशिक्षण डेटा बनाता है, जो सिंथेटिक बेंचमार्क और वास्तविक दुनिया के अनुप्रयोगों दोनों में फाइन-ट्यून किए गए लार्ज लैंग्वेज मॉडल्स की कॉज़ल रीजनिंग क्षमताओं, सामान्यीकरण और निष्ठा को महत्वपूर्ण रूप से बढ़ाता है।

मूल लेखक: Qirun Dai, Xiao Liu, Jiawei Zhang, Dylan Zhang, Hao Peng, Chenhao Tan

प्रकाशित 2026-05-26
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Qirun Dai, Xiao Liu, Jiawei Zhang, Dylan Zhang, Hao Peng, Chenhao Tan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान छात्र है (एक लार्ज लैंग्वेज मॉडल, या LLM) जो तथ्य याद रखने और कहानियाँ लिखने में माहिर है। हालाँकि, जब आप उनसे पूछते हैं कि कोई चीज़ क्यों हुई या यदि वे किसी विशिष्ट विवरण को बदल देते हैं तो क्या होगा, तो वे अक्सर भ्रमित हो जाते हैं। वे "सहसंबंध" (दो चीजों का एक साथ होना) को "कारणता" (एक चीज़ का वास्तव में दूसरी चीज़ का कारण बनना) के साथ मिला सकते हैं, या वे ऐसी कहानी बना सकते हैं जो सुनने में तार्किक लगे लेकिन गणित से मेल न खाती हो।

यह शोध पत्र UNICO नामक एक नया प्रशिक्षण कार्यक्रम पेश करता है, जिसे इन बुद्धिमान छात्रों को यूनिवर्सल कॉज़ल रीजनर्स (सार्वभौमिक कारण तर्ककर्ता) बनाने के लिए डिज़ाइन किया गया है। सोचिए कि UNICO केवल एक पाठ्यपुस्तक नहीं है, बल्कि एक विशेष जिम की तरह है जहाँ छात्र एक जासूस, एक वैज्ञानिक और एक प्रोग्रामर की तरह सोचना सीखता है।

यहाँ इस शोध पत्र का सरल अवधारणाओं में विवरण दिया गया है:

1. समस्या: "शॉर्टकट" का जाल

पहले, शोधकर्ता इन मॉडलों को कारण और प्रभाव के बारे में सिखाने के लिए छोटे, विशिष्ट डेटासेट का उपयोग करते थे। यह एक छात्र को सेब के चित्रों को देखकर गणित की समस्या हल करना सिखाने जैसा था। यदि आप फिर उनसे संतरे के बारे में समस्या हल करने के लिए कहते, तो वे अटक जाते।

इससे भी बुरा यह था कि कई मौजूदा डेटासेट में "लूपहोल्स" (कमियां) थीं। एक मॉडल सही उत्तर का अनुमान लगाने के लिए एक सरल पैटर्न (शॉर्टकट) को पहचान कर सही उत्तर तक पहुँच सकता था, बिना गहरे तर्क को समझे। उदाहरण के लिए, यदि कोई प्रश्न पूछता है, "क्या बारिश से घास गीली होती है?" और उत्तर हमेशा "हाँ" होता था, तो मॉडल ने बिना तंत्र (mechanism) को समझे केवल बारिश से जुड़ी किसी भी चीज़ के लिए "हाँ" कहना सीख लिया।

2. समाधान: UNICO फ्रेमवर्क

लेखकों ने एक विशाल, उच्च गुणवत्ता वाला प्रशिक्षण कारखाना बनाया जिसे UNICO कहा जाता है। केवल मॉडल को प्रश्न देने के बजाय, उन्होंने एक ऐसी प्रणाली बनाई जो लाखों अद्वितीय "कारण-और-प्रभाव" पहेलियाँ उत्पन्न करती है।

उन्होंने दो मुख्य चीजों पर ध्यान केंद्रित किया: विविधता (Diversity) और गुणवत्ता (Quality)

अ. सोचने के तीन स्तर (कॉज़ल लैडर/कारण सीढ़ी)

शोध पत्र एक प्रसिद्ध अवधारणा "पर्ल्स कॉज़ल लैडर" (Pearl's Causal Ladder) का उपयोग करता है ताकि मॉडल को तीन अलग-अलग कठिनाई स्तरों पर प्रशिक्षित किया जा सके, जैसे सीढ़ी चढ़ना:

  1. एसोसिएशन (देखना): "मैं देखता हूँ कि जब X होता है, तो Y आमतौर पर होता है।" (जैसे, "जब मुर्गा बांग देता है, तो सूरज उगता है।")
  2. इंटरवेंशन (करना): "क्या होता है अगर मैं X को होने के लिए मजबूर करूँ?" (जैसे, "यदि मैं रात में मुर्गे को बांग देने के लिए मजबूर करूँ, तो क्या सूरज उगेगा?")
  3. काउंटरफैक्चुअल (कल्पना करना): "क्या होता यदि मैंने X को अलग तरह से किया होता?" (जैसे, "यदि आज सुबह मुर्गा बांग नहीं देता, तो क्या सूरज फिर भी उगता?")

UNICO मॉडल को इन तीनों स्तरों को कवर करने वाले 18 अलग-अलग प्रकार के प्रश्नों पर प्रशिक्षित करता है, यह सुनिश्चित करते हुए कि छात्र केवल एक प्रकार के प्रश्न में कुशल न हो जाए।

ब. तर्क की तीन भाषाएँ

मॉडल को वास्तव में "यूनिवर्सल" बनाने के लिए, UNICO उसे तीन अलग-अलग "भाषाओं" में एक ही तर्क को समझना सिखाता है:

  1. सिंबोलिक (गणित): कच्चे गणितीय सूत्र (जैसे, P(YX)P(Y|X))।
  2. कोड (प्रोग्रामिंग): तर्क को कंप्यूटर प्रोग्राम में बदलना। यह मॉडल को एक रेसिपी देने जैसा है जहाँ सामग्री वेरिएबल हैं और चरण कारण नियम हैं। यदि कोड चलता है, तो तर्क सही है।
  3. नेचुरल लैंग्वेज (कहानियाँ): गणित और कोड को वास्तविक दुनिया की कहानियों (जैसे राजनीतिक ड्रामा या चिकित्सा मामला) में लपेटना।

सादृश्य (Analogy): कल्पना कीजिए कि किसी को गाड़ी चलाना सिखाना।

  • सिंबोलिक घर्षण (friction) और इंजन टॉर्क के भौतिकी को पढ़ना है।
  • कोड कार के वायरिंग डायग्राम को देखना है।
  • नेचुरल लैंग्वेज वास्तव में ट्रैफिक में कार चलाना है।
    UNICO छात्र को इन तीनों को सीखने के लिए मजबूर करता है ताकि वे किसी भी स्थिति में गाड़ी चला (तर्क कर) सकें, न कि केवल आरेख (diagram) देखने के दौरान।

3. गुणवत्ता नियंत्रण: नकल करने की अनुमति नहीं है

लेखक "शॉर्टकट" की समस्या को लेकर चिंतित थे। उन्होंने यह सुनिश्चित करने के लिए एक फ़िल्टर बनाया कि प्रशिक्षण प्रश्न "ईमानदार" हों।

  • उन्होंने हर प्रश्न की जाँच की ताकि यह सुनिश्चित हो सके कि उसमें उस विशिष्ट प्रकार की सोच की आवश्यकता है जिसे वे चाहते थे (उदाहरण के लिए, यदि यह एक "इंटरवेंशन" प्रश्न था, तो मॉडल को केवल अवलोकन के आधार पर अनुमान लगाने के बजाय इंटरवेंशन तर्क का उपयोग करना ही था)।
  • उन्होंने उन सभी प्रश्नों को हटा दिया जहाँ उत्तर एक साधारण, आलसी गणना द्वारा पाया जा सकता था। इसने मॉडल को वास्तव में कठिन कारण तर्क (causal reasoning) करने के लिए मजबूर किया।

4. परिणाम: एक स्मार्ट, अधिक ईमानदार विचारक

66,000 उच्च-गुणवत्ता वाले, विविध उदाहरणों पर प्रशिक्षण के बाद, मॉडलों (विशेष रूप से Qwen3 और Olmo) में भारी सुधार देखा गया:

  • कारणता में बेहतर: वे उन कारणों वाली पहेलियों को हल करने में लगभग 23% बेहतर हुए जिन्हें उन्होंने पहले कभी नहीं देखा था।
  • सामान्य तर्क में बेहतर: यह सबसे आश्चर्यजनक हिस्सा है। चिकित्सा निदान (medical diagnosis), कानूनी निर्णयों और डेटा टेबल के विश्लेषण जैसे वास्तविक दुनिया के कार्यों पर परीक्षण करते समय, UNICO-प्रशिक्षित मॉडल ने न केवल सही उत्तर दिया; बल्कि उन्होंने अधिक ईमानदार स्पष्टीकरण भी दिए।

"फेथफुलनेस" (Faithfulness/निष्ठा) का रूपक:
कल्पना कीजिए कि एक वकील मामले में बहस कर रहा है।

  • पुराना मॉडल: शायद क्लाइंट के घबराए हुए दिखने के कारण "दोषी" के फैसले के लिए तर्क दे सकता है, लेकिन उसका लिखित तर्क कहता है, "क्लाइंट निर्दोष है, लेकिन मैं उनके जूतों का रंग पसंद करने के कारण दोषी वोट देता हूँ।" तर्क और उत्तर मेल नहीं खाते।
  • UNICO मॉडल: सबूतों के समर्थन में "दोषी" के लिए तर्क देता है क्योंकि साक्ष्य इसका समर्थन करते हैं, और उसका लिखित तर्क स्पष्ट रूप से साक्ष्यों का पालन करता है। तर्क और उत्तर एक-दूसरे के प्रति निष्ठावान (faithful) हैं।

शोध में पाया गया कि UNICO-प्रशिक्षित मॉडल अपने तर्क के अंशों (reasoning traces) में 20% अधिक निष्ठावान थे। उन्होंने केवल अनुमान नहीं लगाया; उन्होंने प्रश्न से उत्तर तक एक तार्किक पुल बनाया।

सारांश

शोध पत्र का दावा है कि लार्ज लैंग्वेज मॉडल्स को गणित, कोड और कहानियों में लिखे गए "कारण-और-प्रभाव" की समस्याओं के विशाल, विविध और कड़ाई से जांचे गए आहार से खिलाकर, वे एक "कॉज़ल माइंडसेट" (कारण संबंधी मानसिकता) सीख सकते हैं। यह न केवल उन्हें गणित की समस्याओं में बेहतर बनाता है; यह उन्हें कानून और चिकित्सा जैसे वास्तविक दुनिया के परिदृश्यों में बेहतर, अधिक ईमानदार विचारक बनाता है, जो उन्हें ऐसे कारण बनाने से रोकता है जो उनके निष्कर्षों से मेल नहीं खाते।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →