← नवीनतम पेपर
💬 NLP

CommonWhy: A Dataset for Evaluating Entity-Based Causal Commonsense Reasoning in Large Language Models

यह शोधपत्र CommonWhy प्रस्तुत करता है, जो 15,000 इकाई-आधारित "क्यों" वाले प्रश्नों का एक डेटासेट है जो बड़े भाषा मॉडलों की कारण संबंधी सामान्य ज्ञान (causal commonsense) और अपवर्तक स्पष्टीकरण (abductive explanation) क्षमताओं का मूल्यांकन करता है, जो विकीडेटा (Wikidata) में सहायक ज्ञान की उपलब्धता के बावजूद वर्तमान मॉडलों में महत्वपूर्ण कमियों को प्रकट करता है।

मूल लेखक: Armin Toroghi, Faeze Moradi Kalarde, Scott Sanner

प्रकाशित 2026-05-14
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Armin Toroghi, Faeze Moradi Kalarde, Scott Sanner

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, विद्वान रोबोट सहायक है। आपने उससे हजारों सवाल पूछे हैं जैसे, "क्या यह सच है कि हैरी पॉटर उड़ सकता है?" या "क्या अरस्तू के पास लैपटॉप था?" रोबोट इन "हाँ" या "नहीं" वाले सवालों के जवाब देने में बहुत माहिर हो गया है क्योंकि वह अपने विशाल तथ्य पुस्तकालय को स्कैन करके उत्तर ढूंढ सकता है।

लेकिन अब, कल्पना कीजिए कि आप रोबोट से कुछ बहुत अधिक कठिन पूछते हैं: "कतरिना बारले को 2024 चैंपियंस लीग फाइनल देखने के लिए वीज़ा की आवश्यकता क्यों नहीं पड़ी?"

यहीं पर रोबोट लड़खड़ाने लगता है। यह वह समस्या है जिसे CommonWhy पेपर हल करने की कोशिश कर रहा है।

समस्या: रोबोट "कड़ियों को जोड़" नहीं पाता है

लेखकों का तर्क है कि जबकि रोबट तथ्य प्राप्ति (एक किताब में एक विशिष्ट तथ्य ढूंढना) में बेहतरीन हैं, वे कारण संबंधी तर्क (causal reasoning) (सामान्य समझ के साथ विभिन्न तथ्यों को जोड़कर यह समझना कि कुछ क्यों हुआ) में बहुत खराब हैं।

इसे इस तरह सोचें:

  • तथ्य प्राप्ति (Fact Retrieval) एक डायरेक्टरी में फोन नंबर खोजने जैसा है।
  • कारण संबंधी तर्क (Causal Reasoning) एक जासूस होने जैसा है। आपको फोन नंबर देखना होगा, यह महसूस करना होगा कि वह व्यक्ति एक अलग देश में रहता है, याद करना होगा कि उस देश का उस व्यक्ति के गृह देश के साथ वीज़ा-मुक्त समझौता है, और फिर निष्कर्ष निकालना होगा, "आह, इसीलिए उन्हें वीज़ा की आवश्यकता नहीं थी!"

वर्तमान रोबोट अक्सर इस जासूसी कार्य में विफल हो जाते हैं। वे या तो उत्तर का अनुमान लगा सकते हैं, मनगढ़ंत तथ्य बना सकते हैं (hallucinations), या बस अटक सकते हैं क्योंकि उत्तर उनके प्रशिक्षण डेटा में किसी एक वाक्य में लिखा हुआ नहीं है।

समाधान: एक नया "जासूसी परीक्षण"

शोधकर्ताओं ने एक नया डेटासेट बनाया जिसे CommonWhy कहा जाता है। इसे एक विशाल, 15,000-प्रश्नों वाले "जासूसी परीक्षण" के रूप में समझें जो विशेष रूप से यह परीक्षण करने के लिए डिज़ाइन किया गया है कि ये रोबोट यह समझने में कितने अच्छे हैं कि चीजें क्यों होती हैं।

यहाँ बताया गया है कि उन्होंने इस परीक्षा को कैसे बनाया:

  1. नियम (Axioms): सबसे पहले, उन्होंने AI को दुनिया के कुछ बुनियादी नियम दिए, जैसे "यदि आप देश A के नागरिक हैं, और देश B देश A के नागरिकों को बिना वीज़ा के यात्रा करने की अनुमति देता है, तो आपको वीज़ा की आवश्यकता नहीं है।"
  2. पात्र (Entities): उन्होंने वास्तविक लोगों, स्थानों और घटनाओं को लिया जो Wikidata (जो संरचित डेटा के लिए विकिपीडिया जैसा है) नामक एक विशाल डेटाबेस से लिए गए हैं।
  3. प्रश्न: उन्होंने नियमों को पात्रों के साथ मिलाकर प्रश्न बनाए। उदाहरण के लिए: "व्यक्ति X को Y कार्यक्रम में जाने के लिए वीज़ा की आवश्यकता क्यों नहीं पड़ी?"
  4. उत्तर: महत्वपूर्ण बात यह है कि उन्होंने केवल एक सही उत्तर नहीं खोजा। वास्तविक दुनिया में, अक्सर कई कारण होते हैं। हो सकता है कि व्यक्ति X को वीज़ा की आवश्यकता इसलिए नहीं थी क्योंकि वे मेजबान देश के नागरिक हैं, या शायद इसलिए क्योंकि वे एक राजनयिक हैं। यह डेटासेट सभी वैध संभावनाओं को शामिल करता है।

परिणाम: रोबोट परीक्षा में विफल रहे

शोधकर्ताओं ने इस परीक्षा पर आज के सबसे स्मार्ट AI मॉडल (नवीनतम "तर्क करने वाले" मॉडलों सहित) का परीक्षण किया। परिणाम आश्चर्यजनक और थोड़े चिंताजनक थे:

  • वे अटक गए: सर्वश्रेष्ठ मॉडल भी केवल लगभग 68% उत्तर सही दे पाए। यह उस सिस्टम के लिए एक फेलिंग ग्रेड है जिससे हम सुपर-इंटेलिजेंट होने की उम्मीद करते हैं।
  • उन्होंने चीजें बनाईं: जब मॉडल सही उत्तर दे भी रहे थे, तो वे वहां तक पहुँचने के लिए अक्सर फर्जी तथ्यों को शामिल कर रहे थे। यह एक छात्र के गणित का सही उत्तर देने लेकिन उसे करने के लिए एक बनावटी फॉर्मूला उपयोग करने जैसा है।
  • "लॉन्ग-टेल" (Long-Tail) समस्या: रोबots तब और भी खराब प्रदर्शन करते थे जब प्रश्नों में कम प्रसिद्ध या कम चर्चित लोग या स्थान शामिल होते थे (जिसे "लॉन्ग-टेल" कहा जाता है)। वे वास्तव में तर्क करने के बजाय प्रसिद्ध तथ्यों को याद रखने पर अधिक निर्भर लग रहे थे।
  • पुराने उपकरण काम नहीं करते: उन्होंने डेटाबेस प्रश्नों (KGQA) के लिए डिज़ाइन किए गए मानक उपकरणों का उपयोग किया, लेकिन वे बुरी तरह विफल रहे। वे तथ्य खोजने के लिए बने हैं, यह समझाने के लिए नहीं कि चीजें क्यों होती हैं।

बड़ी तस्वीर

पेपर निष्कर्ष निकालता है कि हमारे पास AI के लिए एक नई, बहुत कठिन चुनौती है। हम केवल रोबोट को तथ्य याद करने या सरल "सही/गलत" प्रश्नों के उत्तर देने के लिए नहीं कह सकते। यदि हम चाहते हैं कि वे वास्तविक दुनिया के साथ प्रभावी ढंग से बातचीत करें, तो हमें उन्हें जासूस बनना सिखाना होगा—यह समझना होगा कि तथ्यों को सामान्य समझ के साथ कैसे जोड़ा जाए ताकि यह समझाया जा सके कि दुनिया कैसे काम करती है।

CommonWhy पहला उपकरण है जो हमें यह मापने में मदद करता है कि क्या रोबोट वास्तव में इस प्रकार की सोच में बेहतर हो रहे हैं, या वे केवल अनुमान लगाने में बेहतर हो रहे हैं। अभी, पेपर कहता है कि वे ज्यादातर केवल अनुमान ही लगा रहे हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →