CommonWhy: A Dataset for Evaluating Entity-Based Causal Commonsense Reasoning in Large Language Models
यह शोधपत्र CommonWhy प्रस्तुत करता है, जो 15,000 इकाई-आधारित "क्यों" वाले प्रश्नों का एक डेटासेट है जो बड़े भाषा मॉडलों की कारण संबंधी सामान्य ज्ञान (causal commonsense) और अपवर्तक स्पष्टीकरण (abductive explanation) क्षमताओं का मूल्यांकन करता है, जो विकीडेटा (Wikidata) में सहायक ज्ञान की उपलब्धता के बावजूद वर्तमान मॉडलों में महत्वपूर्ण कमियों को प्रकट करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, विद्वान रोबोट सहायक है। आपने उससे हजारों सवाल पूछे हैं जैसे, "क्या यह सच है कि हैरी पॉटर उड़ सकता है?" या "क्या अरस्तू के पास लैपटॉप था?" रोबोट इन "हाँ" या "नहीं" वाले सवालों के जवाब देने में बहुत माहिर हो गया है क्योंकि वह अपने विशाल तथ्य पुस्तकालय को स्कैन करके उत्तर ढूंढ सकता है।
लेकिन अब, कल्पना कीजिए कि आप रोबोट से कुछ बहुत अधिक कठिन पूछते हैं: "कतरिना बारले को 2024 चैंपियंस लीग फाइनल देखने के लिए वीज़ा की आवश्यकता क्यों नहीं पड़ी?"
यहीं पर रोबोट लड़खड़ाने लगता है। यह वह समस्या है जिसे CommonWhy पेपर हल करने की कोशिश कर रहा है।
समस्या: रोबोट "कड़ियों को जोड़" नहीं पाता है
लेखकों का तर्क है कि जबकि रोबट तथ्य प्राप्ति (एक किताब में एक विशिष्ट तथ्य ढूंढना) में बेहतरीन हैं, वे कारण संबंधी तर्क (causal reasoning) (सामान्य समझ के साथ विभिन्न तथ्यों को जोड़कर यह समझना कि कुछ क्यों हुआ) में बहुत खराब हैं।
इसे इस तरह सोचें:
- तथ्य प्राप्ति (Fact Retrieval) एक डायरेक्टरी में फोन नंबर खोजने जैसा है।
- कारण संबंधी तर्क (Causal Reasoning) एक जासूस होने जैसा है। आपको फोन नंबर देखना होगा, यह महसूस करना होगा कि वह व्यक्ति एक अलग देश में रहता है, याद करना होगा कि उस देश का उस व्यक्ति के गृह देश के साथ वीज़ा-मुक्त समझौता है, और फिर निष्कर्ष निकालना होगा, "आह, इसीलिए उन्हें वीज़ा की आवश्यकता नहीं थी!"
वर्तमान रोबोट अक्सर इस जासूसी कार्य में विफल हो जाते हैं। वे या तो उत्तर का अनुमान लगा सकते हैं, मनगढ़ंत तथ्य बना सकते हैं (hallucinations), या बस अटक सकते हैं क्योंकि उत्तर उनके प्रशिक्षण डेटा में किसी एक वाक्य में लिखा हुआ नहीं है।
समाधान: एक नया "जासूसी परीक्षण"
शोधकर्ताओं ने एक नया डेटासेट बनाया जिसे CommonWhy कहा जाता है। इसे एक विशाल, 15,000-प्रश्नों वाले "जासूसी परीक्षण" के रूप में समझें जो विशेष रूप से यह परीक्षण करने के लिए डिज़ाइन किया गया है कि ये रोबोट यह समझने में कितने अच्छे हैं कि चीजें क्यों होती हैं।
यहाँ बताया गया है कि उन्होंने इस परीक्षा को कैसे बनाया:
- नियम (Axioms): सबसे पहले, उन्होंने AI को दुनिया के कुछ बुनियादी नियम दिए, जैसे "यदि आप देश A के नागरिक हैं, और देश B देश A के नागरिकों को बिना वीज़ा के यात्रा करने की अनुमति देता है, तो आपको वीज़ा की आवश्यकता नहीं है।"
- पात्र (Entities): उन्होंने वास्तविक लोगों, स्थानों और घटनाओं को लिया जो Wikidata (जो संरचित डेटा के लिए विकिपीडिया जैसा है) नामक एक विशाल डेटाबेस से लिए गए हैं।
- प्रश्न: उन्होंने नियमों को पात्रों के साथ मिलाकर प्रश्न बनाए। उदाहरण के लिए: "व्यक्ति X को Y कार्यक्रम में जाने के लिए वीज़ा की आवश्यकता क्यों नहीं पड़ी?"
- उत्तर: महत्वपूर्ण बात यह है कि उन्होंने केवल एक सही उत्तर नहीं खोजा। वास्तविक दुनिया में, अक्सर कई कारण होते हैं। हो सकता है कि व्यक्ति X को वीज़ा की आवश्यकता इसलिए नहीं थी क्योंकि वे मेजबान देश के नागरिक हैं, या शायद इसलिए क्योंकि वे एक राजनयिक हैं। यह डेटासेट सभी वैध संभावनाओं को शामिल करता है।
परिणाम: रोबोट परीक्षा में विफल रहे
शोधकर्ताओं ने इस परीक्षा पर आज के सबसे स्मार्ट AI मॉडल (नवीनतम "तर्क करने वाले" मॉडलों सहित) का परीक्षण किया। परिणाम आश्चर्यजनक और थोड़े चिंताजनक थे:
- वे अटक गए: सर्वश्रेष्ठ मॉडल भी केवल लगभग 68% उत्तर सही दे पाए। यह उस सिस्टम के लिए एक फेलिंग ग्रेड है जिससे हम सुपर-इंटेलिजेंट होने की उम्मीद करते हैं।
- उन्होंने चीजें बनाईं: जब मॉडल सही उत्तर दे भी रहे थे, तो वे वहां तक पहुँचने के लिए अक्सर फर्जी तथ्यों को शामिल कर रहे थे। यह एक छात्र के गणित का सही उत्तर देने लेकिन उसे करने के लिए एक बनावटी फॉर्मूला उपयोग करने जैसा है।
- "लॉन्ग-टेल" (Long-Tail) समस्या: रोबots तब और भी खराब प्रदर्शन करते थे जब प्रश्नों में कम प्रसिद्ध या कम चर्चित लोग या स्थान शामिल होते थे (जिसे "लॉन्ग-टेल" कहा जाता है)। वे वास्तव में तर्क करने के बजाय प्रसिद्ध तथ्यों को याद रखने पर अधिक निर्भर लग रहे थे।
- पुराने उपकरण काम नहीं करते: उन्होंने डेटाबेस प्रश्नों (KGQA) के लिए डिज़ाइन किए गए मानक उपकरणों का उपयोग किया, लेकिन वे बुरी तरह विफल रहे। वे तथ्य खोजने के लिए बने हैं, यह समझाने के लिए नहीं कि चीजें क्यों होती हैं।
बड़ी तस्वीर
पेपर निष्कर्ष निकालता है कि हमारे पास AI के लिए एक नई, बहुत कठिन चुनौती है। हम केवल रोबोट को तथ्य याद करने या सरल "सही/गलत" प्रश्नों के उत्तर देने के लिए नहीं कह सकते। यदि हम चाहते हैं कि वे वास्तविक दुनिया के साथ प्रभावी ढंग से बातचीत करें, तो हमें उन्हें जासूस बनना सिखाना होगा—यह समझना होगा कि तथ्यों को सामान्य समझ के साथ कैसे जोड़ा जाए ताकि यह समझाया जा सके कि दुनिया कैसे काम करती है।
CommonWhy पहला उपकरण है जो हमें यह मापने में मदद करता है कि क्या रोबोट वास्तव में इस प्रकार की सोच में बेहतर हो रहे हैं, या वे केवल अनुमान लगाने में बेहतर हो रहे हैं। अभी, पेपर कहता है कि वे ज्यादातर केवल अनुमान ही लगा रहे हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।