← नवीनतम पेपर
💬 NLP

LOGICAL-COMMONSENSEQA: A Benchmark for Logical Commonsense Reasoning

यह शोध पत्र LOGICAL-COMMONSENSEQA का परिचय देता है, जो एक नया बेंचमार्क है जो सामान्य ज्ञान तर्क (commonsense reasoning) को AND, OR, और NEITHER/NOR जैसे ऑपरेटरों का उपयोग करके कथनों के युग्मों पर तार्किक संयोजन (logical composition) के रूप में पुनर्गठित करता है, जिससे यह पता चलता है कि जबकि वर्तमान मॉडल संयोजक (conjunctive) और विविक्त (disjunctive) कार्यों को उचित रूप से संभालते हैं, वे निषेध-आधारित (negation-based) तर्क में काफी संघर्ष करते हैं।

मूल लेखक: Obed Junias, Maria Leonor Pacheco

प्रकाशित 2026-04-21
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Obed Junias, Maria Leonor Pacheco

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को दुनिया को समझना सिखा रहे हैं, केवल तथ्यों को रटने के लिए नहीं, बल्कि "कॉमन सेंस" (सामान्य ज्ञान) का उपयोग करने के लिए—वह सहज ज्ञान जो मनुष्यों के पास चीजों के काम करने के तरीके के बारे में होता है।

लंबे समय तक, हमने इन रोबोटों का परीक्षण सरल बहुविकल्पीय प्रश्नों के साथ किया। यह एक बच्चे से पूछने जैसा था, "जंगल में लोमड़ी क्या खोजती है?" और उन्हें चार उत्तर देना: A) एक किला, B) एक पिज्जा, C) एक मांद (den), D) एक स्विमिंग पूल। रोबोट को बस सही उत्तर (C) चुनना था।

समस्या:
इस शोध पत्र के लेखक तर्क देते हैं कि यह परीक्षण बहुत आसान और भ्रामक है। वास्तविक जीवन में, दुनिया अव्यवस्थित होती है। कभी-कभी, दो चीजें एक साथ सच हो सकती हैं। कभी-कभी, दो में से कोई भी चीज़ समझ में नहीं आती। और कभी-कभी, रोबोट इसलिए भ्रमित हो जाता है क्योंकि वह एक एकल "सही" उत्तर की तलाश में होता है जबकि वास्तव में स्थिति में विचारों के संयोजन को समझने की आवश्यकता होती है।

यह एक रोबोट से पूछने जैसा है: "क्या कुकी खाना ठीक है?"

  • पुराना परीक्षण: रोबोट बस कहता है "हाँ।"
  • वास्तविक जीवन: "हाँ, यदि आप भूखे हैं। नहीं, यदि आपको एलर्जी है। नहीं, यदि वह किसी और की कुकी है।" रोबकों को इन संयोजनों को संभालना होगा।

नया समाधान: LOGICAL-COMMONSENSEQA

शोधकर्ताओं ने एक नया, कठिन परीक्षण बनाया जिसे LOGICAL-COMMONSENSEQA कहा जाता है। उत्तर चुनने के बजाय, वे रोबोट से तीन सरल तार्किक "स्विचों" का उपयोग करके उत्तरों के जोड़ों (pairs) का निर्णय लेने के लिए कहते हैं:

  1. "AND" स्विच (दोनों सत्य हैं):

    • प्रश्न: "लोमड़ी कहाँ जा सकती है?"
    • विकल्प: "एक मांद (den) और एक पेड़ का खोखला हिस्सा।"
    • तर्क: दोनों ही लोमड़ी के लिए संभावित स्थान हैं। यह ऐसा है जैसे कहना, "मैं एक सेब AND एक केला खा सकता हूँ।" दोनों काम करते हैं।
  2. "OR" स्विच (कम से कम एक सत्य है):

    • प्रश्न: "लोमड़ी कहाँ जा सकती है?"
    • विकल्प: "एक मांद OR एक व्यस्त शहर की सड़क।"
    • तर्क: एक मांद प्रशंसनीय है; एक व्यस्त सड़क नहीं है। लेकिन चूंकि नियम "OR" है, इसलिए विकल्प अभी भी वैध है क्योंकि एक भाग काम करता है। यह ऐसा है जैसे कहना, "मैं कॉफी OR चाय लूँगा।" जब तक मुझे एक मिल जाए, मैं खुश हूँ।
  3. "NEITHER/NOR" स्विच (दोनों में से कोई भी सत्य नहीं है):

    • प्रश्न: "लोमड़ी कहाँ जा सकती है?"
    • विकल्प: "न तो एक स्विमिंग पूल NOR एक पिज्जा शॉप।"
    • तर्क: दोनों ही लोमड़ी के लिए बेतुके हैं। यह सबसे कठिन हिस्सा है। रोबोट को यह समझना होगा कि दोनों विचार गलत हैं।

जब उन्होंने रोबोटों का परीक्षण किया तो क्या हुआ?

शोधकर्ताओं ने इस नए खेल पर कई अलग-अलग AI मॉडल (रोबोट) का परीक्षण किया। यहाँ उन्होंने क्या पाया, एक सरल उपमा का उपयोग करते हुए:

  • "AND" का खेल: रोबोट इसमें काफी अच्छे थे। यदि आपने पूछा, "क्या एक कुत्ता AND एक बिल्ली एक पालतू जानवर है?", तो उन्होंने "हाँ" कहा। वे दो अच्छे विचारों को जोड़ने में सक्षम थे।
  • "OR" का खेल: वे ठीक थे, लेकिन कभी-कभी भ्रमित हो गए। यदि आपने कहा, "एक कुत्ता OR एक टोस्टर एक पालतू जानवर है," तो वे कभी-कभी लड़खड़ा गए क्योंकि एक टोस्टर स्पष्ट रूप से गलत है, भले ही "OR" नियम का अर्थ है कि यदि एक भाग सही है तो पूरा वाक्य तकनीकी रूप से वैध है।
  • "NEITHER/NOR" का खेल (बड़ी विफलता): यहीं पर रोबोट पूरी तरह से क्रैश हो गए।
    • परीक्षण: "क्या यह सच है कि एक लोमड़ी NEITHER एक स्विमिंग पूल NOR एक पिज्जा शॉप पर जाएगी?"
    • रोबोट की गलती: रोबोट ने "स्विमिंग पूल" और "पिज्जा शॉप" देखा और सोचा, "रुको, वे मज़ेदार चीज़ें हैं! मुझे मज़ेदार चीज़ें पसंद हैं!" वह शब्द NEITHER को भूल गया। उसने "सबसे प्रशंसनीय" वस्तुओं को चुनने की कोशिश की, भले ही प्रश्न में सबसे कम प्रशंसनीय वस्तुओं के बारे में पूछा गया था।

रूपक (Metaphor):
कल्प laइए कि आप एक खेल खेल रहे हैं जहाँ आपको "खराब" सेब खोजने हैं।

  • यदि आप पूछते हैं, "क्या ये दोनों सेब अच्छे हैं?" (AND), तो रोबोट स्मार्ट है।
  • यदि आप पूछते हैं, "क्या इनमें से कम से कम एक सेब अच्छा है?" (OR), तो रोबोट ठीक है।
  • लेकिन यदि आप पूछते हैं, "क्या NEITHER (इनमें से कोई भी नहीं) सेब अच्छा है?" (NEITHER/NOR), तो रोबोट भ्रमित हो जाता है। वह सेबों को देखता है और सोचता है, "ओह, वे सेब दिखते हैं! मुझे उन्हें चुनना चाहिए!" वह यह समझने में विफल रहता है कि निर्देश दोनों को अस्वीकार करने का है।

यह क्यों मायने रखता है?

यह शोध पत्र दिखाता है कि वर्तमान AI मॉडल ऐसे छात्रों की तरह हैं जो तथ्य रटने में माहिर हैं लेकिन तर्क (logic) में बहुत खराब हैं। वे वास्तव में सोचने के बजाय "सतही संकेतों" (जैसे "लोमड़ी" शब्द देखकर "मांद" के बारे में सोचना) पर निर्भर करते हैं।

  • अच्छी खबर: यदि आप रोबोटों को विशेष रूप से इस नए, कठिन खेल पर प्रशिक्षित करते हैं (fine-tuning), तो वे इसमें बहुत अच्छे हो जाते हैं। यह साबित करता है कि वे सीख सकते हैं, लेकिन उन्हें अभी तक सही तरीके से नहीं सिखाया गया है।
  • बुरी खबर: अतिरिक्त प्रशिक्षण के बिना, यहाँ तक कि सबसे स्मार्ट AI मॉडल भी नकारात्मक तर्क ( "NEITHER" वाला हिस्सा) को समझने में बुरी तरह विफल रहते हैं।

निचोड़ (Bottom Line)

यह शोध पत्र एक चेतावनी है। यह हमें बताता है कि AI को वास्तव में "स्मार्ट" और मानव जैसा बनाने के लिए, हम केवल उससे एक सही उत्तर वाले सरल प्रश्न नहीं पूछ सकते। हमें यह परीक्षण करने की आवश्यकता है कि क्या वह वास्तविक जीवन के जटिल, उलझे हुए और कभी-कभी नकारात्मक तर्क को संभाल सकता है।

यह एक ऐसे रोबोट के बीच का अंतर है जो शब्दकोश पढ़ सकता है और एक ऐसे रोबोट के बीच का अंतर है जो वास्तव में इस बारे में बातचीत कर सकता है कि क्या हो सकता है, क्या नहीं हो सकता है, और जब आप दो विचारों को एक साथ रखते हैं तो क्या समझ में आता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →