← नवीनतम पेपर
💬 NLP

Reasoning or a Semblance of it? A Diagnostic Study of Transitive Reasoning in LLMs

यह शोध पत्र इस बात की जांच करता है कि क्या LLaMA 2 और Flan-T5 वास्तविक अनुक्रमिक तर्क (transitive reasoning) प्रदर्शित करते हैं या शब्द ओवरलैप, पूर्व-प्रशिक्षित ज्ञान और नामित संस्थाओं (named entities) को नियंत्रित करके सतही संकेतों पर निर्भर करते हैं, जो यह प्रकट करता है कि जबकि दोनों मॉडल लेक्सिकल ओवरलैप का लाभ उठाते हैं, Flan-T5 ज्ञान-आधारित हेरफेर के प्रति अधिक लचीलापन प्रदर्शित करता है, जो तार्किक समझ विकसित करने में फाइन-ट्यूनिंग की एक संभावित भूमिका का सुझाव देता है।

मूल लेखक: Houman Mehrafarin, Arash Eshghi, Ioannis Konstas

प्रकाशित 2026-09-10
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Houman Mehrafarin, Arash Eshghi, Ioannis Konstas

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आर्टिफिशियल इंटेलिजेंस के तेजी से विकसित होते क्षेत्र में, 'लार्ज लैंग्वेज मॉडल' नामक एक विशिष्ट प्रकार के कंप्यूटर प्रोग्राम ने दुनिया का ध्यान आकर्षित किया है। इंटरनेट से प्राप्त विशाल मात्रा में टेक्स्ट पर प्रशिक्षित ये सिस्टम कहानियाँ लिख सकते हैं, भाषाओं का अनुवाद कर सकते हैं और जटिल प्रश्नों के उत्तर दे सकते हैं। इन मशीनों का अध्ययन करने वाले वैज्ञानिकों के लिए एक केंद्रीय प्रश्न यह है कि क्या वे वास्तव में तर्क (लॉजिक) को समझते हैं या वे केवल उन पैटर्न की नकल कर रहे हैं जिन्हें उन्होंने पहले देखा है। इसे परखने के लिए, शोधकर्ता एक मौलिक कौशल देखते हैं जिसे 'ट्रांजिटिव रीजनिंग' (transitive reasoning) कहा जाता है। रोजमर्रा की भाषा में, यह दो अलग-अलग सूचनाओं को जोड़कर एक नया निष्कर्ष तक पहुँचने की क्षमता है। उदाहरण के लिए, यदि किसी व्यक्ति को पता है कि बिल्ली एक प्रकार का जानवर है, और सभी जानवरों को भोजन की आवश्यकता होती है, तो वह तार्किक रूप से यह निष्कर्ष निकाल सकता है कि बिल्ली को भोजन की आवश्यकता है, बिना यह स्पष्ट रूप से बताए गए कि यह विशिष्ट तथ्य क्या है। इस प्रक्रिया के लिए केवल स्मृति से अधिक की आवश्यकता होती; इसके लिए तथ्यों को आपस में बुनने की क्षमता चाहिए। हालिया शोध को चलाने वाला प्रश्न यह है कि क्या ये शक्तिशाली कंप्यूटर प्रोग्राम वास्तव में इस मानसिक बुनाई को कर रहे हैं, या वे परिचित शब्दों को पहचानकर और उत्तर का अनुमान लगाकर एक शॉर्टकट ले रहे हैं।

हेरियट-वाट यूनिवर्सिटी और एडिनबर्ग विश्वविद्यालय के शोधकर्ताओं की एक टीम ने इसी मुद्दे की जांच करने के लिए हाथ बढ़ाया। उन्होंने दो अलग-अलग प्रकार के लैंग्वेज मॉडल्स पर ध्यान केंद्रित किया, एक जिसे LLaMA 2 कहा जाता है और दूसरा Flan-T5, यह देखने के लिए कि वे दो तथ्यों को जोड़ने वाले प्रश्नों को कैसे संभालते हैं। वैज्ञानिकों ने इस तरह के thinking (सोचने) के परीक्षण के लिए डिज़ाइन किए गए दो मौजूदा प्रश्न संग्रहों का उपयोग किया। QASC नामक एक संग्रह, विज्ञान के बारे में बहुविकल्पीय प्रश्न प्रस्तुत करता है जिनमें सही उत्तर खोजने के लिए दो कथनों को जोड़ना आवश्यक होता है। दूसरा संग्रह, जिसे Bamboogle कहा जाता है, इसमें ऐसे कठिन प्रश्न हैं जो एक मानक इंटरनेट सर्च इंजन को गलत कर सकते हैं, जिससे मॉडल को अपनी स्वयं की प्रोसेसिंग पर निर्भर होना पड़ता है। शोधकर्ता यह जानना चाहते थे कि क्या मॉडल वास्तव में चरणों के माध्यम से तर्क कर रहे हैं या वे केवल विशिष्ट शब्दों, जैसे तारीखों या नामों, पर टिके हुए हैं जो प्रश्न और उत्तर दोनों में दिखाई देते हैं।

सत्य का पता लगाने के लिए, टीम ने चतुर प्रयोगों की एक श्रृंखला डिजाइन की जहाँ उन्होंने व्यवस्थित रूप से मॉडलों को दी जाने वाली जानकारी को बदला। उन्होंने यह जाँचने से शुरुआत की कि क्या मॉडल तथ्यों और उन्हें जोड़ने के एक स्पष्ट उदाहरण के साथ समस्याओं को हल कर सकते हैं। दोनों मॉडलों ने इन परिस्थितियों में अच्छा प्रदर्शन किया, लेकिन शोधकर्ताओं को संदेह था कि यह बहुत आसान हो सकता है। इसके बाद उन्होंने तथ्यों को जोड़ने के उदाहरण को हटा दिया, जिससे मॉडल इसे खुद समझने के लिए स्वतंत्र छोड़ दिए गए। परिणाम काफी खुलासा करने वाले थे। Flan-T5 मॉडल, जिसे विशेष रूप से समान रीजनिंग कार्यों पर प्रशिक्षित किया गया था, बिना उदाहरण के भी बहुत अच्छा प्रदर्शन करता रहा। हालाँकि, LLaMA 2 मॉडल उस मार्गदर्शन के बिना काफी संघर्ष करता रहा, जिससे पता चलता है कि वह उस पैटर्न को देखने पर बहुत अधिक निर्भर था जिसे वह पालन करने से पहले देख सके।

शोधकर्ताओं ने यह देखने के लिए कि क्या मॉडल शब्दों के अर्थ को वास्तव में समझ रहे हैं, एक अधिक कठोर दृष्टिकोण अपनाया। उन्होंने तथ्यों के भीतर शब्दों के क्रम को उलट दिया, जिससे स्पष्ट वाक्य अर्थहीन शब्दों की उलझी हुई कतारों में बदल गए। यदि मॉडल वास्तव में अर्थ के बारे में तर्क कर रहे होते, तो यह अराजकता उत्तरों को खोजना असंभव बना देती। आश्चर्यजनक रूप से, मॉडलों का प्रदर्शन मुश्किल से गिरा। वे अभी भी सही उत्तर चुनने में सक्षम थे भले ही वाक्य व्याकरणिक रूप से सही न हों। इससे संकेत मिला कि वे वाक्यों को सुसंगत विचारों के रूप में नहीं पढ़ रहे थे। इसके बजाय, वे संभवतः उत्तर विकल्पों से मेल खाने वाले विशिष्ट कीवर्ड्स को स्कैन कर रहे थे। जब शोधकर्ताओं ने उन मिलान करने वाले कीवर्ड्स को पूरी तरह से हटा दिया, तो मॉडलों की सटीकता तेजी से गिर गई, जिससे पुष्टि हुई कि वे अक्सर केवल शब्दों का मिलान कर रहे थे न कि तर्क का निष्कर्ष निकाल रहे थे।

यह संभावना खारिज करने के लिए कि मॉडल केवल अपने प्रशिक्षण डेटा से उत्तरों को याद कर रहे हैं, टीम ने Bamboogle डेटासेट की ओर मुड़ी, जिसमें ऐसे प्रश्न थे जिन्हें मॉडलों ने पहले कभी नहीं देखा था। यहाँ, उन्होंने एक अंतिम, कठोर परीक्षण पेश किया। उन्होंने लोगों, स्थानों और तारीखों के नामों को—जो विशिष्ट संस्थाएं हैं जो अक्सर उत्तरों में दिखाई देती हैं—बेमतलब के शब्दों से बदल दिया। उन्होंने तथ्यों में शब्दों के क्रम को भी उलट दिया। जब मॉडल इन निरर्थक संस्करणों के सामने आए, तो LLaMA 2 मॉडल लगभग पूरी तरह से विफल रहा। वह परिचित नामों और तारीखों के बिना उत्तर नहीं ढूंढ सका जो उसे मार्गदर्शन दे सकें। हालाँकि, Flan-T5 मॉडल ने एक अलग प्रकार की लचीलापन दिखाया। हालाँकि इसका प्रदर्शन गिरा, लेकिन यह दूसरे मॉडल की तुलना में काफी बेहतर बना रहा। यह सुझाव देता है कि क्योंकि Flan-T5 को स्पष्ट रूप से रीजनिंग कार्यों पर प्रशिक्षित किया गया था, इसलिए इसने एक अधिक मजबूत क्षमता विकसित की थी कि वह तार्किक श्रृंखला का पालन कर सके, भले ही परिचित संकेतों को हटा दिया गया हो।

अध्ययन निष्कर्ष निकालता है कि हालांकि लार्ज लैंग्वेज मॉडल्स ऐसा प्रतीत कर सकते हैं कि वे तर्क कर रहे हैं, उनकी सफलता अक्सर उनके प्रशिक्षण के विशिष्ट तरीके और टेक्स्ट में उपलब्ध संकेतों पर निर्भर करती है। उन मॉडल्स के लिए जिन्हें विशेष रूप से रीजनिंग कार्यों पर फाइन-ट्यून नहीं किया गया है, जटिल प्रश्नों का उत्तर देने की क्षमता वास्तविक तार्किक निष्कर्ष निकालने के बजाय परिचित शब्दों और पैटर्न को पहचानने पर बहुत अधिक निर्भर करती है। भले ही वे चरण-दर-चरण सोचते हुए प्रतीत हों, वे केवल सही कीवर्ड्स को खोज रहे हो सकते हैं। हालाँकि, शोध का सुझाव है कि जब किसी मॉडल को तथ्यों को जोड़ने का तरीका सिखाने के लिए डिज़ाइन किए गए डेटासेट्स पर सावधानीपूर्वक प्रशिक्षित किया जाता है, तो वह ट्रांसिटिव रीजनिंग की अधिक वास्तविक क्षमता विकसित कर सकता है। यह क्षमता इसे उन प्रश्नों को संभालने की अनुमति देती है जब सामान्य शॉर्टकट, जैसे पहचानने योग्य नाम या तारीखें, हटा दिए जाते हैं। निष्कर्ष इस बात की याद दिलाते हैं कि रीजनिंग टेस्ट पर उच्च स्कोर हमेशा यह साबित नहीं करता कि मशीन तर्क को समझती है; कभी-कभी, यह केवल सही शब्दों को खोजने में बहुत अच्छी होती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →