Three Lenses on Linguistic Knowledge in Pretrained Transformers: A Phenomenon-Centered Review
यह समीक्षा विषय-क्रिया सहमति (subject-verb agreement), निषेध (negation) और संरचनात्मक सामान्यीकरण (compositional generalization) पर प्रीट्रेन्ड ट्रांसफॉर्मर्स (pretrained Transformers) के प्रतिनिधि, व्यवहार संबंधी और यांत्रिक दृष्टिकोणों से साक्ष्यों को संश्लेषित करती है ताकि अभिसरण (convergence) और विखंडन (fragmentation) के विशिष्ट पैटर्न को प्रकट किया जा सके, और अंततः वर्तमान सीमाओं को स्पष्ट करने तथा भविष्य के क्रॉस-लेवल अनुसंधान को निर्देशित करने के लिए एक सुलभता-और-उपयोग (accessibility-and-use) निदान प्रस्तावित करती है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
भाषा नियमों की एक ऐसी प्रणाली है जो हमें सरल विचारों को लेकर उन्हें अनंत नए विचारों में संयोजित करने की अनुमति देती है। दशकों से, वैज्ञानिक इस बात पर विचार कर रहे हैं कि क्या वे विशाल कंप्यूटर प्रोग्राम, जो अब धाराप्रवाह पाठ लिख सकते हैं और जटिल प्रश्नों के उत्तर दे सकते हैं, वास्तव में इन नियमों को सीख चुके हैं, या वे केवल उन पैटर्न की नकल कर रहे हैं जिन्हें उन्होंने पहले देखा है। ये प्रोग्राम, जिन्हें प्रीट्रेन्ड लैंग्वेज मॉडल (pretrained language models) के रूप में जाना जाता है, मानव लेखन की विशाल मात्रा पर प्रशिक्षित होते हैं। वे ऐसे वाक्य बना सकते हैं जो पूरी तरह से स्वाभाविक लगते हैं, जिससे कई लोग यह मान लेते हैं कि वे व्याकरण और अर्थ को उसी तरह समझते हैं जैसे मनुष्य करते हैं। हालाँकि, सही शब्दों का उत्पादन करना यह जानने के समान नहीं है कि वे शब्द एक साथ क्यों आते हैं। एक प्रोग्राम किसी वाक्य को गलती से या किसी शॉर्टकट पर भरोसा करके सही बना सकता है, बिना वास्तव में अंतर्निहित तर्क को समझे। इस रहस्य को सुलझाने के लिए, शोधकर्ताओं ने इन मॉडलों के भीतर झांकने के तीन अलग-अलग तरीके विकसित किए हैं: यह जांचना कि उनकी आंतरिक स्मृति में क्या जानकारी संग्रहीत है, यह परीक्षण करना कि वे वास्तव में अपने आउटपुट में क्या उत्पन्न करते हैं, और उन विशिष्ट पथों का पता लगाना जो उन्हें निर्णय लेने के लिए प्रेरित करते हैं।
शोधकर्ता यीज़े वांग और झेनहुआ लिंग द्वारा की गई एक नई समीक्षा इन तीन तरीकों को एक साथ लाती है ताकि यह देखा जा सके कि क्या वे एक ही कहानी बताते हैं। लेखकों ने भाषा के तीन विशिष्ट क्षेत्रों पर ध्यान केंद्रित किया जो इन मॉडलों के काम करने के तरीके को समझने के लिए आवश्यक हैं: क्रियाएँ अपने कर्ता (subject) के साथ कैसे मेल खाती हैं, शब्द "not" (नहीं) वाक्य के अर्थ को कैसे बदलता है, और मॉडल परिचित भागों को मिलाकर नए, जटिल विचार कैसे बनाते हैं। इन तीन विधियों का उपयोग करने वाले सैकड़ों अध्ययनों को एकत्र करने और तुलना करने के बाद, शोधकर्ताओं ने पाया कि उत्तर पूरी तरह से इस बात पर निर्भर करता है कि आप भाषा के किस हिस्से के बारे में पूछ रहे हैं। कभी-कभी तीनों विधियों से प्राप्त प्रमाण पूरी तरह से मेल खाते हैं; अन्य समय में, विधियाँ विरोधाभासी कहानियाँ बताती हैं, जो उन कमियों को उजागर करती हैं जो मॉडलों को वास्तव में पता होती हैं।
शोधकर्ताओं द्वारा पाया गया सबसे स्पष्ट सफलता का मामला 'सब्जेक्ट-वर्ब एग्रीमेंट' (subject-verb agreement) है, वह नियम कि एक एकवचन कर्ता को एकववचन क्रिया की आवश्यकता होती है, जैसे "the cat runs" (बिल्ली दौड़ती है), जबकि एक बहुवचन कर्ता को बहुवचन क्रिया की आवश्यकता होती है, जैसे "the cats run" (बिल्लियाँ दौड़ती हैं)। इस क्षेत्र में, मॉडलों को देखने के तीन अलग-अलग तरीके सहमत हैं। जब शोधकर्ताओं ने मॉडल की आंतरिक अवस्थाओं के भीतर देखा, तो वे संज्ञा के एकवचन या बहुवचन होने का एक स्पष्ट संकेत पा सके। जब उन्होंने मॉडल के आउटपुट का परीक्षण किया, तो इसने लगभग हमेशा सही क्रिया रूप चुना। सबसे महत्वपूर्ण बात यह है कि जब शोधकर्ताओं ने उस आंतरिक संकेत को बदलने के लिए हस्तक्षेप किया, तो मॉडल का व्यवहार अनुमानित तरीके से बदल गया, जिससे उसे गलत क्रिया चुनने के लिए मजबूर होना पड़ा। यह अभिसरण (convergence) यह सुझाव देता है कि सरल व्याकरणिक नियमों के लिए, इन मॉडलों ने वास्तव में संबंध को सीखा है और निर्णय लेने के लिए इसका उपयोग करते हैं।
जब 'नेगेशन' (negation) को देखा जाता है, या यह कि मॉडल "not" शब्द को कैसे संभालते हैं, तो तस्वीर बहुत अधिक जटिल हो जाती है। यहाँ, तीनों दृष्टिकोण सहमत नहीं हैं। आंतरिक जाँच दिखाती है कि मॉडल "not" की उपस्थिति का पता लगा सकते हैं और समझ सकते हैं कि यह वाक्य में मोटे तौर पर कहाँ लागू होता है। हालाँकि, जब मॉडलों को एक नकारात्मक वाक्य के आधार पर पाठ उत्पन्न करने या प्रश्न पूछने के लिए कहा जाता है, तो वे अक्सर सही अर्थ लागू करने में विफल रहते हैं। वे "not" शब्द को देख सकते हैं लेकिन फिर भी ऐसे कार्य कर सकते हैं जैसे वाक्य सकारात्मक हो। शोधकर्ताओं ने पाया कि जबकि मॉडल मार्कर (संकेत) को पहचान सकते हैं, वे कथन के सत्य को पलटने के लिए उसका विश्वसनीय रूप से उपयोग नहीं करते हैं। यह ऐसा है जैसे मॉडल संकेत को देखता है लेकिन उस निर्देश का पालन नहीं करता जो वह देता है। यह बेमेल (mismatch) दर्शाता है कि भले ही मॉडलों के पास जानकारी के टुकड़े मौजूद हैं, वे पूर्ण अर्थ समझने के लिए उनका लगातार उपयोग नहीं कर रहे हैं।
तीसरा क्षेत्र, जिसमें नए अर्थ बनाने के लिए भाषा के विभिन्न भागों को संयोजित करना शामिल है, सबसे अधिक भ्रम दिखाता है। यह ज्ञात शब्दों और नियमों को लेकर उन स्थितियों में लागू करने की क्षमता है जिन्हें मॉडल ने पहले कभी नहीं देखा है। यहाँ साक्ष्य खंडित (fragmented) हैं। कुछ अध्ययन दिखाते हैं कि मॉडल सरल संयोजनों को संभाल सकते हैं, विशेष रूप से जब शोधकर्ता उन्हें संकेत देते हैं या कार्य को छोटे चरणों में विभाजित करते हैं। अन्य अध्ययन दिखाते हैं कि जब मॉडलों को अपने दम पर तर्क की जटिल श्रृंखलाओं को सुलझाने के लिए छोड़ दिया जाता है, तो वे अक्सर विफल हो जाते हैं। समस्या यह है कि विभिन्न अध्ययन एक ही चीज़ को नहीं देख रहे हैं। कुछ यह परीक्षण कर रहे हैं कि क्या मॉडल एक पैटर्न को पहचान सकता है, जबकि अन्य यह परीक्षण कर रहे हैं कि क्या वह शून्य से एक नया विचार बना सकता है। क्योंकि शोधकर्ता सभी अध्ययनों में इस क्षमता को मापने का एक एकल, सुसंगत तरीका नहीं खोज सके, इसलिए वे यह निष्कर्ष नहीं निकाल सके कि क्या मॉडलों के पास विचारों को संयोजित करने का एक सामान्य कौशल है या वे केवल विशिष्ट, संकीर्ण युक्तियों में कुशल हैं।
समीक्षा के लेखक सुझाव देते हैं कि ये अलग-अलग परिणाम इसलिए होते हैं क्योंकि कुछ भाषाई विशेषताओं को दूसरों की तुलना में अलग करना और उपयोग करना आसान होता है। सब्जेक्ट-वर्ब एग्रीमेंट के लिए, विशेषता सरल और अलग है, इसलिए मॉडल इसे ढूंढ सकता है और उपयोग कर सकता है। नेगेशन के लिए, मॉडल मार्कर को ढूंढ सकता है लेकिन पूरे अर्थ को बदलने के लिए इसका उपयोग करने में संघर्ष करता है। जटिल संयोजनों के लिए, विशेषता इतनी फैली हुई और परिभाषित करने में कठिन है कि मॉडल इसे स्पष्ट रूप से भी अलग नहीं कर सकता। शोधकर्ता निष्कर्ष निकालते हैं कि हम यह मानकर नहीं चल सकते कि ये मॉडल भाषा को सामान्य रूप से जानते हैं। इसके बजाय, उनका ज्ञान कार्य के प्रति विशिष्ट है। वे कुछ चीजों में उत्कृष्ट हैं, जैसे क्रियाओं का मिलान करना, लेकिन वे अन्य चीजों में, जैसे नेगेशन को समझना, असंगत हैं, और वे पुराने भागों से नए विचार बनाने के सबसे जटिल कार्य में अभी भी अपुष्ट हैं। यह खोज कि हमें इन प्रणालियों का मूल्यांकन कैसे करना चाहिए: हम केवल यह नहीं देख सकते कि वे सही उत्तर प्राप्त करते हैं या नहीं, बल्कि हमें यह भी जांचना चाहिए कि क्या वे वहां तक पहुँचने के लिए सही तर्क का उपयोग कर रहे हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।