How Language Models Process Negation
यह शोध पत्र लार्ज लैंग्वेज मॉडल्स (Large Language Models) में निषेध (negation) की यांत्रिक प्रक्रिया की जांच करता है, जो यह प्रकट करता है कि जहाँ कम सटीकता देर से आने वाले लेयर अटेंशन शॉर्टकट्स (late-layer attention shortcuts) से उत्पन्न होती है, वहीं मॉडल नकारात्मक वाक्यांशों को सही ढंग से संभालने के लिए आंतरिक रूप से दमनकारी (suppressive) और रचनात्मक (constructive) दोनों तंत्रों का उपयोग करते हैं—जिसमें बाद वाला प्रमुख है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक लार्ज लैंग्वेज मॉडल (LLM) की कल्पना एक अत्यधिक कुशल, लेकिन थोड़े विचलित लाइब्रेरियन (पुस्तकालयाध्यक्ष) के रूप में करें जो किसी प्रश्न का उत्तर देने की कोशिश कर रहा है। आपके द्वारा प्रदान किया गया पेपर, "How Language Models Process Negation," इस बात की जांच करता है कि जब आप एक पेचीदा सवाल पूछते जिसमें "not" (नहीं) शब्द शामिल हो, तो इस लाइब्रेरियन के मस्तिष्क के अंदर क्या होता है।
यहाँ उनके निष्कर्षों की कहानी दी गई है, जिसे सरल अवधारणाओं में विभाजित किया गया है।
1. समस्या: लाइब्रेरियन "Not" से भ्रमित हो जाता है
शोधकर्ताओं ने एक साधारण अवलोकन से शुरुआत की: यदि आप एक आधुनिक AI से पूछते हैं, "वह कौन सा जानवर है जो एम्फीबियन (उभयचर) नहीं है?" तो यह अक्सर गलत उत्तर देता है, जैसे "मेंढक" (जो कि एक एम्फीबियन है)। ऐसा लगता है जैसे AI "not" शब्द को पूरी तरह से अनदेखा कर रहा है।
हालाँकि, पेपर एक आश्चर्यजनक मोड़ प्रकट करता है: AI वास्तव में "not" को पूरी तरह से समझता है। बस, इसकी समझ बुरी आदतों की एक परत के नीचे दब जाती है।
2. दो प्रतिस्पर्धी तंत्र: "निर्माण" बनाम "शॉर्टकट"
AI कैसे सोचता है, इसे समझने के लिए शोधकर्ताओं ने देखा कि यह नकारात्मक वाक्य को संभालने के दो अलग-अलग तरीकों में से किसका उपयोग करता है। उन्होंने इनकी तुलना एक व्यक्ति द्वारा पहेली सुलझाने के दो अलग-अलग तरीकों से की:
परिकल्पना 1: "सप्रेशन" (दमन) रणनीति (इरेज़र/मिटाने वाला)
कल्पना कीजिए कि आपके पास जानवरों की एक सूची है। "एम्फीबियन नहीं" का उत्तर देने के लिए, आप सूची लेते हैं, "एम्फीबियंस" को ढूंढते हैं, और एक इरेज़र का उपयोग करके उन्हें काट देते हैं। आपके पास बाकी सब कुछ बच जाता है।- पेपर का निष्कर्ष: AI ऐसा थोड़ा बहुत करता है, लेकिन यह इसके काम करने का मुख्य तरीका नहीं है।
परिकल्पना 2: "कंस्ट्रक्शन" (निर्माण) रणनीति (आर्किटेक्ट/वास्तुकार)
इसके बजाय केवल मिटाने के बजाय, कल्पना कीजिए कि AI एक बिल्कुल नई मानसिक तस्वीर बनाता है। जब यह "not gas" (गैस नहीं) सुनता है, तो यह केवल "gas" के बारे में नहीं सोचता और उसे काट देता है। यह सक्रिय रूप से अपने मन में एक नया कॉन्सेप्ट (अवधारणा) बनाता है: "Solid" (ठोस)। यह एक मानसिक मॉडल बनाता है कि उसका विपरीत क्या दिखता है।- पेपर का निष्कर्ष: यही विजेता है। AI मुख्य रूप से एक आर्किटेक्ट है। यह नकारात्मक अवधारणा का एक प्रतिनिधित्व (जैसे, "not gas" को "solid" में बदलना) सक्रिय रूप से बनाता है और उत्तर खोजने के लिए उसका उपयोग करता है।
3. खलनायक: "शॉर्टकट" की आदत
तो, यदि AI इन "नकारात्मक अवधारणाओं" को बनाने में इतना अच्छा है, तो यह अभी भी गलत उत्तर क्यों देता है?
पेपर AI के मस्तिष्क के भीतर "बुरे अभिनेताओं" के एक समूह की पहचान करता है, विशेष रूप से बाद की परतों (later layers) में (AI के बोलने से ठीक पहले के अंतिम चरण)। शोधकर्ता इन्हें "शॉर्टकट अटेंशन हेड्स" (Shortcut Attention Heads) कहते हैं।
- उपमा: कल्पना कीजिए कि AI एक परीक्षा दे रहा छात्र है। छात्र को सही उत्तर पता है (क्योंकि उसने "not gas" = "solid" की अवधारणा बनाई है)। लेकिन, उत्तर लिखने से ठीक पहले, उसके मस्तिष्क का एक आलसी हिस्सा फुसफुसाता है, "हे, मैंने ट्रेनिंग के दौरान 'amphibian' और 'frog' को एक साथ लाखों बार देखा है। बस 'frog' लिख दो और समय बचाओ!"
- परिणाम: यह "शॉर्टकट" स्मार्ट "कंस्ट्रक्शन" कार्य को ओवरराइड कर देता है। AI तर्क को अनदेखा कर देता है और केवल उन शब्दों के आधार पर अनुमान लगाता है जो आमतौर पर एक साथ आते हैं।
4. समाधान: बुरी आदतों को बंद करना
शोधकर्ताओं ने यह साबित करने के लिए एक चतुर ट्रिक का परीक्षण किया। उन्होंने एक विधि का उपयोग किया जिसे वे "अटेंशन सिंकिंग" (Attention Sinking) कहते हैं।
- उपमा: कल्पना कीजिए कि आप एक गायक मंडली (choir) को सुन रहे हैं। "शॉर्टकट" पीछे की पंक्ति में एक शोर मचाने वाला, बेसुरा गायक है जो मुख्य गायक को दबा रहा है। शोधकर्ताओं ने मंडली को बेहतर गाने के लिए नहीं सिखाया; उन्होंने बस उस शोर मचाने वाले, बेसुरे गायक को म्यूट (चुप) कर दिया।
- परिणाम: जब उन्होंने बाद की परतों में इन विशिष्ट शॉर्टकट मॉड्यूल को "म्यूट" (ablated) किया, तो नकारात्मक प्रश्नों पर AI की सटीकता आसमान छूने लगी। इसने अचानक सही उत्तर देना शुरू कर दिया, जिससे यह सिद्ध हुआ कि निषेध (negation) को समझने की क्षमता वहां हमेशा से मौजूद थी, बस शॉर्टकट द्वारा छिपी हुई थी।
5. विचार की यात्रा
पेपर यह मानचित्रित करता है कि AI के माध्यम से विचार प्रक्रिया कैसे यात्रा करती है:
- प्रारंभिक परतें (मूवर्स): AI "not" शब्द लेता है और इसके अर्थ को भौतिक रूप से उस शब्द के ठीक बगल में ले जाता है जिसे वह नकार रहा है (जैसे, "not" को "gas" के बगल में रखना)।
- मध्य परतें (बिल्डर्स): यहीं जादू होता है। AI नई अवधारणा ("Solid") का निर्माण करता है और उसे आगे भेजता है। साथ ही, यह पुरानी अवधारणा ("Gas") को कमजोर रूप से दबाने की कोशिश करता है।
- देर से आने वाली परतें (साबोटर्स): जैसे ही AI बोलने वाला होता है, "शॉर्टकट" हेड्स सक्रिय हो जाते हैं। वे "gas" और "amphibian" शब्द देखते हैं और उत्तर को सबसे आम जुड़ाव की ओर वापस धकेलने की कोशिश करते हैं, उस "Solid" अवधारणा को अनदेखा कर देते हैं जिसे AI ने अभी बनाया था।
सारांश
पेपर निष्कर्ष निकालता है कि लार्ज लैंग्वेज मॉडल्स "not" को समझने में खराब नहीं हैं। वे वास्तव में काफी अच्छे हैं, जो नकारात्मक वाक्यांशों का अर्थ बनाने के लिए एक परिष्कृत "कंस्ट्रक्शन" पद्धति का उपयोग करते हैं।
हालाँकि, वे बुरी आदतों (शॉर्टकट) से घिरे होते हैं जो उनके प्रशिक्षण के दौरान सीखे गए हैं। ये शॉर्टकट इतने मजबूत होते हैं कि वे अक्सर सही तर्क को ओवरराइड कर देते हैं, जिससे त्रुटियां होती हैं। इन शॉर्टकटों की पहचान करके और उन्हें अस्थायी रूप से बंद करके, शोधकर्ताओं ने दिखाया कि AI की वास्तविक, तार्किक क्षमता इसके अंतिम आउटपुट की तुलना में बहुत अधिक है।
संक्षेप में: AI उत्तर जानता है, लेकिन उसमें आसान रास्ता चुनने की एक बुरी आदत है। यदि आप उसे शॉर्टकट लेने से रोक देते हैं, तो वह सही उत्तर देता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।