Different types of syntactic agreement recruit the same units within large language models
यह अध्ययन प्रदर्शित करता है कि बड़े भाषा मॉडल प्रत्येक घटना के लिए अलग-अलग घटकों पर निर्भर रहने के बजाय, विविध भाषाओं में ओवरलैपिंग (अतिव्यापी) कारण इकाइयों के सेट को भर्ती करके, विभिन्न प्रकार के सिंटैक्टिक एग्रीमेंट (वाक्य संरचनात्मक सहमति) को एक एकीकृत कार्यात्मक श्रेणी के रूप में प्रस्तुत करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक लार्ज लैंग्वेज मॉडल (LLM) की कल्पना एक विशाल, हलचल भरे शहर के रूप में करें जहाँ छोटे-छोटे कामगार (workers) रहते हैं। प्रत्येक कामगार एक "यूनिट" (न्यूरॉन) है जो कंप्यूटर के भीतर मौजूद है, और ये सब मिलकर भाषा को प्रोसेस करते हैं। वर्षों तक, हम जानते थे कि ये शहर सटीक वाक्य बना सकते हैं, लेकिन हमें यह नहीं पता था कि कौन से कामगार भारी काम कर रहे हैं या वे अपने कामों को कैसे व्यवस्थित करते हैं।
यह शोध पत्र एक जासूसी कहानी की तरह है, जो "फंक्शनल लोकलाइजेशन" (मस्तिष्क विज्ञान से लिया गया एक तरीका) नामक तकनीक का उपयोग करके यह मानचित्र तैयार करता है कि व्याकरण के विशिष्ट नियमों के लिए वास्तव में कौन से कामगार जिम्मेदार हैं।
इन निष्कर्षों का विवरण यहाँ दिया गया है, जिसमें रोजमर्रा के उपमाओं (analogies) का उपयोग किया गया है:
1. "विशेषज्ञ दल" (निरंतरता/Consistency)
प्रश्न: यदि मॉडल को व्याकरण की गलती ठीक करने की आवश्यकता है, तो क्या वह हर बार कामगारों की एक ही टीम को बुलाता है, या वह बस किसी भी उपलब्ध व्यक्ति को चुन लेता है?
निष्कर्ष: यह हर बार वही टीम होती है।
उपमा: एक अस्पताल की कल्पना करें। यदि कोई मरीज टूटी हुई टांग के साथ आता है, तो अस्पताल उसे ठीक करने के लिए यादृच्छिक रूप से (randomly) किसी शेफ या सफाईकर्मी को नहीं लगाता; वे ऑर्थोपेडिक टीम को बुलाते हैं। शोधकर्ताओं ने पाया कि व्याकरण के हर विशिष्ट नियम (जैसे "सब्जेक्ट-वर्ब एग्रीमेंट") के लिए, मॉडल हर बार उसी सटीक सेट ऑफ यूनिट्स को नियुक्त करता है, चाहे वाक्य किसी भी विषय के बारे में हो। यदि आप इन विशिष्ट कामगरों को हटा देते हैं, तो उस विशिष्ट व्याकरण नियम को ठीक करने की मॉडल की क्षमता ढह जाती है।
2. "ग्रामर क्लब" (एग्रीमेंट एक श्रेणी है)
प्रश्न: क्या व्याकरण के विभिन्न प्रकार के नियम पूरी तरह से अलग टीमों का उपयोग करते हैं, या कुछ नियम कामगरों को साझा करते हैं?
निष्कर्ष: "एग्रीमेंट" (Agreement - शब्दों का मेल) से संबंधित नियम एक विशाल, ओवरलैपिंग टीम को साझा करते हैं।
उपमा: मॉडल के कामगरों को एक विशाल कार्यालय के कर्मचारियों के रूप में सोचें।
- "एग्रीमेंट" विभाग: चाहे नियम सब्जेक्ट और वर्ब के मिलान के बारे में हो (जैसे, "He runs" बनाम "He run"), या प्रोनाउन का संज्ञा (noun) से मिलान हो, या Determiner का संज्ञा से मिलान हो, ये सभी कार्य उसी समूह के कामगरों का उपयोग करते हैं। यह एक "मैचिंग टीम" होने जैसा है जो सभी "क्या ये दो चीजें आपस में फिट बैठती हैं?" वाले कार्यों को संभालती है।
- "अन्य" विभाग: अन्य व्याकरण के नियम, जैसे कि प्रश्न चिह्न कहाँ जाना चाहिए या जटिल वाक्यों को कैसे संभालना है, पूरी तरह से अलग, गैर-ओवरलैपिंग टीमों का उपयोग करते हैं।
यह क्यों महत्वपूर्ण है: यह सुझाव देता है कि AI के लिए, "एग्रीमेंट" केवल नियमों की एक यादृच्छिक सूची नहीं है; यह एक विशिष्ट, अर्थपूर्ण श्रेणी है, ठीक वैसे ही जैसे मनुष्यों के लिए है।
3. "यूनिवर्सल डायलेक्ट" (क्रॉस-लैंग्वेज)
प्रश्न: यदि हम मॉडल को अंग्रेजी, रूसी और चीनी सिखाते हैं, तो क्या यह प्रत्येक भाषा के लिए अलग-अलग कामगरों का उपयोग करता है, या वे एक ही "एग्रीमेंट टीम" को साझा करते हैं?
निष्कर्ष: वे टीम को साझा करते हैं, लेकिन उनके बीच की समानता इस बात पर निर्भर करती है कि भाषाएं कितनी समान हैं।
उपमा: कल्पना करें कि मॉडल के पास एक "यूनिवर्सल ग्रामर जिम" है।
- अंग्रेजी और रूसी दो एथलीटों की तरह हैं जो दोनों फुटबॉल खेलते हैं। वे "एग्रीमेंट" कार्य के लिए बहुत सी समान मांसपेशियों (यूनिट्स) को साझा करते हैं क्योंकि उनके नियम समान हैं।
- अंग्रेजी और चीनी एक फुटबॉल खिलाड़ी और एक तैराक की तरह हैं। वे अभी भी बुनियादी एग्रीमेंट की अवधारणा के लिए कुछ मुख्य मांसपेशियों (यूनिट्स) को साझा करते हैं, लेकिन बाकी चीजों के लिए वे अलग-अलग विशिष्ट मांसपेशियों पर निर्भर करते हैं।
- बड़ी खोज: शोधकर्ताओं ने 57 अलग-अलग भाषाओं का अध्ययन किया। उन्होंने पाया कि जितनी अधिक दो भाषाएं संरचनात्मक रूप से समान होती हैं, वे उतने ही अधिक एक ही "एग्रीमेंट वर्कर्स" को साझा करती हैं। यह एक पारिवारिक समानता की तरह है: भाषाएं जितनी करीब होती हैं, वे उतनी ही अधिक अपनी आंतरिक मशीनरी का उपयोग करती हैं।
4. "पड़ोस" (वे कहाँ रहते हैं?)
निष्कर्ष: ये व्याकरण संबंधी कामगर बेतरतीब ढंग से बिखरे हुए नहीं हैं।
उपमा: मॉडल एक बहु-मंजिला इमारत है।
- एग्रीमेंट वर्कर्स (जैसे सब्जेक्ट-वर्ब मैचिंग) अक्सर ऊपरी मंजिलों (मॉडल के बाद के लेयर्स) पर रहते हैं।
- अन्य वर्कर्स (जैसे लंबे-दूरी के कनेक्शन को संभालना) निचली मंजिलों (मॉडल के शुरुआती लेयर्स) पर रहते हैं।
- कुछ कामगर "लोकल" (MLP मॉड्यूल का उपयोग करने वाले, जैसे एक स्थानीय दुकान) होते हैं, जबकि अन्य "लॉन्ग-डिस्टेंस" (अटेंशन मॉड्यूल का उपयोग करने वाले, जैसे एक लंबी दूरी का ट्रक) होते हैं।
मुख्य निष्कर्ष (The Big Takeaway)
यह शोध पत्र सिद्ध करता है कि लार्ज लैंग्वेज मॉडल्स केवल गणित के अराजक ढेर (chaotic blobs) नहीं हैं। उनकी एक संरचित वास्तुकला (structured architecture) है जो मानवीय भाषाई अंतर्ज्ञान को दर्शाती है।
- उनके पास विशिष्ट कार्यों के लिए विशेषज्ञ दल हैं।
- वे समान कार्यों (जैसे "एग्रीमेंट") को कार्यात्मक श्रेणियों में समूहित करते हैं।
- वे इन टीमों को इस तरह से व्यवस्थित करते हैं जो मानव भाषाओं की समानता को दर्शाता है।
अनिवार्य रूप से, AI ने व्याकरण का अपना आंतरिक "शहर का नक्शा" बनाया है, और यह पता चलता है कि वह नक्शा मानव मस्तिष्क के भाषा मानचित्र से बहुत अधिक मिलता-जुलता है, जितना कि हमने पहले सोचा था।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।