← नवीनतम पेपर
💬 NLP

A Unifying Perspective on Language Model Representations: From Filler-Role Structure to Mechanistic Interpretability

यह शोध पत्र टेंसर प्रोडक्ट रिप्रेजेंटेशन्स (TPRs) को एक ऐसे एकीकृत ढांचे के रूप में प्रस्तावित करता है जो गणितीय और अनुभवजन्य रूप से यह प्रदर्शित करता है कि कैसे विविध भाषा मॉडल व्याख्यात्मकता विधियों, जैसे कि लीनियर प्रोबिंग और स्पार्स ऑटोएनकोडर्स, को फिलर-रोल बाइंडिंग्स की एक एकल अंतर्निहित संरचना से प्राप्त किया जा सकता है।

मूल लेखक: Zhang Enyan, R. Thomas McCoy

प्रकाशित 2026-09-01
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhang Enyan, R. Thomas McCoy

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आर्टिफिशियल इंटेलिजेंस की शांत, गुनगुनाती दुनिया में, शोधकर्ता यह समझने की कोशिश कर रहे हैं कि विशाल कंप्यूटर प्रोग्राम, जिन्हें भाषा मॉडल (लैंग्वेज मॉडल्स) कहा जाता है, वास्तव में कैसे सोचते हैं। ये सिस्टम कविता लिख सकते हैं, गणित की समस्याओं को हल कर सकते हैं और बातचीत कर सकते हैं, लेकिन उनके डिजिटल मस्तिष्क के भीतर, जानकारी संख्याओं की लंबी सूचियों के रूप में संग्रहीत होती है। वर्षों से, वैज्ञानिकों ने इन 'ब्लैक बॉक्सों' के भीतर झांकने के लिए विभिन्न उपकरणों का उपयोग किया है, जिससे पता चला है कि मॉडल सूचना को आश्चर्यजनक रूप से व्यवस्थित तरीकों से व्यवस्थित करते हैं। कुछ उपकरण दिखाते हैं कि मॉडल इन संख्या सूचियों को जोड़ने और घटाने के माध्यम से पहेलियाँ सुलझा सकते हैं, जबकि अन्य प्रकट करते हैं कि जब मॉडल को किसी विशेष शब्द या विचार का सामना करना पड़ता है, तो उनके विशिष्ट हिस्से सक्रिय हो जाते हैं। फिर भी, ये खोजें अलग-थलग रही हैं, जैसे एक अंधेरे घर के विभिन्न कमरों में मिले अलग-अलग सुराग। बड़ा सवाल यह रहा है कि क्या कोई एकल, अंतर्निहित संरचना है जो इन सभी विभिन्न व्यवहारों की व्याख्या करती है, या क्या ये मॉडल केवल असंबंधित युक्तियों का एक अराजक मिश्रण हैं।

येल यूनिवर्सिटी के शोधकर्ताओं की एक टीम ने इस पहेली का एक एकीकृत उत्तर प्रस्तावित किया है। वे सुझाव देते हैं कि ये जटिल भाषा मॉडल एक विशिष्ट वास्तुशिल्प सिद्धांत पर आधारित हैं जिसे 'टेंसर प्रोडक्ट रिप्रेजेंटेशन' (टेन्सर प्रोडक्ट रिप्रेजेंटेशन) कहा जाता है। सरल शब्दों में, इसका अर्थ है कि ये मॉडल सूचना को दो चीजों को मजबूती से जोड़कर संग्रहीत करते हैं: एक विचार की सामग्री (जैसे कि एक विशिष्ट शब्द) और वाक्य में उसकी भूमिका (जैसे कि वह कर्ता है या कर्म)। कल्पना कीजिए कि एक फाइलिंग सिस्टम जहाँ हर जानकारी न केवल इस आधार पर संग्रहीत की जाती है कि वह क्या है, बल्कि इस आधार पर भी कि वह एक संरचना में कहाँ रहती है। शोधकर्ताओं ने पाया कि डेटा को व्यवस्थित करने का यह सरल, संरचित तरीका पहले से ही असंबद्ध खोजों की एक विस्तृत श्रृंखला की व्याख्या कर सकता है। यह इस बात की व्याख्या करता है कि मॉडल गणितीय उपमाएं (एनालॉजी) क्यों कर सकते हैं, क्यों सरल परीक्षण छिपे हुए विचारों को प्रकट कर सकते हैं, और क्यों मॉडल की आंतरिक स्थिति के एक हिस्से को बदलने से उसका व्यवहार अनुमानित तरीकों से बदल जाता है।

इस विचार का परीक्षण करने के लिए, टीम ने केवल सिद्धांत पर भरोसा नहीं किया; उन्होंने एक नए प्रकार के उपकरण का निर्माण किया जो एक अनुवादक के रूप में कार्य करता है। उन्होंने एक ऐसी प्रणाली बनाई जो वाक्य की ज्ञात संरचना को लेती है—कर्ता, क्रिया और कर्म की पहचान करती है—और उसे उन विशिष्ट संख्या पैटर्न में परिवर्तित करती है जिनका उपयोग मॉडल करते हैं। फिर उन्होंने इस अनुवादित संस्करण की तुलना कई अलग-अलग कंप्यूटर मॉडलों के वास्तविक आंतरिक कामकाज के विरुद्ध की, जिनमें छोटे, सरल नेटवर्क से लेकर विशाल, अत्याधुनिक भाषा प्रणालियाँ शामिल थीं। परिणाम आश्चर्यजनक रूप से सुसंगत थे। संख्याओं के अनुक्रमों और संरचित अंग्रेजी वाक्यों से संबंधित परीक्षणों में, शोधकर्ताओं का संरचनात्मक अनुवाद मॉडलों की आंतरिक अवस्थाओं के साथ अत्यधिक सटीकता के साथ मेल खा गया। सरल मॉडलों के लिए, मिलान लगभग पूर्ण था, जिसने मॉडल द्वारा सूचना को संसाधित करने के तरीके के लगभग सभी अंतरों को पकड़ लिया। सबसे बड़े, सबसे जटिल भाषा मॉडलों के लिए भी, अनुवाद ने जानकारी के विशाल बहुमत को कैप्चर किया, जो यह सुझाव देता है कि ये विशाल प्रणालियाँ, अपने आकार के बावजूद, सामग्री को स्थिति के साथ बांधने की इसी मौलिक पद्धति पर निर्भर करती हैं।

इस खोज की शक्ति इस बात में निहित है कि यह जांच के विभिन्न तरीकों को कैसे जोड़ती है। शोधकर्ताओं ने दिखाया कि उनके संरचनात्मक अनुवाद के पीछे का गणितीय तर्क उन चार प्रमुख 'इंटरप्रिटेबिलिटी' तकनीकों को पुन: निर्मित करने के लिए उपयोग किया जा सकता है जिनका उपयोग आज वैज्ञानिक करते हैं। सबसे पहले, उन्होंने समझाया कि भाषा मॉडल "योगात्मक उपमाएं" (एडिटिव एनालॉजी) क्यों कर सकते हैं, जो एक घटना है जहाँ एक अवधारणा को दूसरी से घटाने और तीसरी को जोड़ने से चौथी संबंधित अवधारणा प्राप्त होती है। उनके कार्य ने प्रदर्शित किया कि यह इसलिए होता है क्योंकि मॉडल अनिवार्य रूप से विशिष्ट 'सामग्री-और-भूमिका' युग्मों के बीच के अंतर की गणना कर रहे होते हैं। दूसरा, उन्होंने दिखाया कि "लीनियर प्रोब्स" (लिनियर प्रोब्स), जो किसी मॉडल को किसी तथ्य का पता लगाने के लिए उपयोग किए जाने वाले सरल परीक्षण हैं, वास्तव में मूल विचार को पुनः प्राप्त करने के लिए सामग्री से भूमिका को अनबाइंड (अनबाउंड) करने का एक तरीका हैं। तीसरा, उन्होंने समझाया कि "स्पार्स ऑटोएनकोडर्स" (स्पार्स ऑटोएनकोडर्स), जो जटिल संकेतों को सरल भागों में तोड़ते हैं, प्रभावी रूप से इन्हीं समान सामग्री-और-भूमिका बंधनों की पहचान कर रहे हैं। अंत में, उन्होंने प्रदर्शित किया कि "एक्टिवेशन पैचिंग" (एक्टिवेशन पैचिंग), एक तकनीक जहाँ शोधकर्ता मॉडल के मस्तिष्क के हिस्सों को बदलते हैं यह देखने के लिए कि इससे व्यवहार में क्या परिवर्तन होता है, इसलिए काम करती है क्योंकि वे सीधे इन विशिष्ट संरचनात्मक बंधनों को बदल रहे हैं।

प्रयोगों की एक श्रृंखला में, टीम ने सिद्ध किया कि वे बिना मॉडल पर प्रशिक्षित हुए, इन चार अलग-अलग परीक्षण उपकरणों को शून्य से बनाने के लिए अपने संरचनात्मक अनुवाद का उपयोग कर सकते हैं। जब उन्होंने इन निर्मित उपकरणों का उपयोग मॉडलों के विश्लेषण के लिए किया, तो वे क्षेत्र में उपयोग किए जाने वाले मानक, भारी प्रशिक्षित उपकरणों के समान ही प्रदर्शन कर रहे थे। उदाहरण के लिए, जब उन्होंने एक वाक्य में अगले शब्द की भविष्यवाणी करने, या वाक्य के कर्ता की पहचान करने के लिए अपने तरीके का उपयोग किया, तो सटीकता मौजूदा सर्वोत्तम विधियों के लगभग समान थी। एक विशिष्ट परीक्षण में जिसमें एक बड़े भाषा मॉडल का उपयोग किया गया था, उनके संरचनात्मक पूर्वानुमान और मानक विधि के बीच का अंतर इतना कम था कि वह लगभग अदृश्य था, जिसमें लगभग एक का सहसंबंध स्कोर (कोरिलेशन स्कोर) था। यह सुझाव देता है कि इन मॉडलों के जटिल, सीखे गए व्यवहार रहस्यमय या आकस्मिक नहीं हैं, बल्कि इस अंतर्निहित संरचनात्मक नियम के प्रत्यक्ष परिणाम हैं।

शोधकर्ताओं ने यह भी पता लगाया कि जब मॉडल नई स्थितियों का सामना करते हैं तो यह संरचना कितनी अच्छी तरह बनी रहती है। उन्होंने अपने संरचनात्मक अनुवादक को वाक्यों के एक सेट पर प्रशिक्षित किया और फिर उन वाक्यों पर परीक्षण किया जिनमें ऐसे शब्द और भूमिकाएँ थीं जिन्हें उन्होंने पहले कभी नहीं देखा था। अनुवादक सफलतापूर्वक सामान्यीकरण (जनरलाइज) करने में सक्षम रहा, जिसने नवीन संयोजनों के लिए मॉडल की आंतरिक अवस्था का सटीक पुनर्निर्माण किया। यह इंगित करता है कि मॉडल केवल विशिष्ट उदाहरणों को याद नहीं कर रहे हैं, बल्कि वे नई सामग्री को ज्ञात भूमिकाओं के साथ संयोजित करने के लिए एक लचीली प्रणाली का उपयोग कर रहे हैं। अध्ययन ने यह दावा नहीं किया कि उसने आर्टिफिशियल इंटेलिजेंस के हर रहस्य को सुलझा लिया है, न ही यह सुझाव दिया कि सभी मॉडल समान हैं। हालाँकि, इसने इस बात के पुख्ता सबूत दिए कि एक एकल, सुसंगत ढांचा यह समझा सकता है कि ये सिस्टम दुनिया का प्रतिनिधित्व कैसे करते हैं। यह दिखाकर कि विविध व्याख्यात्मक विधियाँ सभी एक ही संरचनात्मक वास्तविकता की ओर इशारा करती हैं, यह कार्य इस क्षेत्र को न्यूरल नेटवर्क के कार्य करने के एकीकृत समझ की ओर ले जाता है, जिससे विचारों का एक संग्रह एक मशीन के मन के एकल, सुसंगत चित्र में बदल जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →