Vectors from Larger Language Models Predict Human Reading Time and fMRI Data More Poorly when Dimensionality Expansion is Controlled
यह अध्ययन प्रदर्शित करता है कि जब अनट्रेंड (untrained) लार्ज लैंग्वेज मॉडल्स का उपयोग करके डाइमेंशनलिटी एक्सपेंशन (dimensionality expansion) को नियंत्रित किया जाता है, तो मानव पठन समय और fMRI डेटा के लिए ट्रेंड (trained) LLM वेक्टर्स की भविष्य कहने वाली शक्ति विपरीत स्केलिंग (inverse scaling) प्रदर्शित करती है, जिसमें कुछ बिलियन पैरामीटर्स पर ही प्रशिक्षण का अतिरिक्त मूल्य शून्य हो जाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
दशकों से, वैज्ञानिक कंप्यूटरों को लगभग जैविक गति से पढ़ना और लिखना सीखते हुए देख रहे हैं। ये मशीनें, जिन्हें लार्ज लैंग्वेज मॉडल्स (बड़े भाषा मॉडल) के रूप में जाना जाता है, मानव पाठ के विशाल पुस्तकालयों पर प्रशिक्षित की जाती हैं जब तक कि वे एक वाक्य में अगले शब्द की सटीक भविष्यवाणी कर सकें। क्योंकि वे भाषा को बहुत अच्छी तरह से संभालते हैं, शोधकर्ताओं ने यह सोचने पर विचार किया कि क्या ये मशीनें केवल हमारी नकल कर रही हैं, या वास्तव में हमारे अपने मस्तिष्क द्वारा भाषा को संसाधित करने के तरीके को प्रतिबिंबित कर रही हैं। यह व्यापक आशा थी कि जैसे-जैसे ये मॉडल बड़े और अधिक जटिल होते जाएंगे, वे इस बात की बेहतर भविष्यवाणी करने में सक्षम होंगे कि किसी शब्द को पढ़ने में मनुष्य को कितना समय लगता है, या जब हम कोई कहानी सुनते हैं तो हमारा मस्तिष्क कैसे सक्रिय होता है। इस विचार ने सुझाव दिया कि इन डिजिटल दिमागों की संरचना मानव विचार की संरचना का एक मानचित्र हो सकती है, जिसका अर्थ था कि मानव डेटा से मेल खाने में कोई भी विफलता केवल अधिक कंप्यूटिंग शक्ति की आवश्यकता का मामला थी।
हालाँकि, द ओहियो स्टेट यूनिवर्सिटी और यूनिवर्सिटी ऑफ कैलिफोर्निया, सैन डिएगो के शोधकर्ताओं का एक नया अध्ययन इस आशावादी दृष्टिकोण को चुनौती देता है। उन्होंने पाया कि जब उन्होंने इन मॉडलों द्वारा उत्पन्न डेटा के विशाल आकार को सावधानीपूर्वक नियंत्रित किया, तो मॉडल के आकार और मानव-समान प्रदर्शन के बीच का संबंध एक विशिष्ट तरीके से बदल गया: प्रशिक्षण का अतिरिक्त लाभ गायब हो गया। प्रशिक्षण प्रक्रिया के इन मॉडलों को उनके अप्रशिक्षित समकक्षों की तुलना में काफी बेहतर बनाने के बजाय, सबसे बड़े मॉडलों ने उसी आकार के अप्रशिक्षित संस्करणों से बेहतर प्रदर्शन नहीं किया। अध्ययन बताता है कि इन विशाल प्रणालियों की स्पष्ट सफलता काफी हद जान से उस सूचना के विशाल आयतन (वॉल्यूम) द्वारा निर्मित एक भ्रम थी, जिसे वे एक्सेस कर सकते थे, न कि भाषा की वास्तविक समझ। जब शोधकर्ताओं ने इस लाभ को हटा दिया, तो वह प्रशिक्षण जिसने इन मॉडलों को इतना शक्तिशाली बनाया था, उसी मशीन के पूरी तरह से अप्रशिक्षित संस्करण की तुलना में कोई अतिरिक्त लाभ प्रदान नहीं करता दिखा।
यह समझने के लिए कि वे इस निष्कर्ष पर कैसे पहुँचे, किसी को पहले यह देखना होगा कि इन मॉडलों का परीक्षण आमतौर पर कैसे किया जाता है। शोधकर्ता अक्सर एक कहानी को भाषा मॉडल में डालते हैं और मॉडल की आंतरिक स्थिति की तुलना मानव डेटा से करते हैं, जैसे कि किसी व्यक्ति द्वारा एक विशिष्ट शब्द पर रुकने का समय या किसी वाक्य को सुनते समय उनके मस्तिष्क की प्रतिक्रिया। पिछले अध्ययनों में, ऐसा प्रतीत हुआ कि बड़े मॉडल, जिनमें अधिक आंतरिक चर (variables) कार्य करने के लिए उपलब्ध होते हैं, लगातार मानव व्यवहार की बेहतर भविष्यवाणी करते थे। इससे "क्वालिटी-पावर" (गुणवत्ता-शक्ति) नामक एक सिद्धांत सामने आया: मॉडल जितना बड़ा होगा, वह मानव मस्तिष्क के उतना ही अधिक समान होगा। लेकिन शोधकर्ताओं को इसमें एक छिपे हुए दोष का संदेह था। जब एक मॉडल बड़ा होता है, तो वह केवल स्मार्ट नहीं होता; बल्कि वह विश्लेषण के लिए आंतरिक संकेतों, या वेक्टर्स (vectors) की एक बहुत बड़ी संख्या भी उत्पन्न करता है। यह एक छात्र को दोगुने प्रश्नों वाले टेस्ट देने जैसा है; भले ही छात्र को कुछ भी पता न हो, अधिक प्रश्न होने से उन्हें भाग्य से सही उत्तर का अनुमान लगाने के अधिक अवसर मिलते हैं। शोधकर्ता समझ गए कि पिछले अध्ययन शायद अधिक प्रश्नों के होने के लाभ को माप रहे थे, न कि एक बेहतर मस्तिष्क होने के लाभ को।
इस पहेली को सुलझाने के लिए, टीम ने प्रयोगों की एक श्रृंखला डिजाइन की जिसने आकार के प्रभाव को बुद्धिमत्ता के प्रभाव से अलग कर दिया। उन्होंने पांच अलग-अलग भाषा मॉडल परिवारों से डेटा एकत्र किया, जो कुछ सौ मिलियन पैरामीटर्स वाले छोटे मॉडलों से लेकर 66 बिलियन पैरामीटर्स वाले विशाल मॉडलों तक विस्तृत थे। उन्होंने इन मॉडलों का परीक्षण वास्तविक मानव डेटा के विरुद्ध किया, जिसमें प्राकृतिक कहानियाँ पढ़ते समय लोगों के पढ़ने का समय और उन कहानियों को सुनते समय लोगों के मस्तिष्क स्कैन शामिल थे। अपने पहले प्रयोग में, उन्होंने पिछले निष्कर्षों को दोहराया: जैसे-जैसे मॉडल बड़े होते गए, मानव व्यवहार की उनकी भविष्यवाणियाँ बेहतर होती दिखाई दीं। इसने पुष्टि की कि "क्वालिटी-पावर" प्रभाव सतह पर दिखाई दे रहा था।
लेकिन फिर, उन्होंने एक महत्वपूर्ण नियंत्रण (control) पेश किया। उन्होंने उन्हीं मॉडलों को लिया और उन्हें किसी भी टेक्स्ट पर प्रशिक्षित किए बिना देखा। इन अप्रशिक्षित मॉडलों का आकार और संरचना प्रशिक्षित मॉडलों के बिल्कुल समान है, लेकिन वे अनिवार्य रूप से यादृच्छिक शोर (random noise) हैं, जिनमें भाषा का कोई ज्ञान नहीं है। प्रशिक्षित मॉडलों की तुलना उनके अप्रशिक्षित जुड़वाँ मॉडलों से करके, शोधकर्ता देख सके कि कितना सुधार वास्तव में सीखने से आया और कितना केवल उनके पास उपलब्ध आंतरिक संकेतों की बड़ी संख्या के कारण आया। उन्होंने एक विधि का उपयोग किया जो एक 'रिजर्वायर' (reservoir) के समान है, जहाँ एक बड़ा, अप्रशिक्षित नेटवर्क कच्चे माल के स्रोत के रूप में कार्य करता है जिसे एक सरल क्लासिफायर द्वारा आकार दिया जा सकता है। यदि प्रशिक्षण वास्तव में मॉडल को अधिक मानव-समान बना रहा था, तो प्रशिक्षित संस्करण को अप्रशिक्षित संस्करण की तुलना में काफी बेहतर प्रदर्शन करना चाहिए था, विशेष रूप से जैसे-जैसे मॉडल बड़े होते गए।
परिणाम आश्चर्यजनक थे। जब शोधकर्ताओं ने आंतरिक संकेतों के आकार को नियंत्रित किया, तो प्रशिक्षण का अतिरिक्त लाभ गायब हो गया। वास्तव में, कुछ बिलियन पैरामीटर्स से बड़े मॉडलों के लिए, प्रशिक्षित संस्करण अप्रशिक्षित संस्करणों की तुलना में बेहतर प्रदर्शन नहीं कर पाए। कई डेटासेट्स पर, प्रशिक्षण का अतिरिक्त लाभ शून्य हो गया। इसका अर्थ है कि पिछले अध्ययनों में देखे गए भारी सुधार इसलिए नहीं थे क्योंकि बड़े मॉडलों ने भाषा की गहरी समझ विकसित की थी, बल्कि इसलिए थे क्योंकि उनके पास डेटा को फिट करने के लिए अधिक आंतरिक आयाम (dimensions) थे। शोधकर्ताओं ने पाया कि जैसे-जैसे मॉडल एक निश्चित बिंदु से आगे बढ़े, अप्रशिक्षित बेसलाइन के मुकाबले मॉडल के फिट होने में प्रशिक्षण का योगदान बढ़ने के बजाय शून्य की ओर गिर गया। मॉडल जितना बड़ा होता गया, प्रशिक्षण प्रक्रिया ने मॉडल के आकार से मिलने वाली भविष्य कहने वाली शक्ति में उतना ही कम योगदान दिया।
अध्ययन ने मॉडलों के भीतर विभिन्न परतों (layers) का भी अवलोकन किया, यह जाँचते हुए कि क्या नेटवर्क के मध्य भाग, जिनके बारे में कुछ पिछले कार्यों ने अधिक महत्वपूर्ण होने का सुझाव दिया था, अलग व्यवहार करते हैं। उन्होंने वही पैटर्न पाया: जैसे-जैसे मॉडल बढ़े, प्रशिक्षण का योगदान सभी परतों में शून्य हो गया। यहाँ तक कि जब उन्होंने मॉडलों द्वारा मानव डेटा की भविष्यवाणी करने की सीमा तक पहुँचने की संभावना को ध्यान में रखते हुए अपनी सांख्यिकीय विधियों को समायोजित किया, तब भी यह रुझान बना रहा। शोधकर्ताओं ने निष्कर्ष निकाला कि मानव व्यवहार की भविष्यवाणी करने में इन बड़े मॉडलों की सफलता मुख्य रूप से एक सांख्यिकीय प्रभाव है जहाँ अधिक चर होने से बेहतर फिट होने की अनुमति मिलती है, न कि मानव संज्ञान (cognition) का वास्तविक प्रतिबिंब।
यह निष्कर्ष यह सुझाव देता है कि इन कृत्रिम प्रणालियों के निर्माण के तरीके और मानव मस्तिष्क के काम करने के तरीके के बीच एक महत्वपूर्ण असंतुलन है। प्रशिक्षण की वह प्रक्रिया जो इन मॉडलों को टेक्स्ट उत्पन्न करने में इतना अच्छा बनाती है, आवश्यक रूप से उन्हें मानव पढ़ने या मस्तिष्क की गतिविधि का बेहतर मॉडल नहीं बनाती है। वास्तव में, अध्ययन का तर्क है कि इन विशाल नेटवर्क के अप्रशिक्षित संस्करण, जो यादृच्छिक कनेक्शनों के जटिल भंडार (reservoirs) के रूप में कार्य करते हैं, महंगे और पूर्ण रूप से प्रशिक्षित संस्करणों की तरह ही मानव डेटा की भविष्यवाणी करने में प्रभावी हो सकते हैं। शोधकर्ता प्रस्ताव देते हैं कि भविष्य के अध्ययनों को इन अप्रशिक्षित मॉडलों को एक मानक बेसलाइन के रूप में उपयोग करना चाहिए ताकि यह सुनिश्चित किया जा सके कि प्रशिक्षण के कारण होने वाले सुधार वास्तविक हैं और केवल मॉडल के आकार का उपोत्पाद (byproduct) नहीं हैं। हालाँकि "बड़ा ही बेहतर है" के विचार ने वर्षों तक इस क्षेत्र को आगे बढ़ाया है, यह कार्य सुझाव देता है कि मानव भाषा प्रसंस्करण के क्षेत्र में, एक ऐसा बिंदु आता है जहाँ अधिक आकार और प्रशिक्षण जोड़ने से हम मानव मस्तिष्क को समझने के करीब नहीं पहुँचते, बल्कि उससे और दूर चले जाते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।