← नवीनतम पेपर
🔬 materials science

Pre-registered tests of solid-state-physics-inspired LLM compression: a cluster-level negative result at small-language-model scale

स्वायत्त अनुसंधान एजेंटों और एक सख्त 3-सिग्मा निर्णय द्वार (decision gate) का उपयोग करने वाले इस पूर्व-पंजीकृत अध्ययन ने पाया कि कोहन-नियरसाइटनेस (Kohn-nearsightedness) और टेंसर-ट्रेन एम्बेडिंग पर आधारित ठोस-अवस्था-भौतिकी (solid-state-physics) से प्रेरित संपीड़न मैपिंग, छोटे पैमाने के भाषा मॉडलों को संपीड़ित करने में विफल रही, बल्कि इसके बजाय यह प्रकट किया कि उनके अटेंशन तंत्र्स (attention mechanisms) अनुमानित इंसुलेटर-समान गुणों के बजाय महत्वपूर्ण या ग्लास-जैसे व्यवहार प्रदर्शित करते हैं।

मूल लेखक: Jun-qiang Lu

प्रकाशित 2026-09-29
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jun-qiang Lu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

लार्ज लैंग्वेज मॉडल्स आधुनिक आर्टिफिशियल इंटेलिजेंस के इंजन हैं, जो आश्चर्यजनक प्रवाह के साथ लिखने, तर्क करने और अनुवाद करने में सक्षम हैं। फिर भी ये सिस्टम विशाल हैं, जिनमें अरबों संख्याएँ, या पैरामीटर्स होते हैं, जो उनके व्यवहार को निर्धारित करते हैं। यह अत्यधिक आकार उन्हें चलाना महंगा और संग्रहीत करना कठिन बना देता है, जिससे वैज्ञानिक एक मौलिक प्रश्न पूछते हैं: इस जटिलता का वास्तव में कितना हिस्सा आवश्यक है? एक लोकप्रिय सिद्धांत सुझाव देता है कि इन मॉडल्स में छिपी हुई अतिरेकता (redundancies) हो सकती है, ठीक वैसे ही जैसे किसी ठोस पदार्थ में क्रिस्टल लैटिस (crystal lattice) होता है जहाँ परमाणु एक अनुमानित, व्यवस्थित पैटर्न में व्यवस्थित होते हैं। भौतिकी में, यह व्यवस्था वैज्ञानिकों को यह मानकर गणनाओं को सरल बनाने की अनुमति देती है कि अंतःक्रियाएं दूरी के साथ तेजी से कम हो जाती हैं, जिसे "एरिया लॉ" (area law) के रूप में जाना जाता है। यदि भाषा मॉडल इसी तरह व्यवहार करते, तो शोधकर्ताओं को उम्मीद थी कि वे भाषा को समझने की अपनी क्षमता खोए बिना, दूर के कनेक्शनों को काटकर या अपनी आंतरिक संरचनाओं को सरल बनाकर उन्हें भारी मात्रा में संकुचित (compress) कर सकते हैं।

एक शोधकर्ता ने इस विशिष्ट विचार का कठोर सटीकता के साथ परीक्षण करने के लिए कदम उठाया। उन्होंने भाषा मॉडल को केवल एक 'ब्लैक बॉक्स' के रूप में नहीं, बल्कि एक भौतिक प्रणाली के रूप में माना जो सॉलिड-स्टेट फिजिक्स के इंसुलेटर्स (insulators) के समान नियमों का पालन कर सकती है। उनका परिकल्पना (hypothesis) यह थी कि एक मॉडल में शब्दों के बीच के संबंध तेजी से घटेंगे (decay), जिसका अर्थ है कि एक शब्द केवल अपने निकटतम पड़ोसियों को ही दृढ़ता से प्रभावित करेगा, और मॉडल के आंतरिक भार (weights) को एक सरल, स्पार्स (sparse) रूप में घुमाया जा सकता है। अपने परिणामों को विश्वसनीय और किसी विशिष्ट परिणाम की आशा से प्रेरित पूर्वाग्रह से मुक्त करने के लिए, उन्होंने अपनी पूरी योजना को प्री-रजिस्टर्ड (pre-registered) किया। इसका अर्थ था कि उन्होंने डेटा देखने से पहले ही अपनी भविष्यवाणियाँ, परीक्षण किए जाने वाले मॉडल, और सफलता या विफलता के सटीक मानदंड लिख दिए थे। फिर उन्होंने इन भौतिकी-प्रेरित विचारों पर आधारित पांच अलग-अलग परीक्षण चलाने के लिए एक स्वायत्त कंप्यूटर एजेंट का उपयोग किया, यह जाँचने के लिए कि क्या मॉडल वास्तव में उन व्यवस्थित इंसुलेटर्स की तरह व्यवहार करते हैं जिनकी उनसे अपेक्षा की गई थी।

परिणाम प्रारंभिक परिकल्पना का एक स्पष्ट और अप्रत्याशित उलटाव थे। शोधकर्ता ने पाया कि भाषा मॉडल उस तरह व्यवहार नहीं कर रहे थे जैसा कि उन्होंने भविष्यवाणी की थी। कनेक्शनों के तेजी से और अनुमानित रूप से घटने के बजाय, शब्दों के बीच का अटेंशन (attention) एक बहुत अधिक जटिल पैटर्न का अनुसरण करता है। जब उन्होंने यह मापा कि एक शब्द का प्रभाव दूसरे शब्द की दूरी बढ़ने के साथ कैसे कम होता है, तो डेटा एक साधारण इंसुलेटर की अपेक्षित सरल एक्सपोनेंशियल कर्व (exponential curve) में फिट नहीं हुआ। इसके बजाय, प्रभाव इस तरह से कम हुआ जो एक पावर लॉ (power law) के समान था, एक ऐसा पैटर्न जो क्रिटिकल सिस्टम या ग्लास-जैसे पदार्थों (glassy materials) से जुड़ा होता है जहाँ व्यवस्था अव्यवस्थित होती है और लंबी दूरी के कनेक्शन बने रहते हैं। वास्तव में, जब उन्होंने स्थान बचाने के लिए दूर के कनेक्शनों को काटने की कोशिश की, तो मॉडल का प्रदर्शन ढह गया, जो कि केवल सभी कनेक्शनों को रखने की तुलना में काफी खराब हो गया। मॉडल दूर के शब्दों को अनदेखा नहीं कर रहा था; वह उन्हें इस तरह से उपयोग कर रहा था जिसे एक सरल भौतिक शॉर्टकट को दोहराना संभव नहीं था।

इस जांच में यह भी देखा गया कि क्या मॉडल के आंतरिक नंबरों को उनके भार मैट्रिक्स को एक अधिक कुशल आकार में पुनर्व्यवस्थित करके सरल बनाया जा सकता है, ठीक वैसे ही जैसे एक भौतिक विज्ञानी परमाणुओं के एक जटिल ग्रिड को सरल बना सकता है। शोधकर्ता ने परीक्षण किया कि क्या मॉडल की शब्दावली और वेट मैट्रिसेस को एक-आयामी श्रृंखलाओं (one-dimensional chains) के लिए डिज़ाइन की गई उन्नत गणितीय संरचनाओं का उपयोग करके संकुचित किया जा सकता है। उन्होंने पाया कि इन मॉडल्स में शोषण के लिए ऐसी कोई एक-आयामी संरचना नहीं थी। आंतरिक संख्याएँ इस तरह व्यवस्थित नहीं थीं कि उन्हें आसानी से संकुचित किया जा सके; वे अनिवार्य रूप से यादृच्छिक (random) थीं और उनमें ऐसी जानकारी भरी थी जिसे मॉडल के कार्य को नष्ट किए बिना हटाया नहीं जा सकता था। जब उन्होंने मॉडल को इन सरल आकारों में बदलने का प्रयास किया, तो परिणाम छोटा फ़ाइल नहीं, बल्कि एक बड़ी फ़ाइल थी, क्योंकि गणितीय प्रारूप को समान मात्रा में जानकारी संग्रहीत करने के लिए अधिक स्थान की आवश्यकता थी। यह तब भी सत्य था जब उन्होंने बड़े मॉडल्स का परीक्षण किया, जो यह सुझाव देता है कि जटिलता इन प्रणालियों के काम करने का एक मौलिक फीचर है, न कि केवल छोटे मॉडल्स का एक गुण।

शायद सबसे महत्वपूर्ण खोज यह थी कि शोधकर्ता की विधियों ने सफलतापूर्वक इस विचार को खारिज कर दिया कि ये मॉडल सरल, इंसुलेटर-जैसे सिस्टम हैं। अपने प्री-रजिस्टर्ड नियमों पर टिके रहकर, उन्होंने डेटा को सिद्धांत के अनुरूप ढालने के प्रलोभन से खुद को बचाया। जब डेटा ने दिखाया कि मॉडल उनकी भविष्यवाणी के अनुसार व्यवहार नहीं कर रहे हैं, तो उन्होंने ईमानदारी से विफलता को दर्ज किया। उन्होंने पाया कि मॉडल एक ऐसे शासन (regime) में काम करते हैं जो एक सरल क्रिस्टल की तुलना में कहीं अधिक जटिल है, जो एक जटिल, क्रिटिकल अवस्था के समान है जहाँ हर हिस्सा दूसरे हिस्से से गहराई से जुड़ा हुआ है। इसका अर्थ है कि इन मॉडल्स को दूर के कनेक्शनों को काटकर या उनकी आंतरिक संरचना को पुनर्व्यवस्थित करके संकुचित करने की उम्मीद संभवतः गलत है। मॉडल की जटिलता उसके आकार का एक आर्टिफैक्ट (artifact) नहीं है, बल्कि उसकी बुद्धिमत्ता का एक आवश्यक फीचर है।

अध्ययन यह निष्कर्ष निकालता है कि हालांकि सॉलिड-स्टेट फिजिक्स के सिद्धांतों का उपयोग करके भाषा मॉडल्स को संकुचित करने का सपना आकर्षक है, वास्तविकता यह है कि ये मॉडल उन विशिष्ट भौतिक नियमों का पालन नहीं करते हैं। शोधकर्ता को उनकी शक्ति खोए बिना मॉडल्स को छोटा करने का कोई तरीका नहीं मिला। इसके बजाय, उन्होंने एक स्पष्ट मानचित्र प्रदान किया कि वे क्या नहीं हैं: वे सरल इंसुलेटर नहीं हैं, और उनमें कोई छिपी हुई, स्पार्स संरचना नहीं है जिसे खोजा जा सके। उनका कार्य एक अनुशासित सुधार के रूप में कार्य करता है, जो दिखाता है कि इन प्रणालियों को समझने का मार्ग नए भौतिक उपमानों (physical analogies) की मांग करता है जो उनकी अव्यवस्थित, क्रिटिकल और अत्यधिक परस्पर जुड़ी प्रकृति को समझा सकें। सबक यह है कि इन मॉडल्स की बुद्धिमत्ता उनकी जटिलता के ताने-बाने में बुनी हुई है, और उन्हें छोटा करने के लिए उन्हें छीलने का प्रयास करना उन्हें काम करने से रोकने के बिना असंभव हो सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →