← नवीनतम पेपर
🔬 materials science

Measuring trainable degrees of freedom in materials graph neural networks: a random-subspace intrinsic dimension analysis

यह शोध पत्र रैंडम-सबस्पेस इंट्रिन्सिक डायमेंशन विश्लेषण का उपयोग करके मटेरियल्स ग्राफ न्यूरल नेटवर्क के लिए एक नए अभिलक्षण के रूप में 'ट्रेनलेबल-डिग्री डिपेंडेंस' (trainable-degree dependence) को प्रस्तुत करता है, जो यह प्रकट करता है कि विभिन्न आर्किटेक्चर और प्रेडिक्शन टास्क उच्च प्रदर्शन प्राप्त करने के लिए आवश्यक 'ट्रेनलेबल डिग्री ऑफ फ्रीडम' की संख्या के प्रति अपनी संवेदनशीलता में कैसे भिन्न होते हैं, और यह इन मांगों को केवल अंतिम सटीकता से अलग करता है।

मूल लेखक: Shehroz Ahmad Shoaib, Kangming Li

प्रकाशित 2026-09-30
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shehroz Ahmad Shoaib, Kangming Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

बेहतर सामग्रियों के डिजाइन की खोज में, वैज्ञानिक एक शक्तिशाली नए उपकरण की ओर मुड़े हैं: एक ऐसा आर्टिफिशियल इंटेलिजेंस जो पदार्थ की अदृश्य संरचना को "देख" सकता है। ये सिस्टम, जिन्हें ग्राफ न्यूरल नेटवर्क के रूप में जाना जाता है, एक सामग्री को एक ठोस ब्लॉक के रूप में नहीं, बल्कि बंधों (bonds) द्वारा जुड़े परमाणुओं के एक मानचित्र के रूप में देखते हैं, ठीक वैसे ही जैसे एक सबवे सिस्टम जहाँ स्टेशन परमाणु होते हैं और ट्रैक उनके बीच के रासायनिक लिंक होते हैं। इन मानचित्रों का अध्ययन करके, कंप्यूटर यह सीखता है कि कोई सामग्री कैसे व्यवहार करेगी—चाहे वह बिजली का संचालन करेगी, कितनी कठोर होगी, या कैसे कंपन करेगी। वर्षों तक, यह आंकने का एकमात्र तरीका कि इनमें से कोई AI मॉडल अच्छा था या नहीं, उसका अंतिम स्कोर देखना था: कि उसकी भविष्यवाणी प्रयोगशाला में मापे गए वास्तविक मान के कितने करीब थी। यदि त्रुटि कम थी, तो मॉडल को सफल माना जाता था। लेकिन यह एकल संख्या एक महत्वपूर्ण रहस्य को छिपा लेती है। यह हमें यह नहीं बताती कि मॉडल ने वास्तव में उत्तर कैसे सीखा, या उस तक पहुँचने के लिए उसे अपनी कितनी आंतरिक "बौद्धिक क्षमता" (brainpower) की आवश्यकता थी।

किंग अब्दुल्ला यूनिवर्सिटी ऑफ साइंस एंड टेक्नोलॉजी के शोधकर्ताओं की एक टीम ने पर्दे के पीछे झाँकने का निर्णय लिया। वे न केवल अंतिम परिणाम को समझना चाहते थे, बल्कि उस पथ को भी समझना चाहते थे जिस पर मॉडल ने वहाँ तक पहुँचने के लिए यात्रा की। कल्पना कीजिए कि एक छात्र परीक्षा दे रहा है। यदि दो छात्र दोनों 'A' ग्रेड प्राप्त करते हैं, तो हम मानते हैं कि वे समान रूप से बुद्धिमान हैं। लेकिन क्या होगा यदि एक छात्र को 'A' पाने के लिए पाठ्यपुस्तक के हर एक तथ्य को रटने की आवश्यकता थी, जबकि दूसरे को केवल कुछ मुख्य अवधारणाओं को समझने की आवश्यकता थी? पहला छात्र नाजुक है; यदि आप उनकी पाठ्यपुस्तक से कुछ पन्ने हटा देते हैं, तो वे असफल हो जाते हैं। दूसरा छात्र मजबूत है; वे बहुत छोटी पुस्तक के साथ भी पास हो सकते हैं। शोधकर्ताओं ने महसूस किया कि सामग्रियों के लिए वर्तमान AI मॉडल अक्सर पहले छात्र की तरह ही व्यवहार करते हैं। हम जानते हैं कि वे सही उत्तर देते हैं, लेकिन हमें यह नहीं पता कि वे कनेक्शनों के एक विशाल, जटिल जाल पर निर्भर कर रहे हैं या वे एक बहुत ही सरल मस्तिष्क के साथ समस्या को हल कर सकते हैं। यह पता लगाने के लिए, उन्होंने मॉडल की सीखने की क्षमता को जानबूझकर सीमित करके इन मॉडलों का परीक्षण करने का एक नया तरीका विकसित किया।

टीम ने सामग्रियों के गुणों की भविष्यवाणी करने वाले तीन लोकप्रिय AI मॉडलों को लिया और उन्हें उनके उपलब्ध "सोचने के स्थान" के एक बहुत छोटे अंश का उपयोग करके सीखने के लिए मजबूर किया। सामान्यतः, इन मॉडलों में लाखों समायोज्य नॉब्स (adjustable knobs) होते हैं जिन्हें वे अपनी भविष्यवाणियों को सुधारने के लिए घुमा सकते हैं। शोधकर्ताओं ने अधिकांश नॉब्स को अपनी जगह पर लॉक कर दिया और मॉडलों को केवल उनके एक छोटे, यादृच्छिक चयन को समायोजित करने की अनुमति दी। उन्होंने बहुत कम चयन से शुरुआत की—कुल उपलब्ध स्थान के एक बहुत छोटे हिस्से से—और देखा कि मॉडलों ने कैसा प्रदर्शन किया। फिर, उन्होंने धीरे-धीरे अधिक नॉब्स को अनलॉक किया, जिससे मॉडलों को सीखने की अधिक स्वतंत्रता मिली, जब तक कि उन्हें अपनी पूरी क्षमता तक पहुंच प्राप्त नहीं हो गई। इन स्वतंत्रताओं को पुनः प्राप्त करने के दौरान मॉडलों के प्रदर्शन में सुधार को मापकर, शोधकर्ता प्रत्येक कार्य के लिए एक "रिकवरी कर्व" (recovery curve) बना सके। इस वक्र ने एक छिपे हुए सत्य को उजागर किया: कुछ भौतिक गुण सीखना आसान होता है और उनमें बहुत कम मानसिक प्रयास की आवश्यकता होती है, जबकि अन्य अविश्वसनीय रूप से कठिन होते हैं और मॉडल की पूरी शक्ति की मांग करते हैं।

परिणामों ने दिखाया कि विभिन्न सामग्रियाँ आश्चर्यजनक रूप से अलग-अलग तरह से व्यवहार करती हैं। यह भविष्यवाणी करना कि कोई धातु चुंबकीय है या उसके बल्क स्टिफनेस (bulk stiffness) की गणना करना, अपेक्षाकृत सरल रहा। ये मॉडल लगभग पूर्ण सटीकता प्राप्त कर सकते थे, भले ही उन्हें उनके कुल समायोज्य मापदंडों (parameters) के केवल पांच से दस प्रतिशत का उपयोग करने की अनुमति दी गई हो। यह ऐसा था मानो इन कार्यों को नियमों के एक छोटे, केंद्रित सेट के साथ हल किया जा सकता था। हालाँकि, किसी सामग्री को बनाने के लिए आवश्यक ऊर्जा या इसके इलेक्ट्रॉनिक बैंड गैप के आकार की भविष्यवाणी करना बहुत कठिन था। इन कार्यों ने AI मॉडल के विशिष्ट डिज़ाइन पर एक मजबूत निर्भरता दिखाई। एक मॉडल, जिसे ALIGNN कहा जाता है, ने केवल पंद्रह प्रतिशत क्षमता का उपयोग करके फॉर्मेशन एनर्जी (formation energy) की समस्या को हल किया, जबकि अन्य दो मॉडलों को उसी स्तर की सटीकता तक पहुँचने के लिए अपने आधे मापदंडों को अनलॉक करने की आवश्यकता थी। इससे यह संकेत मिला कि कुछ कार्यों के लिए AI मॉडल का निर्माण बहुत मायने रखता है, और मॉडल का अंतिम स्कोर अकेले उसकी दक्षता की पूरी कहानी नहीं बताता है।

सबसे उल्लेखनीय निष्कर्ष सामग्रियों के कंपन के अध्ययन से आया, जिसे फोनोन प्रेडिक्शन (phonon prediction) कहा जाता है। यह कार्य सीखने की स्वतंत्रता के प्रतिबंध के प्रति सबसे संवेदनशील था। जैसे-जैसे शोधकर्ताओं ने मॉडल के मापदंडों को अधिक लॉक किया, मॉडलों का प्रदर्शन आम तौर पर काफी गिर गया। हालाँकि, आर्किटेक्चर के आधार पर व्यवहार भिन्न था: एक मॉडल, DimeNet++, अपनी पूर्ण सटीकता के मामले में सर्वश्रेष्ठ प्रदर्शन करने वाले मॉडल, ALIGNN, से कम सटीक था, फिर भी इसने आयामी स्वीप (dimensional sweep) के एक हिस्से के दौरान प्रदर्शन में कम स्पष्ट गिरावट दिखाई। इस विरोधाभास ने एक ट्रेड-ऑफ को उजागर किया: जिस मॉडल की अंतिम त्रुटि सबसे कम थी, वह आवश्यक रूप से वह नहीं था जो सीखने की स्वतंत्रता प्रतिबंधित होने पर सबसे कम गिरावट दिखाता था। यह इंगित करता है कि कंपन की भविष्यवाणी करने के लिए मॉडल के मापदंडों के पूरे नेटवर्क में एक अत्यधिक समन्वित प्रयास की आवश्यकता होती है। यह एक ऐसा कार्य नहीं है जिसे कुछ चतुर युक्तियों से हल किया जा सके; यह मॉडल के संपूर्ण, अबाधित एक्सेस की मांग करता है। इसके अलावा, शोधकर्ताओं ने पाया कि यह संवेदनशीलता इस बात पर भी निर्भर करती थी कि मॉडल को कितने डेटा पर प्रशिक्षित किया गया है। बैंड गैप की भविष्यवाणी करने के लिए, अधिक डेटा जोड़ने से वास्तव में कार्य मॉडल के लिए कठिन हो गया, जिससे समान सटीकता प्राप्त करने के लिए मॉडल के मापदंडों के एक बड़े हिस्से की आवश्यकता पड़ी। यह सुझाव देता है कि जैसे-जैसे डेटा अधिक जटिल होता जाता है, मॉडल को नई जानकारी को संभालने के लिए अपनी अधिक आंतरिक मशीनरी को अनलॉक करने की आवश्यकता होती है।

इस अध्ययन ने इस सामान्य धारणा को भी चुनौती दी कि ये मॉडल कैसे स्केल अप (scale up) होते हैं। जब शोधकर्ताओं ने मॉडल के आकार को बढ़ाकर उन्हें बड़ा बनाया, तो उन्होंने पाया कि किसी समस्या को हल करने के लिए आवश्यक मापदंडों की पूर्ण संख्या मॉडल के आकार के सीधे अनुपात में बढ़ती है। बारह गुना बड़ा मॉडल अपनी पूरी क्षमता तक पहुँचने के लिए लगभग बारह गुना अधिक समायोज्य नॉब्स की आवश्यकता रखेगा। इसका अर्थ है कि मॉडल को बड़ा बनाना स्वचालित रूप से उसे अधिक कुशल नहीं बनाता है; यह केवल उसे संसाधनों का एक बड़ा भंडार प्रदान करता है। समस्या को हल करने के लिए आवश्यक मॉडल का अंश लगभग समान रहा, लेकिन "बौद्धिक क्षमता" की कुल मात्रा बढ़ गई। यह निष्कर्ष बताता है कि कार्य की जटिलता मॉडल के निर्माण के विशिष्ट तरीके से जुड़ी हुई है, न कि स्वयं सामग्री के एक निश्चित गुण से।

अंततः, यह कार्य विज्ञान में आर्टिफिशियल इंटेलिजेंस को समझने के लिए एक नया दृष्टिकोण प्रदान करता है। यह दिखाता है कि परीक्षा में उच्च स्कोर मॉडल की गुणवत्ता का एकमात्र पैमाना नहीं है। एक मॉडल जो अपने उपलब्ध संसाधनों के लगभग सभी का उपयोग करके उच्च स्कोर प्राप्त करता है, वह उस मॉडल से मौलिक रूप से भिन्न है जो अपनी क्षमता के एक छोटे से अंश के साथ वही स्कोर प्राप्त करता है। पूर्व नाजुक है और नए या थोड़े अलग डेटा का सामना करने पर संघर्ष कर सकता है, जबकि बाद वाला मजबूत और कुशल है। विभिन्न भौतिक गुणों को सीखने के लिए एक मॉडल को कितनी स्वतंत्रता की आवश्यकता होती है, इसका मानचित्र बनाकर, वैज्ञानिक अब सही उपकरण चुन सकते हैं, बेहतर डेटासेट डिजाइन कर सकते हैं, और उस भौतिक दुनिया की वास्तविक जटिलता को समझ सकते हैं जिसका वे अनुकरण (simulate) करने का प्रयास कर रहे हैं। अंतिम स्कोर हमें बताता है कि मॉडल क्या कर सकता है, लेकिन यह नई विधि हमें बताती है कि वह इसे कैसे करता है, जो सीखने की छिपी हुई वास्तुकला को प्रकट करती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →