Computing high-order mixed derivatives in physics-informed neural networks using multi-index Bell polynomials
यह शोध पत्र मल्टी-इंडेक्स बेल पॉलिनोमिअल्स (multi-index Bell polynomials) का उपयोग करके मल्टीवेरिएट फ़ा दी ब्रूनो फॉर्मूला (multivariate Faà di Bruno formula) को व्यवस्थित करने के माध्यम से, फिजिक्स-इन्फॉर्मड न्यूरल नेटवर्क्स में उच्च-क्रम के मिश्रित डेरिवेटिव्स की गणना के लिए एक गणनात्मक रूप से कुशल और मेमोरी-स्थिर विधि प्रस्तुत करता है, जिससे राउंडऑफ एरर (roundoff error) तक सटीक रहते हुए मानक नेस्टेड ऑटोमैटिक डिफरेंशिएशन (standard nested automatic differentiation) की मेमोरी विफलताओं से बचा जा सकता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
आधुनिक भौतिकी की दुनिया में, वैज्ञानिक अक्सर एक कठिन पहेली का सामना करते हैं: बहते पानी, विद्युत क्षेत्रों या शॉक वेव्स जैसे जटिल प्रणालियों के व्यवहार की भविष्यवाणी कैसे की जाए, जब उन्हें नियंत्रित करने वाले गणितीय नियम अविश्वसनीय रूप से जटिल होते हैं। दशकों से, शोधकर्ताओं ने इन पहेलियों को हल करने में मदद करने के लिए आर्टिफिशियल इंटेलिजेंस (कृत्रिम बुद्धिमत्ता) की ओर रुख किया है। एक विशिष्ट प्रकार का मशीन लर्निंग, जिसे 'फिजिक्स-इन्फॉर्म्ड न्यूरल नेटवर्क' कहा जाता है, एक डिजिटल प्रशिक्षु (apprentice) की तरह कार्य करता है। इसे न केवल डेटा पर, बल्कि भौतिकी के मौलिक नियमों पर भी प्रशिक्षित किया जाता है। यह नेटवर्क समस्या के समाधान का अनुमान लगाने के लिए यह जांचकर सीखता है कि उसका अनुमान अंतर्निهمित समीकरणों को कितनी अच्छी तरह संतुष्ट करता है। हालाँकि, इन समीकरणों में अक्सर परिवर्तन की दरें शामिल होती हैं जिन्हें गणना करना अत्यंत कठिन होता है, विशेष रूप से तब जब उनमें समय और तीन-आयामी स्थान (three-dimensional space) जैसे कई चर (variables) एक साथ बदल रहे हों। नेटवर्क को प्रभावी ढंग से प्रशिक्षित करने के लिए, कंप्यूटर को इन जटिल दरों के परिवर्तन, जिन्हें डेरिवेटिव (derivatives) कहा जाता है, को अत्यधिक सटीकता के साथ गणना करना होता है।
चुनौती यह रही है कि मानक कंप्यूटर विधियों का उपयोग करके इन उच्च-क्रम (high-order) की परिवर्तन दरों की गणना करना एक ऐसे पहाड़ पर चढ़ने की कोशिश करने जैसा है जो जितना ऊपर आप जाते हैं, उतना ही ऊंचा होता जाता है। जैसे-जैसे समीकरण की जटिलता बढ़ती है, कंप्यूटर की मेमोरी भर जाती है, और गणनाएं इतनी धीमी हो जाती हैं कि उन्हें पूरा करना व्यावहारिक रूप से असंभव हो जाता है। इस बाधा ने आर्टिफिशियल इंटेलिजेंस की सबसे कठिन भौतिक समस्याओं को हल करने की क्षमता को सीमित कर दिया है, विशेष रूप से उन समस्याओं में जिनमें लहरें समय के साथ फैलती या बिखरती हैं। फुमिहिरो इमोटो का एक नया अध्ययन सीधे तौर पर इस सीमा को संबोधित करता है। शोधकर्ता ने एक नई गणितीय विधि विकसित की है जो कंप्यूटर को इन जटिल, बहु-चर परिवर्तन दरों को कुशलतापूर्वक गणना करने की अनुमति देती है, बिना मेमोरी खत्म हुए या अनावश्यक गणनाओं में फंसे।
इस नए दृष्टिकोण का मूल आधार यह है कि कंप्यूटर अपने काम को कैसे व्यवस्थित करता है। बार-बार कंप्यूटर से एक ही फंक्शन को अलग-अलग बार डिफरेंशिएट करने के बजाय—एक ऐसी प्रक्रिया जो गणनाओं का एक विशाल और उलझा हुआ जाल बना देती है—यह नया तरीका एक पूर्व-व्यवस्थित प्रणाली का उपयोग करता है। इसकी कल्पना एक ऐसी लाइब्रेरी के रूप में करें जहाँ हर संभावित पुस्तक संयोजन पहले से ही सूचीबद्ध (cataloged) है और किसी पाठक द्वारा पुस्तक मांगे जाने पर उसे तुरंत निकाला जा सकता है, बजाय इसके कि हर बार नया कैटलॉग लिखना पड़े। शोधकर्ता ने बेल पॉलिनोमिअल्स (Bell polynomials) नामक संरचनाओं वाले एक विशिष्ट गणितीय उपकरण का उपयोग करके, सभी आवश्यक गणनाओं का एक निश्चित मानचित्र (map) बनाने के लिए किया। यह मानचित्र एक बार बनाया जाता है और फिर सीखने की प्रत्येक प्रक्रिया के लिए पुन: उपयोग किया जाता है। ऐसा करके, कंप्यूटर केवल समस्या के लिए आवश्यक सूचना के विशिष्ट हिस्सों की गणना करता है, और बाकी सब को अनदेखा कर देता है। यह रणनीति सिस्टम को उन समीकरणों को संभालने की अनुमति देती है जिनमें सातवें क्रम (seventh order) तक के डेरिवेटिव शामिल हैं, एक ऐसा स्तर की जटिलता जो मानक विधियों को विफल कर देती है।
इस कार्य के परिणाम दोनों सटीक और व्यावहारिक हैं। शोधकर्ता ने जल तरंगों की गति और विद्युत रूप से आवेशित तरल पदार्थों के प्रवाह सहित विभिन्न कठिन भौतिक परिदृश्यों पर इस विधि का परीक्षण किया। चार आयामों (four dimensions) में एक जटिल वेव इक्वेशन से जुड़े एक विशिष्ट परीक्षण में, नई विधि ने केवल 0.0006 की सापेक्ष त्रुटि (relative error) के साथ एक समाधान प्रस्तुत किया, जो सटीकता का एक ऐसा स्तर है जो पुष्टि करता है कि विधि इच्छित रूप से कार्य करती है। शायद इससे भी महत्वपूर्ण बात यह है कि यह विधि वहां सफल रही जहां अन्य विफल रहीं। जब मानक कंप्यूटर प्रोग्रामों ने उन्हीं उच्च-क्रम की समस्याओं को हल करने की कोशिश की, तो वे अक्सर मेमोरी खत्म होने के कारण क्रैश हो गए। नया दृष्टिकोण, जो एक सिंगल प्रोसेसर कोर पर चल रहा था, बिना किसी मेमोरी विफलता के सैकड़ों मिश्रित डेरिवेटिव्स की सफलतापूर्वक गणना करने में सक्षम रहा। इसने उन प्रणालियों को भी संभाला जिनमें कई परस्पर क्रिया करने वाले क्षेत्र (fields) शामिल थे, जैसे कि तरल वेग, दबाव और विद्युत आवेश के बीच का जटिल नृत्य, जो वास्तविक दुनिया की इंजीनियरिंग में आम हैं लेकिन सिम्युलेट करने में अत्यंत कठिन हैं।
गति और स्थिरता के अलावा, अध्ययन ने इन नेटवर्क को बनाने वाले उपकरणों के बारे में कुछ आश्चर्यजनक भी प्रकट किया। एक न्यूरल नेटवर्क का "मस्तिष्क" एक गणितीय फंक्शन पर निर्भर करता है जिसे एक्टिवेशन फंक्शन (activation function) कहा जाता है, जो नेटवर्क को पैटर्न सीखने में मदद करता है। लंबे समय से, हाइपरबोलिक टेंगेंट (hyperbolic tangent) नामक फंक्शन एक मानक विकल्प रहा है। हालाँकि, जब शोधकर्ता ने अपने नए उच्च-क्रम विधि का विभिन्न एक्टिवेशन फंक्शन्स के विरुद्ध परीक्षण किया, तो उन्होंने पाया कि मानक विकल्प हमेशा सबसे अच्छा नहीं होता है। बेसेल फंक्शन्स (Bessel functions) पर आधारित कार्यों के परीक्षण में, जो अक्सर प्रकृति में तरंग पैटर्न का वर्णन करने के लिए उपयोग किए जाते हैं, उन्होंने मानक विकल्प से बेहतर प्रदर्शन किया। इन वैकल्पिक फंक्शन्स ने नेटवर्क को समाधान को अधिक सटीकता से सीखने की अनुमति दी, जिससे पता चलता है कि काम के लिए सबसे अच्छा उपकरण समस्या की विशिष्ट गणितीय मांगों पर बहुत अधिक निर्भर करता है।
अध्ययन ने इन शक्तिशाली उपकरणों का उपयोग करने वाले किसी भी व्यक्ति के लिए एक महत्वपूर्ण सबक भी रेखांकित किया: गणना में एक छोटी सी त्रुटि का अर्थ हमेशा अंतिम उत्तर में छोटी त्रुटि नहीं होता है। तरल प्रवाह से संबंधित एक परीक्षण में, कंप्यूटर भौतिक समीकरणों में त्रुटि को एक बहुत बड़े अंतर से कम करने में सफल रहा, जिससे गणित एकदम सटीक दिखने लगा। फिर भी, इसके द्वारा तैयार किया गया वास्तविक समाधान पूरी तरह से गलत था। ऐसा इसलिए हुआ क्योंकि कंप्यूटर ने भौतिक वास्तविकता को संतुष्ट किए बिना गणित को संतुष्ट करने का एक रास्ता खोज लिया था, एक ऐसा जाल जिसे केवल ज्ञात सीमाओं या डेटा के विरुद्ध समाधान की जांच करके ही टाला जा सकता है। यह निष्कर्ष एक याद दिलाता है कि यहाँ तक कि सबसे उन्नत गणितीय चालों के लिए भी मानवीय निरीक्षण और स्वतंत्र जांच की आवश्यकता होती है ताकि यह सुनिश्चित किया जा सके कि परिणाम भौतिक रूप से सही हैं। नई विधि आवश्यक डेरिवेटिव की गणना करने का एक विश्वसनीय तरीका प्रदान करती है, लेकिन यह भौतिक वास्तविकता सुनिश्चित करने के लिए मानवीय निगरानी और स्वतंत्र जांच की आवश्यकता को प्रतिस्थापित नहीं करती है।
अंततः, यह कार्य भौतिकी की सबसे कठिन समस्याओं के लिए आर्टिफिशियल इंटेलिजेंस का उपयोग करने में एक महत्वपूर्ण बाधा को दूर करता है। जटिल डेरिवेटिव की गणना को इस तरह से व्यवस्थित करके जो सटीक और मेमोरी-कुशल दोनों है, शोधकर्ता ने उन घटनाओं के सिमुलेशन के द्वार खोल दिए हैं जो पहले पहुंच से बाहर थीं। यह विधि कोई जादुई छड़ी नहीं है जो सब कुछ तुरंत हल कर देती है, बल्कि यह एक शक्तिशाली नया इंजन है जो वैज्ञानिकों को उनके सिमुलेशन को पहले की तुलना में कहीं आगे तक ले जाने की अनुमति देता है। चाहे वह फ्यूजन रिएक्टर में प्लाज्मा के प्रवाह का मॉडल बनाना हो या समुद्री लहरों के व्यवहार की भविष्यवाणी करना, उच्च-क्रम की इन दरों को सटीक और तेज़ी से गणना करने की क्षमता एक महत्वपूर्ण प्रगति है। अध्ययन पुष्टि करता है कि सही गणितीय संगठन के साथ, आर्टिफिशियल इंटेलिजेंस भौतिकी की सबसे कठिन समीकरणों से निपट सकती है, बशर्ते कि गणनाओं को सही उपकरणों द्वारा निर्देशित किया जाए और सावधानी के साथ सत्यापित किया जाए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।