← नवीनतम पेपर
🔬 materials science

Understanding and Mitigating Distribution Shifts For Machine Learning Force Fields

यह शोध पत्र उन सामान्य वितरण परिवर्तनों (distribution shifts) की पहचान करता है जो मशीन लर्निंग फोर्स फील्ड्स (MLFFs) के सामान्यीकरण में बाधा डालते हैं और बिना महंगे एब इनिटियो (ab initio) लेबल की आवश्यकता के, आउट-ऑफ-डिस्ट्रीब्यूशन सिस्टम पर त्रुटियों को महत्वपूर्ण रूप से कम करने के लिए स्पेक्ट्रल ग्राफ थ्योरी और सहायक भौतिक उद्देश्यों पर आधारित दो लागत प्रभावी, टेस्ट-टाइम रिफाइनमेंट रणनीतियों का प्रस्ताव करता है।

मूल लेखक: Tobias Kreiman, Aditi S. Krishnapriyan

प्रकाशित 2026-09-28
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tobias Kreiman, Aditi S. Krishnapriyan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यह समझने के लिए कि नई दवाएं कैसे काम करती हैं या बैटरियां ऊर्जा कैसे संचित करती हैं, वैज्ञानिकों को पहले अणुओं के भीतर परमाणुओं के अदृश्य नृत्य को समझना होगा। इस स्तर पर, शास्त्रीय भौतिकी (classical physics) के नियम टूट जाते हैं, और पदार्थ का व्यवहार क्वांटम मैकेनिक्स द्वारा नियंत्रित होता है। इन अंतःक्रियाओं की पूर्ण सटीकता के साथ गणना करने के लिए अत्यधिक कंप्यूटिंग शक्ति की आवश्यकता होती है, जिसमें परमाणु गति के कुछ सेकंड के सिम्युलेशन के लिए भी सुपरकंप्यूटरों पर कई दिन या सप्ताह लग सकते हैं। इसे तेज करने के लिए, शोधकर्ताओं ने एक शॉर्टकट विकसित किया है: मशीन लर्निंग फोर्स फील्ड्स (machine learning force fields)। ये ऐसे कंप्यूटर प्रोग्राम हैं जिन्हें महंगे क्वांटम गणनाओं के परिणामों की नकल करने के लिए प्रशिक्षित किया गया है। एक बार प्रशिक्षित होने के बाद, वे पलक झपकते ही यह अनुमान लगा सकते हैं कि परमाणु एक-दूसरे पर कैसे दबाव डालेंगे या खिंचाव पैदा करेंगे, जिससे वैज्ञानिकों के लिए जटिल रासायनिक प्रतिक्रियाओं और भौतिक गुणों का अनुकरण करना संभव हो जाता है जो पहले पहुंच से बाहर थे।

हालाँकि, जैसे-जैसे ये प्रोग्राम अधिक शक्तिशाली होते गए, एक महत्वपूर्ण समस्या उभर कर आई है। एक ऐसे छात्र की तरह जिसने किसी विशिष्ट परीक्षा के उत्तरों को रट लिया है लेकिन प्रश्न बदलने पर विफल हो जाता है, ये मशीन लर्निंग मॉडल अक्सर उन अणुओं के साथ संघर्ष करते हैं जिन्हें उन्होंने पहले कभी नहीं देखा है। वे उस डेटा पर शानदार प्रदर्शन करते हैं जिस पर उन्हें प्रशिक्षित किया गया है, लेकिन नए रासायनिक स्थानों, अलग परमाणु आकारों या असामान्य परमाणु व्यवस्थाओं का सामना करने पर उनकी सटीकता गिर जाती है। इस सीमा ने शोधकर्ताओं को एक महत्वपूर्ण प्रश्न पूछने के लिए मजबूर किया है: ये परिष्कृत मॉडल सामान्यीकरण (generalize) करने में क्यों विफल होते हैं, और क्या उन्हें और अधिक डेटा के साथ फिर से प्रशिक्षित किए बिना ठीक किया जा सकता है?

यूसी बर्कले और लॉरेंस बर्कले नेशनल लेबोरेटरी के शोधकर्ताओं की एक टीम ने इस समस्या पर एक नए दृष्टिकोण से विचार किया है। उन्होंने पाया कि समस्या यह नहीं है कि मॉडलों में विविध रसायन विज्ञान को समझने की क्षमता की कमी है, बल्कि यह है कि जिस तरह से उन्हें प्रशिक्षित किया जाता है वह उन्हें बहुत कठोर बना देता है। मॉडल अपने प्रशिक्षण डेटा में पाए जाने वाले परमाणुओं के बीच संबंधों के विशिष्ट पैटर्न पर बहुत अधिक निर्भर रहने लगते हैं। जब कोई नया अणु आता है जिसकी आकृति थोड़ी भिन्न होती है या जिसमें परमाणुओं की संख्या अलग होती है, तो मॉडल भ्रमित हो जाता है क्योंकि परमाणुओं के जुड़ने का उसका आंतरिक मानचित्र उस वास्तविकता से मेल नहीं खाता जिसे वह अनुमानित करने की कोशिश कर रहा है। शोधकर्ताओं ने पाया कि केवल अधिक प्रशिक्षण डेटा जोड़ने से समाधान नहीं होता है; मॉडल 'ओवरफिट' (overfit) होते रहते हैं, जिसका अर्थ है कि वे सभी अणुओं को नियंत्रित करने वाले अंतर्निहित भौतिक नियमों को सीखने के बजाय प्रशिक्षण उदाहरणों को रट लेते हैं।

इसे संबोधित करने के लिए, टीम ने दो नई रणनीतियों का प्रस्ताव दिया है जो मॉडल के पूर्ण बदलाव के बजाय उपयोग के समय एक त्वरित समायोजन की तरह कार्य करती हैं। पहली रणनीति इस बात पर केंद्रित है कि मॉडल परमाणुओं के बीच के संबंधों को कैसे "देखता" है। इन प्रोग्रामों में, परमाणुओं को एक नेटवर्क में नोड्स के रूप में माना जाता है, और मॉडल यह तय करता है कि कौन से परमाणु परस्पर क्रिया करने के लिए पर्याप्त करीब हैं, जो एक निश्चित दूरी के नियम पर आधारित होता है। शोधकर्ताओं ने पाया कि प्रत्येक नए अणु के लिए इस दूरी के नियम को थोड़ा समायोजित करके, ताकि यह प्रशिक्षण के दौरान सीखे गए पैटर्न से बेहतर मेल खा सके, वे त्रुटियों को काफी कम कर सकते हैं। यह एक कैमरे के लेंस पर फोकस को किसी विशिष्ट विषय के लिए समायोजित करने जैसा है; कैमरे को फिर से बनाने की आवश्यकता नहीं है, उसे बस नए विषय को स्पष्ट रूप से देखने के लिए एक छोटे से सुधार की आवश्यकता है। यह समायोजन, जिसे वे 'टेस्ट-टाइम रेडियस रिफाइनमेंट' (test-time radius refinement) कहते हैं, बहुत कम कंप्यूटिंग शक्ति की आवश्यकता करता है और इसे तुरंत किया जा सकता है।

दूसरी रणनीति मॉडल को भविष्यवाणी करने से ठीक पहले बुनियादी भौतिकी की एक सौम्य याद दिलाने से संबंधित है। शोधकर्ताओं ने एक "चीप प्रायर" (cheap prior) पेश किया, जो एक सरल, तेज़ और कम सटीक भौतिक मॉडल है जिसे कंप्यूटर एक सेकंड के अंश में चला सकता है। एक नए, अनदेखे अणु की ऊर्जा का अनुमान लगाने से पहले, मुख्य मॉडल एक नए अणु की ऊर्जा का अनुमान लगाने से पहले, यह एक सरल भौतिक मॉडल के साथ अपने आंतरिक बोध को संरेखित करने के लिए कुछ त्वरित कदम उठाता है। 'टेस्ट-टाइम ट्रेनिंग' (test-time training) के रूप में जानी जाने वाली यह प्रक्रिया, मॉडल को अपनी भविष्यवाणियों को सुचारू बनाने और उन ऊबड़-खाबड़, अवास्तविक ऊर्जा परिदृश्यों से बचने में मदद करती है जो यह अपरिचित प्रणालियों के लिए उत्पन्न करता है। इस सरल भौतिक मार्गदर्शक का उपयोग करके, मॉडल बेहतर सामान्यीकरण करना सीखता है, प्रभावी रूप से यह याद रखता है कि परमाणुओं को एक निश्चित तरीके से व्यवहार करना चाहिए, चाहे वे किसी भी अणु में हों।

इन प्रयोगों के परिणाम आश्चर्यजनक थे। जब शोधकर्ताओं ने इन विधियों का परीक्षण बड़े, अत्याधुनिक मॉडलों पर किया, तो उन्होंने पाया कि नए, अनदेखे अणुओं पर त्रुटियां नाटकीय रूप रूप से कम हो गईं। कुछ मामलों में, इन सरल समायोजनों को लागू करने के बाद मॉडल दस गुना अधिक सटीक हो गए। सुधार केवल एक प्रकार की त्रुटि तक सीमित नहीं थे; इन विधियों ने मॉडलों को अणु के आकार में परिवर्तन, शामिल परमाणुओं के प्रकार और उन परमाणुओं के जुड़ने के तरीके को संभालने में मदद की। शायद सबसे महत्वपूर्ण बात यह है कि इन समायोजनों ने मॉडलों को उन अणुओं के स्थिर सिमुलेशन चलाने की अनुमति दी जिनका उन्होंने प्रशिक्षण के दौरान कभी सामना नहीं किया था, एक ऐसा कार्य जिसके कारण पहले सिमुलेशन क्रैश हो जाते थे या निरर्थक परिणाम देते थे।

अध्ययन बताता है कि मशीन लर्निंग फोर्स फील्ड की वर्तमान पीढ़ी में रासायनिक स्थानों की एक बहुत व्यापक विविधता को मॉडल करने की क्षमता है, जिसका हम अब तक उपयोग नहीं कर पाए हैं। बाधा मॉडल की बुद्धिमत्ता नहीं है, बल्कि प्रशिक्षण प्रक्रिया है जो इसे बहुत कठोर छोड़ देती है। भविष्यवाणी के क्षण में इन छोटे, कुशल सुधारों को पेश करके, शोधकर्ता इन उपकरणों की पूर्ण क्षमता को अनलॉक कर सकते हैं। यह दृष्टिकोण एक आशाजनक रास्ता प्रदान करता है, जिससे वैज्ञानिक विशाल नए डेटासेट उत्पन्न करने या मॉडलों को शून्य से फिर से प्रशिक्षित करने की अत्यधिक लागत के बिना विविध और जटिल रासायनिक प्रणालियों का अनुकरण कर सकते हैं। यह कार्य इस बात के लिए एक नया मानक स्थापित करता है कि इन मॉडलों का मूल्यांकन कैसे किया जाना चाहिए, जिससे ध्यान इस बात से हटकर कि वे प्रशिक्षण डेटा को कितनी अच्छी तरह याद रखते हैं, इस पर केंद्रित होता है कि वे अज्ञात के प्रति कितनी अच्छी तरह अनुकूलित हो सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →