BOOM: Benchmarking Out-Of-distribution Molecular Property Predictions of Machine Learning Models
यह शोध पत्र BOOM को प्रस्तुत करता है, जो आणविक गुण भविष्यवाणी में व्यवस्थित रूप से आउट-ऑफ-डिस्ट्रीब्यूशन (OOD) सामान्यीकरण का मूल्यांकन करने के लिए पहला रासायनिक रूप से सूचित ओपन-सोर्स बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान मशीन लर्निंग मॉडल अपने प्रशिक्षण डेटा से परे एक्सट्रपलेशन करने में संघर्ष करते हैं और मजबूत OOD प्रदर्शन प्राप्त करने के लिए नए दृष्टिकोणों की आवश्यकता पर प्रकाश डालता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
नई दवाओं और सामग्रियों की खोज का मिशन अक्सर एक सरल, लेकिन कठिन प्रश्न से शुरू होता है: अरबों संभावित रासायनिक संरचनाओं में से वास्तव में कौन सी काम करेगी? दशकों तक, वैज्ञानिक परीक्षण और त्रुटि (trial and error) पर निर्भर रहे हैं, लेकिन आर्टिफिशियल इंटेलिजेंस की एक नई लहर इस प्रक्रिया को तेज करने का वादा करती है, यह अनुमान लगाकर कि किसी अणु (molecule) के बनने से पहले ही उसका व्यवहार कैसा होगा। ये कंप्यूटर मॉडल ज्ञात रसायनों के विशाल पुस्तकालयों पर प्रशिक्षित होते हैं, जो अणु के आकार और उसके गुणों (जैसे कि वह पानी में कितनी अच्छी तरह घुलता है या जलने पर कितनी ऊर्जा छोड़ता है) के बीच के पैटर्न को पहचानना सीखते हैं। उम्मीद यह है कि ये मॉडल फिर एक पूरी तरह से नए, अनदेखे अणु को देखकर उसके व्यवहार का सटीक अनुमान लगा सकेंगे, जिससे प्रभावी रूप से शोधकर्ता कंप्यूटर स्क्रीन पर रसायन विज्ञान के भविष्य को डिजाइन कर सकेंगे।
हालाँकि, इसमें एक बड़ी समस्या है। अधिकांश AI मॉडल उस डेटा के भीतर पैटर्न पहचानने में उत्कृष्ट होते हैं जिस पर उन्हें सिखाया गया है, लेकिन वे उन अणुओं के गुणों की भविष्यवाणी करने में अक्सर लड़खड़ा जाते हैं जो उनके प्रशिक्षण पुस्तकालय से वास्तव में भिन्न हैं। मशीन लर्निंग की दुनिया में, इसे "आउट-ऑफ-डिस्ट्रीब्यूशन" (out-of-distribution) समस्या कहा जाता है। यह उस छात्र के बीच का अंतर है जो अभ्यास परीक्षा के उत्तर रट लेता है और उस छात्र के बीच का अंतर जो वास्तव में एक नई, अप्रत्याशित समस्या को हल कर सकता है। यदि कोई मॉडल अपने प्रशिक्षण डेटा से परे सामान्यीकरण (generalize) करने में सक्षम नहीं है, तो वह केवल वही पुष्टि करने का उपकरण बन जाता है जो हम पहले से जानते हैं, न कि अज्ञात की खोज करने का उपकरण। यह सीमा अगली पीढ़ी की दवा खोज और सामग्री विज्ञान के लिए एक बड़ा अवरोध है, जहाँ लक्ष्य ऐसे अणु खोजना है जो वर्तमान में संभव सीमाओं को आगे बढ़ा सकें।
लॉरेंस लिवरमोर नेशनल लेबोरेटरी और बिंगहैमटन यूनिवर्सिटी के शोधकर्ताओं की एक टीम ने 'बूम' (BOOM) नामक एक नए बेंचमार्क के साथ इस समस्या पर गहराई से विचार किया है। केवल परिचित डेटा पर मॉडल के प्रदर्शन का परीक्षण करने के बजाय, उन्होंने विशेष रूप से यह देखने के लिए परीक्षणों का एक कठोर सेट तैयार किया कि क्या ये आर्टिफिशियल इंटेलिजेंस सिस्टम अपरिचित स्थितियों को संभाल सकते हैं। उन्होंने छोटे कार्बनिक यौगिकों से लेकर विशिष्ट इलेक्ट्रॉनिक गुणों वाले जटिल संरचनाओं तक, हजारों अणुओं वाले दस अलग-अलग डेटासेट एकत्र किए। प्रत्येक डेटासेट के लिए, उन्होंने अणुओं को तीन समूहों में सावधानीपूर्वक विभाजित किया: एक प्रशिक्षण सेट (training set), परिचित अणुओं का एक मानक परीक्षण सेट, और एक विशेष "आउट-ऑफ-डिस्ट्रीब्यूशन" परीक्षण सेट। इस विशेष समूह में अत्यधिक गुण वाले अणु शामिल थे—ऐसे मान जो इतने उच्च या इतने कम थे कि वे प्रशिक्षण डेटा में शायद ही कभी दिखाई देते हैं। शोधकर्ताओं ने पंद्रह अलग-अलग मशीन लर्निंग मॉडलों को उनकी क्षमता परखने के लिए लगाया, और प्रत्येक से इन चरम अणुओं की भविष्यवाणी करने को कहा।
परिणाम निराशाजनक थे। आधुनिक आर्टिफिशियल इंटेलिजेंस की प्रभावशाली क्षमताओं के बावजूद, अध्ययन में पाया गया कि कोई भी एकल मॉडल सभी कार्यों के लिए इन चरम अणुओं के गुणों की लगातार भविष्यवाणी नहीं कर सका। सबसे अच्छा प्रदर्शन करने वाले मॉडलों ने भी इन कठिन, अनदेखे मामलों में ऐसी गलतियाँ कीं जो परिचित डेटा की तुलना में तीन गुना अधिक थीं। शोधकर्ताओं ने एक सामान्य विफलता मोड देखा: मॉडल समान अणुओं को एक साथ समूहित करने में तो अच्छे थे, लेकिन वे अज्ञात क्षेत्र में अपनी भविष्यवाणियों का विस्तार करने में विफल रहे। वास्तव में देखे गए मानों से बाहर का अनुमान लगाने के बजाय, मॉडल अपनी भविष्यवाणियों को संकुचित करने लगे, यानी चरम मानों को औसत की ओर खींचने लगे। यह व्यवहार बताता है कि मॉडल ऐसे शॉर्टकट सीख रहे हैं जो मानक डेटा के लिए तो ठीक हैं, लेकिन वैज्ञानिक खोज के लिए आवश्यक वास्तविक नवीनता के सामने विफल हो जाते हैं।
टीम ने यह भी जांचा कि मॉडल क्यों संघर्ष कर रहे थे और इस समस्या को ठीक करने के लिए कई सामान्य रणनीतियों का परीक्षण किया। उन्होंने यह जांचा कि क्या अरबों अणुओं के विशाल डेटासेट पर मॉडलों को प्री-ट्रेन (pre-training) करना—एक ऐसी तकनीक जिसने भाषा मॉडलों में क्रांति ला दी है—मदद कर सकता है। आश्चर्यजनक रूप से, उन्होंने पाया कि जबकि इस प्री-ट्रेनिंग ने मॉडलों को परिचित डेटा को बेहतर ढंग से संभालने में सक्षम बनाया, इसने चरम मानों की भविष्यवाणी करने की उनकी क्षमता में सुधार नहीं किया। वास्तव में, कुछ मॉडलों के लिए, प्री-ट्रेनिंग ने आउट-ऑफ-डिस्ट्रीब्यूशन प्रदर्शन को और खराब कर दिया। उन्होंने यह भी परीक्षण किया कि क्या प्रशिक्षण सेट में केवल अधिक डेटा जोड़ना मदद करेगा। हालांकि कुछ गुणों के लिए कुछ चरम उदाहरणों को शामिल करने से प्रदर्शन में सुधार हुआ, लेकिन यह कोई सार्वभौमिक समाधान नहीं था। अध्ययन बताता है कि वर्तमान में इन मॉडलों को जिस तरह से बनाया जा रहा है, विशेष रूप से टेक्स्ट-आधारित निरूपण (representations) पर उनकी निर्भरता, शायद उनकी रसायनों के व्यवहार को नियंत्रित करने वाले गहरे भौतिक नियमों को समझने की क्षमता को मौलिक रूप से सीमित कर रही है।
सबसे महत्वपूर्ण निष्कर्षों में से एक यह था कि डेटा का प्रकार मॉडल के आकार से अधिक मायने रखता है। जिन मॉडलों ने परमाणुओं और उनकी स्थितियों के बारे में त्रि-आयामी (3D) ज्यामितीय जानकारी का उपयोग किया, उन्होंने रैखिक टेक्स्ट स्ट्रिंग्स (जो अनुक्रम में लिखे गए रासायनिक नामों की तरह हैं) पर निर्भर रहने वाले मॉडलों की तुलना में काफी बेहतर प्रदर्शन किया। तीन-आयामी मॉडल, जो अंतरिक्ष की भौतिक समरूपता का सम्मान करते हैं, चरम मामलों में बहुत बेहतर तरीके से सामान्यीकरण करने में सक्षम थे। यह एक स्पष्ट मार्ग की ओर संकेत करता है: वास्तविक रसायन विज्ञान की खोज करने के लिए AI बनाने हेतु, मॉडलों को इस बात की भौतिक वास्तविकता पर आधारित होना चाहिए कि परमाणु कैसे चलते हैं और परस्पर क्रिया करते हैं, न कि केवल इस बात के पैटर्न पर कि उन्हें टेक्स्ट में कैसे वर्णित किया जाता है। शोधकर्ताओं ने निष्कर्ष निकाला कि इन कठिन कार्यों में मजबूत प्रदर्शन प्राप्त करने के लिए बड़े, अधिक विविध डेटासेट और ऐसे मॉडलों के संयोजन की आवश्यकता होगी जो अणुओं की इलेक्ट्रॉनिक संरचना को स्पष्ट रूप से समझते हों।
BOOM बेंचमार्क इस क्षेत्र के लिए एक वास्तविकता की जाँच (reality check) के रूप में कार्य करता है, जो यह दिखाता है कि वर्तमान पीढ़ी का केमिकल AI, शक्तिशाली होने के बावजूद, अभी भी विश्वसनीय रूप से अज्ञात रास्तों पर चलने के लिए तैयार नहीं है। अध्ययन यह दावा नहीं करता कि यह समस्या समाधान योग्य नहीं है, बल्कि यह इस विचार को खारिज करता है कि मौजूदा मॉडलों को केवल बड़ा बनाना या मानक प्री-ट्रेनिंग तकनीकों का उपयोग करना ही पर्याप्त होगा। इसके बजाय, यह इस बात पर प्रकाश डालता है कि रासायनिक मशीन लर्निंग के अगले चरण के लिए उनके डिज़ाइन के तरीके में बदलाव की आवश्यकता है। इस विशिष्ट कमजोरी के लिए परीक्षण करने का एक मानकीकृत तरीका प्रदान करके, शोधकर्ता इस समुदाय को ऐसे मॉडल बनाने की दिशा में मार्गदर्शन करने की आशा करते हैं जो न केवल अतीत को याद रखने में अच्छे हों, बल्कि वास्तव में भविष्य की कल्पना करने में भी सक्षम हों। अगली पीढ़ी की जीवन रक्षक दवाओं और उन्नत सामग्रियों की खोज का मार्ग इस विशिष्ट सामान्यीकरण की पहेली को सुलझाने पर निर्भर हो सकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।