A Large Scale Investigation of Scaling Limits in Chemical Language Models
30,000 से अधिक प्रयोगों का यह बड़े पैमाने पर किया गया अध्ययन प्रकट करता है कि हालांकि केमिकल लैंग्वेज मॉडल्स को स्केल करने से प्रीट्रेनिंग लॉस और केमिकल सिंटैक्स की समझ में सुधार होता है, लेकिन ये लाभ लक्ष्य-निर्देशित आणविक डिजाइन (goal-directed molecular design) में आनुपातिक सुधार में परिवर्तित नहीं होते हैं, जो अत्याधुनिक नोवोमोलजेन (NovoMolGen) सूट की शुरूआत के बावजूद रिप्रेजेंटेशन लर्निंग और डाउनस्ट्रीम उपयोगिता के बीच एक महत्वपूर्ण विच्छेद को रेखांकित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
आधुनिक विज्ञान के विशाल परिदृश्य में, यह एक बढ़ती हुई धारणा है कि यदि आप केवल एक कंप्यूटर मॉडल को बड़ा बनाते हैं और उसमें अधिक डेटा डालते हैं, तो वह अनिवार्य रूप से अधिक स्मार्ट हो जाएगा। यह विचार, जिसे 'स्केलिंग' (scaling) कहा जाता है, ने भाषा को समझने के हमारे तरीके को बदल दिया है, जिससे मशीनें मानव लेखन के विशाल पुस्तकालयों से सीखकर निबंध लिखने, ग्रंथों का अनुवाद करने और बातचीत करने में सक्षम हो गई हैं। वैज्ञानिकों ने हाल ही में इसी तर्क को रसायन विज्ञान पर लागू किया है, जिससे "केमिकल लैंग्वेज मॉडल्स" (chemical language models) बनाए गए हैं। ये कृत्रिम बुद्धिमत्ता (AI) प्रणाली हैं जिन्हें अणुओं (molecules) का प्रतिनिधित्व करने वाले वर्णों की कतारों को पढ़ने और लिखने के लिए प्रशिक्षित किया गया है, ठीक वैसे ही जैसे एक कंप्यूटर वाक्य पढ़ना सीखता है। उम्मीद यह रही है कि इन रासायनिक मॉडलों को बड़ा बनाने और उन्हें अधिक अणुओं पर प्रशिक्षित करने से, वे स्वाभाविक रूप से नए ड्रग्स (दवाओं) को शून्य से डिजाइन करने, नई यौगिकों (compounds) को खोजने में बेहतर हो जाएंगे जो बीमारियों को ठीक कर सकें या व्याधियों का उपचार कर सकें।
हालाँकि, एक हालिया बड़े पैमाने की जाँच इस सरल धारणा को चुनौती देती है। शोधकर्ताओं ने यह परीक्षण करने के लिए प्रयास किया कि क्या भाषा सीखने के नियम रासायनिक डिजाइन की जटिल दुनिया पर भी लागू होते हैं। उन्होंने बहुत छोटे से लेकर अत्यंत बड़े आकार के मॉडलों का एक परिवार बनाया, और यह देखने के लिए उन्हें अरबों अणुओं पर प्रशिक्षित किया कि उनका प्रदर्शन कैसे बदलता है। आईआईटी मद्रास और मिला - क्यूबेक एआई इंस्टीट्यूट सहित संस्थानों की एक टीम द्वारा किए गए इस अध्ययन से एक आश्चर्यजनक विसंगति का पता चलता है। जबकि मॉडल आकार में बढ़ने के साथ रसायन विज्ञान के बुनियादी व्याकरण को समझने में वास्तव में बेहतर हुए, यह सुधार तब काम नहीं आया जब उन्हें विशिष्ट, उपयोगी दवाओं को डिजाइन करने के लिए कहा गया। वास्तव में, शोधकर्ताओं ने पाया कि एक अपेक्षाकृत छोटा मॉडल भी नए औषधीय खोजों के कठिन कार्य को करने में एक विशाल मॉडल के समान ही प्रभावी था, जो यह सुझाव देता है कि केवल कंप्यूटर को बड़ा बनाना ही ड्रग डिस्कवरी (दवा की खोज) के रहस्यों को खोलने की कुंजी नहीं है।
शोधकर्ताओं ने इन विभिन्न रासायनिक मॉडलों के तीस हजार से अधिक संस्करणों को प्रशिक्षित करके शुरुआत की। उन्होंने मॉडलों के आकार को पाँच लाख पैरामीटर्स से लेकर एक अरब पैरामीटर्स तक भिन्न किया, उन्हें विभिन्न प्रकार के आणविक डेटा से अवगत कराया, और रासायनिक संरचनाओं का प्रतिनिधित्व करने के विभिन्न तरीकों का उपयोग करके उनका परीक्षण किया। एक प्रमुख निष्कर्ष यह था कि जैसे-जैसे मॉडल बड़े हुए और उन्होंने अधिक डेटा देखा, वे रासायनिक स्ट्रिंग के अगले भाग की भविष्यवाणी करने में बढ़ती सटीकता के साथ सक्षम हुए। यह एक बच्चे के भाषा सीखने के समान है जो अंततः एक वाक्य में अगले शब्द का अनुमान लगाने में बेहतर हो जाता है। मॉडल रासायनिक सिंटैक्स (syntax) के नियमों को समझने में उत्कृष्ट हो गए, यह जानते हुए कि परमाणुओं के कौन से संयोजन वैध अणु बनाते हैं और कौन से नहीं। रासायनिक संरचना की यह आंतरिक समझ सबसे बड़े मॉडलों के लिए भी बेहतर होती रही, जो यह दर्शाता है कि कंप्यूटर रसायन विज्ञान की "शब्दावली" और "व्याकरण" को सफलतापूर्वक याद कर रहा था।
फिर भी, जब शोधकर्ताओं ने इन मॉडलों का वास्तविक ड्रग डिजाइन पर परीक्षण किया, तो कहानी नाटकीय रूप से बदल गई। उन्होंने मॉडलों को नए अणु उत्पन्न करने के लिए कहा जो विशिष्ट रोग लक्ष्यों (disease targets) से जुड़ सकें या वांछित रासायनिक गुणों के एक सेट को पूरा कर सकें, जो एक जटिल 'ट्रायल एंड एरर' (प्रयास और त्रुटि) प्रक्रिया शामिल करता है। यहाँ, आकार के लाभ लुप्त हो गए। लक्ष्य-निर्देशित अणुओं को डिजाइन करने में मॉडलों का प्रदर्शन लगभग पाँच मिलियन पैरामीटर्स के आकार पर पहुँचते ही स्थिर (plateaued) हो गया। मॉडल के आकार को एक अरब पैरामीटर्स तक बढ़ाने पर, जो कि दो सौ गुना बड़ा है, उनके द्वारा डिजाइन की जा सकने वाली दवाओं की गुणवत्ता में लगभग कोई अतिरिक्त सुधार नहीं हुआ। पाँच मिलियन पैरामीटर्स वाला एक मॉडल दवा की खोज के लिए नए उम्मीदवारों को खोजने में एक अरब-पैरामीटर वाले विशाल मॉडल के समान ही प्रदर्शन करता है।
यह परिणाम बताता है कि इन मॉडलों को प्रशिक्षित करने की वर्तमान विधि, जो रासायनिक स्ट्रिंग में अगले वर्ण की भविष्यवाणी करने पर केंद्रित है, कंप्यूटर को रसायन विज्ञान के नियम तो सिखाती है लेकिन आवश्यक रूप से यह नहीं सिखाती कि वे अणु जैविक प्रणालियों के साथ कैसे परस्पर क्रिया करते हैं। मॉडलों ने रसायन विज्ञान की भाषा को धाराप्रवाह बोलना तो सीख लिया, लेकिन वे उस भाषा का उपयोग विशिष्ट समस्याओं को हल करने के लिए करना नहीं सीख पाए। शोधकर्ताओं ने पाया कि जबकि बड़े मॉडल वैध अणु उत्पन्न कर सकते थे, वे चिकित्सा के लिए आवश्यक विशिष्ट, उच्च-गुणवत्ता वाले अणुओं को खोजने में महत्वपूर्ण रूप से बेहतर नहीं हुए। अध्ययन इंगित करता है कि बाधा मॉडल का आकार या डेटा की मात्रा नहीं है, बल्कि मॉडलों को प्रशिक्षित करने का तरीका और वे किन उद्देश्यों को अनुकूलित (optimize) करने के लिए कहे जाते हैं, वह है।
इस खोज के निहितार्थ विज्ञान में कृत्रिम बुद्धिमत्ता के भविष्य के लिए महत्वपूर्ण हैं। यह सुझाव देता है कि ड्रग डिस्कवरी का मार्ग केवल बड़े और अधिक शक्तिशाली कंप्यूटर मॉडल बनाने में नहीं, बल्कि हमारे पास मौजूद मॉडलों को प्रशिक्षित करने के स्मार्ट तरीके विकसित करने में निहित है। शोधकर्ता प्रस्ताव देते हैं कि केवल कंप्यूटर को अगले रासायनिक प्रतीक की भविष्यवाणी करना सिखाने के बजाय, हमें उन्हें अणुओं के कार्यात्मक गुणों को समझने के लिए प्रशिक्षित करने की आवश्यकता है, जैसे कि वे प्रोटीन के साथ कैसे परस्पर क्रिया करते हैं या मानव शरीर में उनका व्यवहार कैसा होता है। केवल सतही पैटर्न के बजाय इन गहरे रासायनिक अर्थों पर ध्यान केंद्रित करके, वैज्ञानिक अगली पीढ़ी की जीवन रक्षक दवाओं को डिजाइन करने के लिए अधिक कुशल और प्रभावी उपकरण बना सकते हैं। यह कार्य एक अनुस्मारक के रूप में कार्य करता है कि रसायन विज्ञान की जटिल दुनिया में, बड़ा होना हमेशा बेहतर नहीं होता है, और वास्तविक बुद्धिमत्ता के लिए पैटर्न की विशाल स्मृति से कहीं अधिक की आवश्यकता होती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।