Development and Evaluation of Target-Specific Machine-Learning Scoring Functions for Monoamine Oxidase B
यह अध्ययन प्रदर्शित करता है कि जबकि MAO-B के लिए लक्षित-विशिष्ट मशीन-लर्निंग स्कोरिंग फंक्शन, विशेष रूप से संयुक्त विशेषताओं वाले ट्यून्ड रिग्रेशन मॉडल, स्वतंत्र परीक्षण सेटों पर जेनेरिक स्कोरिंग फंक्शन की तुलना में काफी बेहतर प्रदर्शन करते हैं, उनका अर्ली-रिकग्निशन प्रदर्शन ज्ञात सक्रिय तत्वों के साथ संरचनात्मक समानता से भारी रूप से प्रभावित होता है, जो नवीन रासायनिक स्थान (नोवेल केमिकल स्पेस) में सामान्यीकरण सुनिश्चित करने के लिए कठोर बेंचमार्क डिजाइन और प्रोस्पेक्टिव वैलिडेशन की महत्वपूर्ण आवश्यकता को रेखांकित करता है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
नई दवाओं की खोज के अभियान में, वैज्ञानिक अक्सर पैमाने (scale) की एक समस्या का सामना करते हैं। उनके पास लाखों रासायनिक यौगिकों (chemical compounds) का पुस्तकालय होता है, फिर भी उन्हें उन कुछ चुनिले अणुओं को खोजने की आवश्यकता होती है जो किसी विशिष्ट रोग-जनक प्रोटीन से जुड़ सकें और उसके कार्य को रोक सकें। इसे हल करने के लिए, शोधकर्ता कंप्यूटर सिमुलेशन का उपयोग करते हैं ताकि यह अनुमान लगाया जा सके कि कौन से अणु प्रभावी ढंग से जुड़ेंगे, इस प्रक्रिया को 'वर्चुअल स्क्रीनिंग' कहा जाता है। इस प्रक्रिया का केंद्र एक 'स्कोरिंग फंक्शन' (scoring function) है, जो एक गणितीय उपकरण की तरह एक न्यायाधीश की भूमिका निभाता है, जो लाखों उम्मीदवारों की रैंकिंग करता है ताकि यह तय किया जा सके कि प्रयोगशाला में परीक्षण के योग्य कौन से कुछ अणु हैं। दशकों से, ये न्यायाधीश यह अनुमान लगाने के लिए सरल नियमों पर निर्भर रहे हैं कि एक दवा अपने लक्ष्य (target) में कितनी अच्छी तरह फिट बैठती है। हालाँकि, ये नियम अक्सर अणुओं के बीच होने वाली जटिल और सूक्ष्म अंतःक्रियाओं (interactions) को समझने में चूक जाते हैं, जिससे सटीकता में एक ठहराव आ जाता है जहाँ कंप्यूटर एक वास्तविक दवा उम्मीदवार और एक रासायनिक मृत अंत (dead end) के बीच अंतर करने में संघर्ष करते हैं।
इस बाधा को दूर करने के लिए, वैज्ञानिकों ने मशीन लर्निंग की ओर रुख किया है, जिससे वे कंप्यूटर को पूर्व-लिखित सूत्रों के बजाय मौजूदा डेटा की विशाल मात्रा से बाइंडिंग (binding) के नियमों को सीधे सीखना सिखाते हैं। हालाँकि इन नए डिजिटल न्यायाधीशों ने आशाजनक प्रदर्शन दिखाया है, लेकिन उनका प्रदर्शन असंगत रहा है, जो नियंत्रित परीक्षणों में तो शानदार दिखाई देते हैं लेकिन वास्तविक दुनिया की जटिलताओं के सामने विफल हो जाते हैं। एक महत्वपूर्ण प्रश्न बना हुआ है: क्या ये मशीन लर्निंग मॉडल वास्तव में यह समझते हैं कि एक दवा प्रोटीन से कैसे जुड़ती है, या वे केवल परीक्षण डेटा में पैटर्न को याद कर रहे हैं जो वास्तविकता को नहीं दर्शाते? यह अनिश्चितता विशेष रूप से मोनोअमीन ऑक्सीडेज बी (monoamine oxidase B) जैसे लक्ष्यों के लिए महत्वपूर्ण है, जो मस्तिष्क में एक एंजाइम है और पार्किंसंस रोग से जुड़ा है, जहाँ बेहतर अवरोधक (inhibitors) खोजने से उपचार में सुधार हो सकता है।
एक हालिया अध्ययन ने इस विशिष्ट एंजाइम, मोनोअमीन ऑक्सीडेज बी पर ध्यान केंद्रित किया ताकि मशीन लर्निंग न्यायाधीशों की एक नई पीढ़ी का निर्माण और परीक्षण किया जा सके। शोधकर्ताओं ने सबसे पहले इस बात को स्वीकार करते हुए शुरुआत की कि इन मॉडलों का परीक्षण आमतौर पर कैसे किया जाता है। मानक परीक्षण अक्सर "डिकोय" (decoys) का उपयोग करते हैं, जो नकली निष्क्रिय अणु होते हैं जिन्हें वास्तविक दवाओं जैसा दिखने के लिए बनाया जाता है लेकिन उनमें जुड़ने की क्षमता नहीं होती। अध्ययन में पाया गया कि जब मशीन लर्निंग मॉडलों का परीक्षण इन डिकोय के विरुद्ध किया गया, तो वे असाधारण रूप से अच्छा प्रदर्शन करते थे, जिससे ऐसा प्रतीत होता था कि वे उच्च सटीकता के साथ सक्रिय दवाओं की पहचान कर रहे हैं। हालाँकि, जब शोधकर्ताओं ने एक सख्त परीक्षण सेट का उपयोग किया जो पूरी तरह से वास्तविक, प्रयोगात्मक रूप से पुष्ट निष्क्रिय यौगिकों से बना था, तो मानक, 'ऑफ-द-शेल्फ' मॉडलों का प्रदर्शन ढह गया। सबसे अच्छा जेनेरिक मॉडल, जो पहले लगभग 80% शीर्ष उम्मीदवारों को सही ढंग से खोजने में सक्षम लग रहा था, एक स्तर तक गिर गया जो रैंडम अनुमान लगाने से भी थोड़ा ही बेहतर था। इस नाटकीय गिरावट ने खुलासा किया कि पिछला उच्च स्कोर परीक्षण डेटा के विशिष्ट डिज़ाइन द्वारा निर्मित एक भ्रम था, न कि वास्तविक समझ का संकेत।
निराश होने के बजाय, टीम ने विशेष रूप से मोनोअमीन ऑक्सीडेज बी के डेटा पर प्रशिक्षित एक कस्टम मशीन लर्निंग मॉडल बनाया। उन्होंने कंप्यूटर को हजारों ज्ञात सक्रिय दवाओं और बड़ी संख्या में निष्क्रिय डिकोय को खिलाया, जिससे उसे प्रोटीन और अणुओं के बीच अंतःक्रिया के विशिष्ट पैटर्न को पहचानना सिखाया जा सके। शोधकर्ताओं ने कई अलग-अलग दृष्टिकोणों का परीक्षण किया यह देखने के लिए कि कौन सा सबसे अच्छा काम करेगा। उन्होंने उन मॉडलों की तुलना की जो अणुओं को केवल सक्रिय या निष्क्रिय के रूप में वर्गीकृत करते थे, बनाम उन मॉडलों की जो बाइंडिंग की सटीक शक्ति का अनुमान लगाने का प्रयास करते थे। उन्होंने यह भी परीक्षण किया कि क्या अणु के रासायनिक आकार के विवरण को, प्रोटीन के साथ उसके संपर्क के विवरण के साथ जोड़ने से मदद मिलेगी। परिणाम स्पष्ट थे: वे मॉडल जो बाइंडिंग की शक्ति की भविष्यवाणी करते थे, वे उन मॉडलों की तुलना में लगातार बेहतर प्रदर्शन करते थे जो केवल एक साधारण हाँ-या-ना वर्गीकरण करते थे। इसके अलावा, अणु के आकार के विवरण को उसके प्रोटीन के साथ होने वाली अंतःक्रिया के विवरण के साथ मिलाने से सबसे सटीक भविष्यवाणियाँ प्राप्त हुईं।
सबसे सफल मॉडल, जो एक अत्यधिक ट्यून किया गया मशीन लर्निंग एल्गोरिदम था, ने सख्त निष्क्रिय यौगिकों के सेट के विरुद्ध परीक्षण किए जाने पर सक्रिय दवाओं को उस दर से तीन गुना अधिक तेजी से पहचाना जो सर्वश्रेष्ठ जेनेरिक मॉडलों ने किया था। हालाँकि, इस सफलता के साथ एक महत्वपूर्ण चेतावनी भी जुड़ी थी। जब शोधकर्ताओं ने उन अणुओं का विश्लेषण किया जिन्हें इस शीर्ष प्रदर्शन करने वाले मॉडल ने खोजा था, तो उन्होंने पाया कि यह काफी हद तक उन यौगिकों को खोज रहा था जो प्रशिक्षण के दौरान देखे गए सक्रिय दवाओं के बहुत समान थे। मॉडल ज्ञात दवाओं के रासायनिक 'कजिन्स' (समान रूपों) को पहचानने में उत्कृष्ट था, लेकिन वह पूरी तरह से नए प्रकार के अणुओं को खोजने में संघर्ष कर रहा था जिनका कंप्यूटर ने पहले कभी सामना नहीं किया था। यह सुझाव देता है कि जबकि कस्टम मॉडल मौजूदा उपचारों के रूपांतर खोजने के लिए एक शक्तिशाली उपकरण है, इसमें पूरी तरह से नए रासायनिक क्षेत्रों तक सामान्यीकरण (generalize) करने की क्षमता अभी तक नहीं है।
अध्ययन यह निष्कर्ष निकालता है कि दवा की खोज के मार्ग के लिए अधिक कठोर परीक्षण की आवश्यकता है। अतीत में कई मशीन लर्निंग उपकरणों की कथित सफलता अक्सर आसान परीक्षण सेटों के उपयोग से बढ़ी हुई थी जो वास्तविक दुनिया की स्क्रीनिंग की कठिनाई को नहीं दर्शाते हैं। वास्तव में विश्वसनीय उपकरण बनाने के लिए, भविष्य के अनुसंधान को वास्तविक निष्क्रिय यौगिकों से बने परीक्षण सेटों का उपयोग करना चाहिए और इस बात के प्रति सावधान रहना चाहिए कि एक मॉडल जो विशिष्ट रासायनिक आकारों को पहचानना सीख चुका है और वह जो दवाओं के प्रोटीन से जुड़ने के मौलिक नियमों को सीख चुका है, के बीच अंतर किया जा सके। मोनोअमीन ऑक्सीडेज बी के लिए, और संभवतः कई अन्य ड्रग टारगेटों के लिए, सबसे प्रभावी रणनीति कस्टम-प्रशिक्षित मॉडलों का उपयोग करना है जो संरचनात्मक विवरणों को रासायनिक विवरणों के साथ जोड़ते हैं, जबकि इस बात के प्रति सचेत रहते हैं कि ये मॉडल वर्तमान में जो वे पहले से जानते हैं उसे खोजने में सबसे अच्छे हैं, न कि अज्ञात की खोज करने में।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।