SPADE: Faster Drug Discovery by Learning from Sparse Data
यह शोध पत्र SPADE को पेश करता है, जो एक नवीन एल्गोरिदम है जो विरल डेटा (sparse data) का उपयोग करके नवीन प्रोटीनों के लिए उच्च-गुणवत्ता वाले लिगेंड्स को कुशलतापूर्वक पहचानकर दवा की खोज में महत्वपूर्ण तेजी लाता है, जिसमें 10 सफल उम्मीदवारों को खोजने के लिए औसतन केवल 40 परीक्षणों की आवश्यकता होती है और यह नमूना दक्षता (sample efficiency) और स्कोरिंग गति दोनों में डीप लर्निंग और बायेसियन ऑप्टिमाइज़ेशन विधियों से बेहतर प्रदर्शन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक खजाना खोजने वाले हैं जो एक विशाल गोदाम में छिपे एक विशिष्ट, अविश्वसनीय रूप से दुर्लभ रत्न की तलाश कर रहे हैं, जो लाखों साधारण पत्थरों से भरा हुआ है। यह अनिवार्य रूप से वैसा ही है जैसा कि ड्रग डिस्कवरी (दवा की खोज) में होता है, जब वैज्ञानिक एक विशिष्ट प्रोटीन (हमारे शरीर के भीतर एक सूक्ष्म मशीन, जिसके खराब होने पर बीमारी होती है) के लिए एक नई दवा खोजने की कोशिश करते हैं।
यहाँ SPADE की कहानी है, जो एक नया तरीका है जिसे इन "रत्नों" (प्रभावी दवा अणुओं) को वर्तमान तरीकों की तुलना में बहुत तेज़ी से और सस्ते में खोजने के लिए डिज़ाइन किया गया है।
समस्या: भूसे के ढेर में सुई
ड्रग डिस्कवरी की दुनिया में, वैज्ञानिकों के पास लाखों संभावित उम्मीदवारों (लिगेंड्स) की एक सूची होती है। हालाँकि, उनमें से 5% से भी कम वास्तव में अगले चरण के लिए विचार किए जाने लायक काम के होते हैं। उन बिल्कुल नए प्रोटीनों के लिए जिनका अध्ययन वैज्ञानिकों ने पहले कभी नहीं किया है, उनके पास शून्य पूर्व डेटा होता है। उन्हें शून्य से शुरुआत करनी पड़ती है।
इन रत्नों को खोजने का पारंपरिक तरीका एक धीमा और महंगा चक्र है जिसे DM_TA (डिज़ाइन, मेक, टेस्ट, एनालाइज़) कहा जाता है:
- कुछ उम्मीदवारों को चुनें।
- उन्हें लैब में बनाएं।
- यह देखने के लिए परीक्षण करें कि वे लक्षित प्रोटीन से कितनी अच्छी तरह जुड़ते हैं।
- परिणामों का विश्लेषण करें और अगला बैच चुनें।
लक्ष्य कम से कम परीक्षणों का उपयोग करके 10 उच्च-गुणवत्ता वाले रत्न (ऐसे अणु जो मजबूती से जुड़ते हैं) खोजना है। लेकिन क्योंकि "अच्छे" अणु बहुत दुर्लभ हैं (जैसे 100 पत्थरों में से 1 रत्न ढूंढना), और गोदाम बहुत बड़ा है, इसलिए पारंपरिक तरीके अक्सर उन पत्थरों का परीक्षण करने में समय बर्बाद करते हैं जो स्पष्ट रूप से बेकार हैं।
पुराना तरीका: हर पत्थर के मूल्य का अनुमान लगाना
पिछले तरीकों ने एक अत्यंत सटीक मूल्यांकनकर्ता (appraiser) की तरह काम करने की कोशिश की। उन्होंने गोदाम के हर एक पत्थर के सटीक "मूल्य" (बाइंडिंग स्ट्रेंथ) की भविष्यवाणी करने की कोशिश की।
- खामी: बहुत कम डेटा पॉइंट्स और इतने बड़े, जटिल गोदाम के साथ, हर पत्थर के सटीक मूल्य का अनुमान लगाने की कोशिश करने से भ्रम और त्रुटियां पैदा होती हैं। यह एक शहर के हर घर की सटीक कीमत बताने की कोशिश करने जैसा है जब आपने केवल दो घर देखे हों। यह बहुत कठिन और धीमा है।
नया तरीका: SPADE (एक "बाकी सबसे बेहतर" फ़िल्टर)
लेखक SPाडे (SPADE - Sparse-data Predictions for Accelerating Drug Exploration) का प्रस्ताव करते हैं। हर पत्थर का मूल्य बताने वाले एक पूर्ण मूल्यांकनकर्ता बनने के बजाय, SPADE एक स्मार्ट फ़िल्टर की तरह कार्य करता है।
उपमा: "टॉप 10" गेम
कल्पना कीजिए कि आप एक खेल खेल रहे हैं जहाँ आपको लाखों खिलाड़ियों की लीग में शीर्ष 10 सर्वश्रेष्ठ खिलाड़ियों को खोजना है।
- पुराना तरीका: आप लीग के प्रत्येक खिलाड़ी के सटीक कौशल स्कोर की गणना करने की कोशिश करते हैं।
- SPADE तरीका: आपको औसत खिलाड़ी के सटीक स्कोर की परवाह नहीं है। आपको केवल एक प्रश्न की परवाह है: "क्या यह नया खिलाड़ी हमारे द्वारा अब तक खोजे गए वर्तमान शीर्ष 10 खिलाड़ियों में से 10वें सर्वश्रेष्ठ खिलाड़ी से बेहतर है?"
यदि उत्तर "हाँ" है, तो आप उनका परीक्षण करते हैं। यदि उत्तर "नहीं" है, तो आप उन्हें अनदेखा कर देते हैं।
SPADE कैसे काम करता है (सीक्रेट सॉस)
SPADE इस तथ्य को संभालने के लिए कि डेटा बहुत कम है, दो चतुर युक्तियों का उपयोग करता है:
विजेताओं पर ध्यान दें, हारने वालों पर नहीं:
करोड़ों "बुरे" पत्थरों से सीखने के बजाय, SPADE पूरी तरह से उन कुछ "अच्छे" पत्थरों पर ध्यान केंद्रित करता है जो उसे अब तक मिले हैं। यह प्रत्येक वर्तमान शीर्ष उम्मीदवारों के लिए एक विशेष फ़िल्टर बनाता है। यह पूछता है, "क्या यह नया पत्थर हमारे वर्तमान सर्वश्रेष्ठ पत्थरों की विशेष विशेषताओं को साझा करता है?""फजी" सुरक्षा जाल (Robustness):
चूंकि अच्छे उदाहरण बहुत कम हैं, इसलिए एक कंप्यूटर भ्रमित हो सकता है और भाग्यवश एक रैंडम बुरे पत्थर को अच्छा समझ सकता है (ओवरफिटिंग)। इसे रोकने के लिए, SPADE एक गणितीय "फजी" (धुंधले) क्षेत्र का उपयोग करता है।
- कल्पित कीजिए कि डार्टबोर्ड पर एक लक्ष्य है। यह कहने के बजाय कि "आपको विजेता बनने के लिए ठीक केंद्र में हिट करना होगा," SPADE कहता है, "यदि आप केंद्र के आसपास के इस घेरे के भीतर कहीं भी हिट करते हैं, तो आप एक विजेता हैं।"
- यह कंप्यूटर को रैंडम शोर (noise) से धोखा खाए बिना, एक अच्छी दवा के सामान्य पैटर्न को सीखने में मदद करता है। यह विधि को अत्यधिक डेटा की कमी के बावजूद बहुत मजबूत बनाता है।
परिणाम: गति और दक्षता
पेपर ने 100 अलग-अलग प्रोटीनों के खिलाफ SPADE का परीक्षण किया और इसकी तुलना मौजूदा सर्वोत्तम तरीकों (जैसे Bayesian Optimization और Deep Learning) से की।
- कम परीक्षण: 10 उच्च-गुणवत्ता वाली दवाओं को खोजने के लिए, SPADE को अपने प्रतिस्पर्धियों की तुलना में 7% से 32% कम परीक्षणों की आवश्यकता पड़ी। औसतन, इसने केवल 40 परीक्षणों में 10 अच्छी दवाएं खोज लीं।
- तेज़ स्कोरिंग: जब करोड़ों उम्मीदवारों की जांच करने का समय आया कि आगे किन परीक्षणों को करना है, तो SPADE अपने निकटतम प्रतिद्वंद्वी की तुलना में 10 गुना तेज़ था।
- कोई पूर्व ज्ञान आवश्यक नहीं: यह तब भी पूरी तरह से काम करता है जब वैज्ञानिकों को लक्षित प्रोटीन के बारे में पहले से कुछ भी पता नहीं होता है।
निचोड़
SPADE गेम को बदल देता है क्योंकि यह वैज्ञानिकों को असंभव की भविष्यवाणी करने (प्रत्येक अणु के मूल्य की) के बजाय एक सरल, स्मार्ट लक्ष्य पर ध्यान केंद्रित करने के लिए प्रेरित करता है: उन अणुओं को खोजना जो हमारे द्वारा पहले से खोजे गए सर्वश्रेष्ठ अणुओं से बेहतर हैं।
यह इस बात को समझने जैसा है कि आपको स्टेडियम में सबसे लंबे व्यक्ति को खोजने के लिए हर व्यक्ति की सटीक ऊंचाई जानने की आवश्यकता नहीं है; आपको बस यह पहचानने का एक तरीका चाहिए कि क्या कोई वर्तमान रिकॉर्ड धारक से लंबा है। यह दृष्टिकोण जीवन रक्षक दवाएं बनाने के शुरुआती चरणों में समय, पैसा और संसाधनों की बचत करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।