Frequent Hitter Prediction Beyond Classification Models
यह अध्ययन प्रदर्शित करता है कि एम्पेरिकल बेयस-सुधारित हिट दरों का प्रत्यक्ष प्रतिगमन (डायरेक्ट रिग्रेशन) और मल्टी-लेबल एकत्रीकरण रणनीतियाँ, हाई-थ्रूपुट स्क्रीनिंग में बार-बार हिट होने वाले तत्वों की भविष्यवाणी करने के लिए पारंपरिक थ्रेशोल्ड-विशिष्ट बाइनरी वर्गीकरण से बेहतर प्रदर्शन करती हैं, जो एक अधिक सुदृढ़, कटऑफ-अज्ञेय दृष्टिकोण प्रदान करती है जो प्रारंभिक संवर्धन (अर्ली एनरिचमेंट) और वैश्विक रैंकिंग में सुधार करता है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें
दवा की खोज के शुरुआती चरणों में, वैज्ञानिक उच्च-थ्रूपुट स्क्रीनिंग (high-throughput screening) नामक विशाल प्रयोग चलाते हैं। कल्पना कीजिए कि एक प्रयोगशाला में रोबोट सैकड़ों हजारों सूक्ष्म रासायनिक अणुओं का जैविक लक्ष्यों के विरुद्ध परीक्षण कर रहे हैं, और यह देख रहे हैं कि क्या कोई अणु किसी बीमारी पैदा करने वाले प्रोटीन से चिपक सकता है या किसी हानिकारक कोशिका प्रक्रिया को बाधित कर सकता है। इसका लक्ष्य उन दुर्लभ "हिट्स" (hits) को खोजना है—ऐसे अणु जो भविष्य की दवाओं के रूपas वास्तविक क्षमता दिखाते हैं। हालाँकि, यह प्रक्रिया शोर भरी (noisy) होती है। कई अणु झूठी चेतावनी (false alarms) देते हैं। कुछ अणु इस तरह आपस में गुच्छे बना लेते हैं जो परीक्षण को रोक देते हैं, कुछ उपकरण के साथ रासायनिक प्रतिक्रिया करते हैं, और कुछ बस उस तरीके में हस्तक्षेप करते हैं जिससे मशीन परिणाम पढ़ती है। इन समस्या पैदा करने वालों को "फ्रीक्वेंट हिटर्स" (frequent hitters) के रूप में जाना जाता है। वे दर्जनों या सैकड़ों अलग-अलग परीक्षणों में सक्रिय दिखाई देते हैं, इसलिए नहीं कि वे शक्तिशाली दवाएं हैं, बल्कि इसलिए क्योंकि वे रासायनिक रूप से शोर पैदा करने वाले होते हैं। यदि शोधकर्ता इन शोर वाले यौगिकों को वास्तविक दवा उम्मीदवारों से अलग नहीं कर पाते हैं, तो वे गलत रास्तों पर समय और पैसा बर्बाद करते हैं। चुनौती एक ऐसा सिस्टम बनाने की है जो इन फ्रीक्वेंट हिटर्स को जल्दी पहचान सके, और महंगे प्रयोग शुरू होने से पहले सिग्नल को शोर से अलग कर सके।
वर्षों से, इस समस्या को संभालने का मानक तरीका एक कठोर रेखा खींचना रहा है। वैज्ञानिक गणना करते थे कि एक अणु अपने सभी परीक्षणों में कितनी बार 'हिट' के रूप में दिखाई दिया और फिर एक निश्चित कटऑफ (cutoff) निर्धारित करते थे। यदि किसी अणु की हिट दर उस रेखा से ऊपर थी, तो उसे "फ्रीक्वेंट हिटर" मानकर हटा दिया जाता था। यदि यह रेखा से नीचे थी, तो उसे रखा जाता था। यह दृष्टिकोण, हालांकि सरल है, में एक महत्वपूर्ण दोष है। यह निर्णय को एक साधारण 'हाँ' या 'ना' के रूप में मानता है, जिससे रेखा के ठीक पास स्थित अणुओं के बारे में मूल्यवान जानकारी भी नष्ट हो जाती है। एक अणु जो कटऑफ से बस थोड़ा ही ऊपर है, उसे ठीक वैसा ही माना जाता है जैसे कि एक बहुत बड़ा अपराधी, जबकि एक अणु जो कटऑफ से बस थोड़ा नीचे है, उसे पूरी तरह सुरक्षित माना जाता है, भले ही वह समस्या होने के बेहद करीब हो। इसके अलावा, यदि कोई लैब अपने नियम बदलना चाहती है और अधिक सख्त या उदार होना चाहती है, तो उन्हें अपना पूरा कंप्यूटर मॉडल शून्य से फिर से बनाना पड़ता है। यह कठोरता वैज्ञानिकों की सबसे आशाजनक संभावनाओं को प्राथमिकता देने की क्षमता को सीमित करती है।
स्विस फेडरल इंस्टीट्यूट ऑफ टेक्नोलॉजी और नोवार्टिस बायोमेडिकल रिसर्च के शोधकर्ताओं की एक टीम ने इस प्रक्रिया पर पुनर्विचार करने का निर्णय लिया। हर अणु को एक बाइनरी बॉक्स (binary box) में डालने के बजाय, उन्होंने पूछा कि क्या वे एक निरंतर स्कोर (continuous score) की भविष्यवाणी कर सकते हैं जो एक अणु के फ्रीक्वेंट हिटर होने की वास्तविक संभावना को दर्शाता हो। उन्होंने ग्राफ न्यूरल नेटवर्क (graph neural networks) के रूप में जाने जाने वाले उन्नत कंप्यूटर मॉडलों का उपयोग करके एक नया दृष्टिकोण विकसित किया, जो अणुओं के आकार को देखते हैं। इन मॉडलों को केवल "हाँ" या "ना" कहने के लिए प्रशिक्षित करने के बजाय, उन्होंने उन्हें एक विशिष्ट संख्या की भविष्यवाणी करने के लिए प्रशिक्षित किया: एक सुधारा गया हिट रेट (corrected hit rate) जो इस बात का हिसाब रखता है कि एक अणु वास्तव में कितने परीक्षणों से गुजरा है। यह विधि, जो शोर को कम करने के लिए एम्पीरिक बेयस (empirical Bayes) नामक सांख्यिकीय तकनीक का उपयोग करती है, मॉडल को जोखिम के पूरे स्पेक्ट्रम को देखने की अनुमति देती है। यह स्पष्ट रूप से परेशानी पैदा करने वाले अणु, एक स्पष्ट सफलता, और बीच के उन अणुओं के बीच अंतर कर सकती है जिन्हें बारीकी से निरीक्षण की आवश्यकता है।
शोधकर्ताओं ने इस नई विधि का परीक्षण पुराने तरीके के मुकाबले डेटा के दो विशाल संग्रहों का उपयोग करके किया। एक सेट एक सार्वजनिक डेटाबेस से आया जिसमें एक हजार से अधिक विभिन्न जैविक परीक्षण शामिल थे, और दूसरा नोवार्टिस के अपने निजी स्क्रीनिंग परिणामों की लाइब्रेरी से था। उन्होंने डेटा को इस आधार पर समूहों में विभाजित किया कि परीक्षण टेस्ट ट्यूब (biochemical) में किए गए थे या जीवित कोशिकाओं (cellular) के भीतर, यह सुनिश्चित करते हुए कि कंप्यूटर मॉडल उन रासायनिक संरचनाओं पर परीक्षण किए जाएं जिन्हें उन्होंने पहले कभी नहीं देखा था। उन्होंने अपने नए निरंतर भविष्यवाणी मॉडलों की तुलना निश्चित कटऑफ पर निर्भर पारंपरिक मॉडलों से की। परिणामों ने दिखाया कि नया दृष्टिकोण श्रेष्ठ था। निरंतर मॉडल अणुओं को सही ढंग से रैंक करने में बेहतर थे, विशेष रूप से तब जब शोधकर्ताओं को सबसे खराब अपराधियों को छानने के लिए बहुत सख्त होने की आवश्यकता थी। वे सूची में सबसे समस्याग्रस्त यौगिकों को पहले ही पहचान सकते थे, जो प्रयोगशाला में समय बचाने के लिए अत्यंत महत्वपूर्ण है।
शायद सबसे महत्वपूर्ण बात यह है कि नई विधि बहुत अधिक लचीली साबित हुई। चूंकि मॉडल एक निश्चित लेबल के बजाय एक निरंतर स्कोर की भविष्यवाणी करता है, इसलिए वैज्ञानिक बिना कंप्यूटर को पुन: प्रशिक्षित किए किसी भी समय अपने निर्णय के नियमों को समायोजित कर सकते हैं। यदि किसी प्रोजेक्ट के लिए सुरक्षा का बहुत उच्च मार्जिन आवश्यक है, तो वे समस्या के रूप में क्या गिना जाए, इसकी सीमा (threshold) को आसानी से बढ़ा सकते हैं। यदि उन्हें व्यापक जाल फैलाना है, तो वे इसे कम कर सकते हैं। अध्ययन में पाया गया कि यह लचीलापन, बेहतर सटीकता के साथ मिलकर, निरंतर दृष्टिकोण को वास्तविक दुनिया की दवा खोज के लिए एक अधिक व्यावहारिक उपकरण बनाता है। शोधकर्ताओं ने एक दूसरी रणनीति का भी पता लगाया जहाँ मॉडल प्रत्येक विशिष्ट परीक्षण के परिणाम की व्यक्तिगत रूप से भविष्यवाणी करता है और फिर उन भविष्यवाणियों को एक एकल स्कोर में जोड़ देता है। यह विधि भी अच्छा प्रदर्शन करती है, जो यह समझने का एक अलग तरीका प्रदान करती है कि कोई अणु समस्या क्यों पैदा कर रहा होगा।
निष्कर्ष बताते हैं कि स्क्रीनिंग का भविष्य कठोर, ब्लैक-एंड-व्हाइट वर्गीकरणों से हटकर जोखिम की एक सूक्ष्म समझ की ओर बढ़ने में निहित है। फ्रीक्वेंट हिटिंग को एक श्रेणी के बजाय एक स्पेक्ट्रम के रूप में मानकर, ये नए मॉडल यह प्राथमिकता देने का एक स्पष्ट और अधिक विश्वसनीय तरीका प्रदान करते हैं कि किन अणुओं पर आगे का अध्ययन किया जाना चाहिए। इसका मतलब यह नहीं है कि पुराने तरीके बेकार हैं, बल्कि यह दिखाता है कि वे उतने कुशल नहीं हैं जितने कि वे हो सकते हैं। निरंतर मॉडल एक मजबूत आधार (baseline) के रूप में कार्य करते हैं, जो उन सूक्ष्म अंतरों को त्याग बिना जो अक्सर सबसे अधिक मायने रखते हैं, रासायनिक डेटा की अव्यवस्थित वास्तविकता को संभालने में सक्षम हैं। जैसे-जैसे दवा की खोज बड़े पैमाने पर डेटा पर निर्भर होती जा रही है, एक ऐसा सिस्टम होना जो बदलती जरूरतों के अनुकूल हो सके और प्रत्येक अणु के लिए एक विस्तृत जोखिम प्रोफाइल प्रदान कर सके, जीवन रक्षक दवाओं की अगली पीढ़ी खोजने के लिए आवश्यक होगा।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।