Two Comparators May Be All We Need
यह शोधपत्र दो स्ट्रक्चर-फ्री (संरचना-मुक्त) मशीन लर्निंग मॉडल प्रस्तुत करता है जो रासायनिक संरचनाओं और प्रोटीन अनुक्रमों की तुलना करके यौगिकों और लक्ष्यों के बीच युग्मवार प्राथमिकताओं (pairwise preferences) की सटीक भविष्यवाणी करते हैं, जिससे बिना किसी कन्फर्मेशनल विश्लेषण या प्रोटीन संरचना डेटा की आवश्यकता के रैंकिंग में उच्च सटीकता प्राप्त होती है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें
एक जीवित कोशिका के भीतर, एक दवा का अणु केवल एक ही लक्ष्य से नहीं मिलता। यह एक भीड़भाड़ वाले वातावरण में तैरता रहता है जहाँ इसका सामना प्रोटीन के एक विशाल स्पेक्ट्रम से होता है, जिनमें से कई अलग-अलग परिवारों से संबंधित होते हैं। अणु का अंतिम प्रभाव इन सभी अंतःक्रियाओं का योग होता है, न कि केवल इसके इच्छित लक्ष्य से इसके जुड़ने का। दशकों से, इन अंतःक्रियाओं का अध्ययन करने का मानक तरीका एक समय में एक ही प्रश्न पूछना रहा है: क्या यह विशिष्ट दवा इस विशिष्ट प्रोटीन से जुड़ती है? शोधकर्ताओं ने इस एकल अंतःक्रिया की भविष्यवाणी करने के लिए मॉडल बनाए हैं, लेकिन दवा विकास की वास्तविकता शायद ही कभी इतनी अलग-थलग होती है। वैज्ञानिक अक्सर दो व्यावहारिक, तुलनात्मक प्रश्नों का सामना करते हैं जो उनके निर्णयों को संचालित करते हैं: एक नए दवा उम्मीदवार को देखते हुए, इसकी संभावना किस दो संभावित लक्ष्यों में से किससे जुड़ने की अधिक है? और इसके विपरीत, एक विशिष्ट लक्ष्य को देखते हुए, किन दो दवा उम्मीदवारों में से कौन सा बेहतर फिट है? इन प्रश्नों का उत्तर देने से शोधकर्ताओं को यह तय करने में मदद मिलती है कि उन्हें आगे कौन से यौगिकों का संश्लेषण करना चाहिए और किन अवांछित दुष्प्रभावों की जांच करनी चाहिए, यह भी बहुत पहले कि कोई दवा क्लिनिक तक पहुँचे।
शोधकर्ताओं की एक टीम ने अब विशेष रूप से इन तुलनात्मक प्रश्नों का उत्तर देने के लिए डिज़ाइन किए गए दो कंप्यूटर मॉडल बनाए हैं। एक सटीक बाइंडिंग स्ट्रेंथ (जुड़ने की शक्ति) की गणना करने के बजाय, ये मॉडल एक साथ दो वस्तुओं को देखते हैं और बस एक विजेता चुनते हैं। एक मॉडल एक दवा और दो अलग-अलग प्रोटीनों को लेता है और भविष्यवाणी करता है कि दवा किसे पसंद करती है। दूसरा मॉडल एक प्रोटीन और दो अलग-अलग दवाओं को लेता है और भविष्यवाणी करता है कि प्रोटीन किसे पसंद करता है। इन मॉडलों को लगभग 800,000 अद्वितीय दवा अणुओं और 2,700 से अधिक मानव प्रोटीनों से जुड़े 1.2 मिलियन से अधिक मापों के एक विशाल सार्वजनिक डेटाबेस पर प्रशिक्षित किया गया था। महत्वपूर्ण बात यह है कि ये मॉडल प्रोटीनों या दवा अणुओं के त्रि-आयामी (3D) आकार पर निर्भर नहीं करते हैं। उन्हें बाइंडिंग पॉकेट के सटीक ढांचे को जानने या अणुओं के आपस में फिट होने के लिए मुड़ने और घूमने के तरीके का अनुकरण करने की आवश्यकता नहीं है। इसके बजाय, वे प्रोटीनों को बनाने वाले अमीनो एसिड के कच्चे अनुक्रम (sequence) और दवाओं की रासायनिक संरचना के द्वि-आयामी मानचित्र के साथ काम करते हैं।
परिणाम बताते हैं कि यह प्रत्यक्ष तुलना दृष्टिकोण आश्चर्यजनक सटीकता के साथ काम करता है। दो अलग-अलग परिवारों के प्रोटीनों के बीच चयन करने के लिए पूछे जाने पर, मॉडल ने लगभग 75 प्रतिशत बार सही पसंदीदा लक्ष्य को चुना। जब दोनों प्रोटीन एक ही परिवार के थे, तो सटीकता बढ़कर 78 प्रतिशत हो गई। इसके विपरीत प्रश्न के लिए—एक एकल लक्ष्य के लिए दो दवाओं के बीच चुनना—मॉडल 71 प्रतिशत समय सही था। शोधकर्ताओं ने पाया कि मॉडल का आत्मविश्वास एक विश्वसनीय मार्गदर्शक है। जब मॉडल अपने चुनाव के प्रति बहुत आश्वस्त होता है, तो इसकी सटीकता बढ़कर 90 प्रतिशत से अधिक हो जाती है। हालाँकि, जब दोनों विकल्प उनकी मापी गई गतिविधि में बहुत समान होते हैं, तो मॉडल की उनके बीच अंतर करने की क्षमता कम हो जाती है, जो इस तथ्य को दर्शाता है कि प्रायोगिक डेटा स्वयं उन मामलों में अलग करना कठिन हो जाता है। मॉडलों का परीक्षण उन दवा अणुओं पर किया गया था जिन्हें उन्होंने पहले कभी नहीं देखा था, यह सुनिश्चित करते हुए कि परिणाम केवल पिछले डेटा की स्मृति नहीं बल्कि सामान्यीकरण करने की वास्तविक क्षमता थे।
इस कार्य की एक प्रमुख खोज यह है कि इन भविष्यवाणियों की सटीकता काफी हद तक वैज्ञानिक रिकॉर्ड में उपलब्ध डेटा पर निर्भर करती है, न कि केवल कंप्यूटर एल्गोरिदम की परिष्कार पर। मॉडल के लिए दो अलग-अलग प्रोटीन परिवारों की तुलना करने के लिए, उसे एक ऐसी दवा को देखना होगा जिसे दोनों के विरुद्ध परखा गया हो। शोधकर्ताओं ने पाया कि उनके डेटाबेस में मौजूद दवा अणुओं में से केवल लगभग 4.6 प्रतिशत को ही दो अलग-अलग प्रोटीन परिवारों के विरुद्ध मापा गया था। इस क्रॉस-फैमिली डेटा की कमी, दूर के लक्ष्यों की तुलना करने के दौरान मॉडल के प्रदर्शन पर एक प्राकृतिक सीमा लगा देती है। इसके विपरीत, एक ही प्रोटीन परिवार के भीतर, डेटा बहुत समृद्ध है, जिससे अधिक तुलनाएं संभव होती हैं। ये मॉडल एक सटीक बांड स्ट्रेंथ की भविष्यवाणी करने या भौतिक प्रयोगों को बदलने के लिए नहीं बनाए गए हैं। इसके बजाय, वे एक शक्तिशाली छँटाई उपकरण (sorting tool) के रूप में कार्य करते हैं, जो शोधकर्ताओं को यह प्राथमिकता देने में मदद करते हैं कि कौन से प्रयोग पहले किए जाएं। लक्ष्यों और यौगिकों को पूर्ण मूल्यों के बजाय प्राथमिकता के आधार पर रैंक करके, ये उपकरण प्रत्येक प्रोटीन के विस्तृत त्रि-आयामी वास्तुकला को जाने बिना, दवा अंतःक्रियाओं के जटिल परिदृश्य में नेविगेट करने का एक तरीका प्रदान करते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।