← नवीनतम पेपर
💻 bioinformatics

Biological rationales from language models enable leakage-resistant forecasts of target-indication success

यह शोध पत्र PRIORITI को प्रस्तुत करता है, जो एक लीकेज-प्रतिरोधी (leakage-resistant) ढांचा है जो लक्ष्य-इंडिकेशन (target-indication) की सफलता के कैलिब्रेटेड और व्याख्यात्मक पूर्वानुमान उत्पन्न करने के लिए ड्रग-अग्नोस्टिक जैविक साक्ष्य को संश्लेषित करने हेतु डोमेन-निर्देशित लार्ज लैंग्वेज मॉडल्स का लाभ उठाता है, जो ऐतिहासिक और भविष्योन्मुखी दोनों मूल्यांकनों में मौजूदा बेसलाइन से बेहतर प्रदर्शन करता है।

मूल लेखक: Zhang, W., Xu, J., Zhang, Z., Liu, M., Sun, R., Al-lazikani, B., Shen, X., Kopetz, S., Wu, L., Zhao, B., Wu, C.

प्रकाशित 2026-09-29
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhang, W., Xu, J., Zhang, Z., Liu, M., Sun, R., Al-lazikani, B., Shen, X., Kopetz, S., Wu, L., Zhao, B., Wu, C.

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ⚕️ यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें

एक जैविक विचार से जीवन बचाने वाली दवा तक का सफर एक लंबा, महंगा और अक्सर निराशाजनक रास्ता है। वैज्ञानिक हजारों आशाजनक लक्ष्यों—विशिष्ट जीन या प्रोटीन जो किसी बीमारी को ठीक कर सकते हैं—और हजारों बीमारियों की पहचान कर सकते हैं जिन्हें ठीक करने की आवश्यकता है। लेकिन यह पता लगाना कि किसी विशिष्ट लक्ष्य और बीमारी का संयोजन एक दवा बनाने के लिए आवश्यक अरबों डॉलर और वर्षों के काम को उचित ठहराने के लिए पर्याप्त मजबूत है या नहीं, एक बहुत बड़ा अनुमान लगाने वाला खेल है। ऐतिहासिक रूप से, शोधकर्ता बिखरे हुए डेटा के पहाड़ों को छानने के लिए मानव विशेषज्ञों पर निर्भर रहे हैं, ताकि इस बात के सुराग मिल सकें कि क्या कोई विशिष्ट जीन वास्तव में किसी विशिष्ट बीमारी का कारण बनता है। यह प्रक्रिया धीमी, असमान है और इसमें अक्सर सूक्ष्म विवरणों पर ध्यान केंद्रित करने के चक्कर में व्यापक परिदृश्य को समझने में चूक हो जाती है। मुख्य चुनौती विचार उत्पन्न करना नहीं है, बल्कि उन्हें फ़िल्टर करना है: यह निर्धारित करना कि कौन से जैविक परिकल्पनाएं (hypotheses) एक दवा अणु को डिजाइन किए जाने से पहले ही आगे बढ़ने के लिए पर्याप्त ठोस हैं।

एक नया अध्ययन PRIORITI नामक एक प्रणाली पेश करता है, जिसे दवा खोज के इस अराजक प्रारंभिक चरण में स्पष्टता लाने के लिए डिज़ाइन किया गया है। शोधकर्ताओं ने एक ढांचा तैयार किया है जो एक लार्ज लैंग्वेज मॉडल (LLM)—एक प्रकार का आर्टिफिशियल इंटेलिजेंस जिसे विशाल मात्रा में टेक्स्ट पर प्रशिक्षित किया गया है—का उपयोग करता है, जिसका उद्देश्य किसी दवा परीक्षण के परिणाम का अनुमान लगाना नहीं, बल्कि जैविक साक्ष्यों के एक कठोर संकलक (synthesizer) के रूप में कार्य करना है। AI से यह पूछने के बजाय कि क्या कोई दवा काम करेगी, यह प्रणाली उससे उपलब्ध सभी मानव आनुवंशिक डेटा, पशु अध्ययनों और जैविक मार्गों (pathways) को पढ़ने और एक स्पष्ट, दवा-मुक्त तर्क बनाने के लिए कहती है कि क्यों एक विशिष्ट जीन किसी विशिष्ट बीमारी का इलाज कर सकता है। AI को सख्ती से निर्देश दिया गया है कि वह मौजूदा दवाओं, नैदानिक परीक्षणों या नियामक अनुमोदनों के बारे में किसी भी जानकारी को अनदेखा करे, जिससे यह सुनिश्चित हो सके कि वह केवल कच्चे जैविक डेटा को ही देखे। एक बार जब AI यह जैविक तर्क लिख लेता है, तो एक अलग, पारंपरिक कंप्यूटर मॉडल पिछले सफल और असफल ड्रग्स के विशाल डेटाबेस के विरुद्ध उस तर्क की संरचना का विश्लेषण करता है ताकि सफलता की संभावना की गणना की जा सके।

टीम ने इस प्रणाली का परीक्षण हजारों ऐतिहासिक लक्ष्य-रोग युग्मों (target-disease pairs) पर किया, जिसमें उन युग्मों का एक सेट भी शामिल था जिनके परिणाम AI के प्रशिक्षण डेटा की कट-ऑफ तिथि के बाद ज्ञात हुए थे। यह "आउट-ऑफ-टाइम" परीक्षण महत्वपूर्ण है क्योंकि यह सिद्ध करता है कि प्रणाली जैविक तर्क के आधार पर भविष्यवाणी कर रही है, न कि केवल पिछले परिणामों को याद करके। परिणाम आश्चर्यजनक थे। PRIORITI प्रणाली ने सफल दवा कार्यक्रमों को असफल कार्यक्रमों की तुलना में बहुत उच्च स्तर पर सही ढंग से रैंक किया, और ऐसी सटीकता हासिल की जो मानक कंप्यूटर मॉडलों (जो केवल जीन के नाम और रोग की परिभाषाओं को देखते हैं) और सीधे तौर पर परिणाम का अनुमान लगाने के प्रयासों, दोनों से काफी बेहतर थी। यह प्रणाली विशेष रूप से यह पहचानने में सक्षम थी कि कौन सी परिकल्पनाएं विफल होने की संभावना रखती हैं, जिसने असफल युग्मों के बड़े हिस्से को कम-संभावना वाले उम्मीदवारों के रूप में सही ढंग से चिह्नित किया।

इस शोध का एक प्रमुख निष्कर्ष यह है कि मूल्य जैविक तर्क की संरचना में निहित है, न कि केवल एक साधारण स्कोर में। विभिन्न प्रकार के साक्ष्यों को जोड़ने की AI की क्षमता—जैसे कि मानव आनुवंशिकी पशु अध्ययनों के साथ कितनी अच्छी तरह मेल खाती है—ने एक समृद्ध विवरण तैयार किया जिससे कंप्यूटर मॉडल सीख सका। जब शोधकर्ताओं ने AI का उपयोग सीधे परिणाम का अनुमान लगाने के लिए किया, बिना इस संरचित साक्ष्य चरण के, तो प्रदर्शन खराब रहा और विश्वास स्तर अविश्वसनीय थे। यह सुझाव देता है कि AI का सबसे अच्छा उपयोग एक अनुवादक के रूप में है जो बिखरे हुए और अव्यवस्थित वैज्ञानिक तथ्यों को एक सुसंगत कहानी में बदल देता है, जिसका उपयोग एक अलग सांख्यिकीय मॉडल एक कैलिब्रेटेड भविष्यवाणी करने के लिए करता है। प्रणाली ने प्रत्येक भविष्यवाणी के लिए एक "तर्क" (rationale) भी प्रदान किया, जिसमें सरल भाषा में समझाया गया कि क्यों एक विशिष्ट जीन-रोग युग्म को उच्च या निम्न रैंक दी गई, जिससे यह प्रक्रिया मानव वैज्ञानिकों के लिए पारदर्शी और ऑडिट योग्य बन गई।

अध्ययन स्पष्ट रूप से इस विचार को खारिज करता है कि प्रणाली की सफलता केवल AI द्वारा पिछले दवा परीक्षण परिणामों को याद रखने के कारण थी। शोधकर्ताओं ने सत्यापित किया कि AI परीक्षण मामलों के विशिष्ट परिणामों को अपने प्रशिक्षण डेटा से शायद ही कभी पहचान पाता था, और भले ही उसने उन्हें पहचाना भी, वे मामले बहुत कम थे और समग्र परिणामों को प्रभावित नहीं करते थे। उन्होंने यह भी प्रदर्शित किया कि यह प्रणाली तब भी काम करती है जब इसका सामना पूरी तरह से नए जीन या बीमारियों से होता है जिन्हें इसने पहले कभी नहीं देखा है, जो यह सिद्ध करता है कि इसने विशिष्ट नामों को याद करने के बजाय जैविक संभाव्यता के पैटर्न को पहचानना सीख लिया है। हालांकि, लेखक सावधानीपूर्वक नोट करते हैं कि यह प्रणाली एक जैविक परिकल्पना के ठोस होने की संभावना की भविष्यवाणी करती है, न कि किसी विशिष्ट दवा की सफलता की। एक दवा जैविक कारणों से, जैसे कि खराब खुराक या निर्माण संबंधी समस्याओं के कारण विफल हो सकती है, और एक जैविक रूप से ठोस विचार अप्रत्याशित तंत्रों के माध्यम से सफल हो सकता है।

अंततः, यह कार्य महंगी नैदानिक परीक्षण अवस्था में प्रवेश करने से पहले संभावित दवाओं की विशाल संख्या को प्राथमिकता देने का एक नया तरीका प्रदान करता है। साक्ष्य एकत्र करने और सारांशित करने के कार्य को परिणाम की भविष्यवाणी करने के कार्य से अलग करके, शोधकर्ताओं ने एक ऐसा उपकरण बनाया है जो शक्तिशाली और पारदर्शी दोनों है। यह मानव निर्णय का स्थान नहीं लेता है बल्कि एक कैलिब्रेटेड, 'बायोलॉजी-फर्स्ट' संभावना प्रदान करता है जो शोधकर्ताओं को यह तय करने में मदद करता है कि वे अपने सीमित संसाधनों को कहाँ केंद्रित करें। यह प्रणाली सुझाव देती है कि दवा खोज का भविष्य आर्टिफिशियल इंटेलिजेंस को भविष्यवक्ता बनाने में नहीं, बल्कि इस बात का एक स्पष्ट, साक्ष्य-आधारित मामला बनाने में है कि कोई उपचार क्यों काम कर सकता है, जिससे अंतिम निर्णय विज्ञान के कठोर परीक्षण पर छोड़ दिया जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →