← नवीनतम पेपर
🧬 biology

Large-scale AI-Ready Data for Anti-Cancer Drug Response Modeling

यह शोध पत्र एंटी-कैंसर ड्रग रिस्पॉन्स मॉडलिंग के लिए एक महत्वपूर्ण रूप से विस्तारित, बड़े पैमाने के AI-रेडी डेटासेट को प्रस्तुत करता है जो लाखों मापों और 50,000 से अधिक नए यौगिकों को एकीकृत करता है, यह प्रदर्शित करते हुए कि इस संसाधन पर प्रशिक्षित मॉडल मूल IMPROVE बेंचमार्क की तुलना में अनदेखी दवाओं के लिए बेहतर सामान्यीकरण प्राप्त करते हैं।

मूल लेखक: Vincent Lavelle, Yitan Zhu, Kaitlyn Marlor, Thomas Brettin, Rick Stevens

प्रकाशित 2026-08-13
📖 3 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Vincent Lavelle, Yitan Zhu, Kaitlyn Marlor, Thomas Brettin, Rick Stevens

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ⚕️ यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जासूस हैं जो एक परम रहस्य को सुलझाने की कोशिश कर रहे हैं: क्यों एक विशिष्ट दवा एक व्यक्ति के कैंसर के लिए सुपरहीरो की तरह काम करती है लेकिन दूसरे के लिए पूरी तरह विफल हो जाती है? यह फार्माकोजेनोमिक्स (pharmacogenomics) की दुनिया है, जहाँ वैज्ञानिक दवा के रासायनिक स्वरूप और कैंसर कोशिकाओं के आनुवंशिक "फिंगरप्रिंट" नामक दो बड़े सुरागों को देखकर सही मरीज के लिए सही दवा मिलाने की कोशिश करते हैं। लंबे समय तक, इन जासूसों को कठिनाई हुई क्योंकि उनकी सुराग वाली किताबें बहुत छोटी और अव्यवस्थित थीं। उनके पास कुछ प्रयोगों का डेटा था, लेकिन रसायन हर किताब में अलग दिखते थे, और कोशिका प्रकार भ्रमित करने वाले तरीकों से वर्णित थे। यह अलग-अलग लिपियों में लिखी डिक्शनरी का उपयोग करके एक नई भाषा सीखने जैसा था। बिना सूचना के एक विशाल, स्वच्छ पुस्तकालय के, कंप्यूटर प्रोग्राम (AI) जिन्हें यह अनुमान लगाने के लिए डिज़ाइन किया गया था कि कौन सी दवाएं जीतेंगी, वे उन गहरे पैटर्न को सीखने में सक्षम नहीं थे जिनकी नए उपचार खोजने के लिए आवश्यकता थी। वे बुद्धिमान तो थे, लेकिन डेटा के लिए भूखे थे।

यह शोध पत्र उस विशाल, अत्यंत व्यवस्थित पुस्तकालय के निर्माण के बारे में है। शोधकर्ताओं ने एक मानक, सुव्यवस्थित डेटासेट जिसे IMPROVE कहा जाता है, लिया और उसे एक बड़ा अपग्रेड दिया। उन्होंने केवल कुछ पन्ने ही नहीं जोड़े; उन्होंने इसमें PharmacoDB नामक ड्रग प्रयोगों के एक विशाल संग्रह से लाखों नए माप मिला दिए। उन्होंने रासायनिक नामों को साफ किया ताकि हर दवा की एक एकल, सटीक आईडी हो, उन्होंने इस बात को मानकीकृत किया कि एक दवा ने कैंसर कोशिका को कैसे मारा, और इसमें 53,000 से अधिक विभिन्न रासायनिक यौगिकों को शामिल किया। उन्होंने कैंसर के प्रकारों और आनुवंशिक डेटा की एक विस्तृत विविधता भी शामिल की, जिससे एक छोटी नोटबुक एक विशाल विश्वकोश में बदल गई।

जब उन्होंने इस नए, विस्तारित पुस्तकालय पर अपने AI मॉडल का परीक्षण किया, तो उन्हें कुछ रोमांचक पता चला। मॉडल नई, अनदेखी रसायनों (एक परिदृश्य जिसे वे "ड्रग-ब्लाइंड" कहते हैं) के विरुद्ध दवा कैसे काम करेगी, और दवाओं और कैंसर कोशिकाओं के पूरी तरह से नए संयोजनों ( "डिस्क जॉइंट" सेटिंग) का सामना करते समय, बेहतर भविष्यवाणी करने में काफी सक्षम पाए गए। यह ऐसा है जैसे AI ने, लाखों और पन्ने पढ़ने के बाद, अंततः रसायन विज्ञान और जीव विज्ञान के सामान्य नियमों को इतनी अच्छी तरह से सीख लिया है कि वह उस दवा के परिणाम का अनुमान लगा सके जिसे उसने पहले कभी नहीं देखा था। हालाँकि, शोध पत्र एक छोटा सा मोड़ नोट करता है: मॉडल उन दवाओं और कैंसरों के परिणामों की भविष्यवाणी करने में बहुत बेहतर नहीं हुए जिन्हें वे पुराने, छोटे डेटासेट में पहले से देख चुके थे। वास्तव में, उन परिचित मामलों में उनका प्रदर्शन थोड़ा गिर गया। लेखक सुझाव देते हैं कि ऐसा इसलिए हो सकता है क्योंकि नया डेटा एक विशिष्ट प्रकार के प्रयोग (NCI60 अध्ययन से) के प्रभुत्व में है जो अन्य की तुलना में एक थोड़े अलग परीक्षण तरीके का उपयोग करता है। इसलिए, जबकि AI अज्ञात का अनुमान लगाने में मास्टर बन गया, वह परिचित मामलों के साथ थोड़ा कम आत्मविश्वासी हो गया। अंततः, यह कार्य बताता है कि AI को अधिक विविध डेटा खिलाना नए कैंसर उपचारों की खोज में मदद करने की कुंजी है, भले ही यह मॉडल को अज्ञात को संभालने में थोड़ा अधिक विशिष्ट बना दे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →