← नवीनतम पेपर
🧬 biology

FUSION: a multimodal graph-based structural AI framework for interpretable somatic cancer driver mutation prediction

यह शोध पत्र FUSION को पेश करता है, जो एक मल्टीमॉडल ग्राफ-आधारित AI फ्रेमवर्क है जो प्रोटीन लैंग्वेज मॉडल एम्बेडिंग्स, अल्फाफोल्ड2-व्युत्पन्न संरचनात्मक टोपोलॉजी और कन्फर्मेशनल एन्सेम्बल्स को एकीकृत करता है ताकि विशेष रूप से पूर्व नैदानिक साक्ष्य की कमी वाले दुर्लभ मिसेंस वेरिएंट्स के लिए दैहिक कैंसर ड्राइवर म्यूटेशन (somatic cancer driver mutations) की सटीक भविष्यवाणी और व्याख्या की जा सके।

मूल लेखक: Lucas Moraes dos Santos, Tatiane Senna Bialves, Luana Luiza Bastos, José Gutembergue de Mendonça Silva, Sheila Cruz Araujo, Janaina de Oliveira Melo, Adriano de Paula Sabino, Eduardo Tarazona-Santos
प्रकाशित 2026-08-31
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Lucas Moraes dos Santos, Tatiane Senna Bialves, Luana Luiza Bastos, José Gutembergue de Mendonça Silva, Sheila Cruz Araujo, Janaina de Oliveira Melo, Adriano de Paula Sabino, Eduardo Tarazona-Santos, Leonardo Henrique França de Lima, Gerd Bruno da Rocha, Eduardo Moraes Reis, Wagner Meira Junior, Raquel Cardoso de Melo-Minardi

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ⚕️ यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें

कैंसर तब शुरू होता है जब शरीर की कोशिकाएं अनियंत्रित रूप से बढ़ने लगती हैं, जो अक्सर उनके जेनेटिक कोड में होने वाली सूक्ष्म त्रुटियों के कारण होता है। ये त्रुटियां, जिन्हें म्यूटेशन (उत्परिवर्तन) कहा जाता है, एक कार के अटके हुए एक्सीलेटर की तरह काम कर सकती हैं, जो कोशिका को तब विभाजित होने के लिए मजबूर करती हैं जब उसे आराम करना चाहिए। वैज्ञानिक इन खतरनाक म्यूटेशन को, जो इस प्रक्रिया को संचालित करते हैं, "ड्राइवर" कहते हैं, जबकि वे हानिरहित मطेशन जो बस साथ चलते हैं, उन्हें "पैसेंजर" कहा जाता है। दशकों तक, ड्राइवरों को खोजना जेनेटिक डेटा के विशाल ढेर में कुछ विशिष्ट सुइयों को खोजने जैसा रहा है। चुनौती यह है कि कई ड्राइवर दुर्लभ होते हैं; वे केवल कुछ ही रोगियों में या प्रोटीन के विशिष्ट हिस्सों में दिखाई देते हैं, जिससे उन्हें उन मानक उपकरणों के साथ पहचानना कठिन हो जाता है जो एक ही गलती को बार-बार देखने पर निर्भर करते हैं। इसके अलावा, कोई म्यूटेशन कैंसर का कारण क्यों बनता है, इसे समझने के लिए अक्सर डीएनए के अक्षरों के अनुक्रम के बजाय, प्रभावित प्रोटीन के त्रि-आयामी आकार को देखना आवश्यक होता है।

शोधकर्ताओं की एक टीम ने इस समस्या को हल करने के लिए FUSION नामक एक नया आर्टिफिशियल इंटेलिजेंस सिस्टम विकसित किया है। अलग-अलग म्यूटेशन को देखने के बजाय, यह सिस्टम एक विस्तृत मानचित्र बनाता है कि एक प्रोटीन कैसे बना है और वह कैसे हिलता-डुलता है। यह प्रोटीन के रासायनिक अनुक्रम, उसके मुड़े हुए आकार और उसकी संरचनात्मक लचीलेपन की जानकारी को एक एकल, एकीकृत मॉडल में जोड़ता है। हजारों उदाहरणों पर प्रशिक्षण प्राप्त करके, यह प्रणाली उन सूक्ष्म संरचनात्मक संकेतों को पहचानने में सक्षम होती है जो कैंसर पैदा करने वाले 'ड्राइवर' को एक हानिरहित 'पैसेंजर' से अलग करते हैं। परिणाम दर्शाते हैं कि यह दृष्टिकोण उन खतरनाक म्यूटेशन की पहचान कर सकता है जिन्हें अन्य तरीके छोड़ देते हैं, जिनमें वे दुर्लभ वेरिएंट भी शामिल हैं जो सामान्य "हॉटस्पॉट्स" में नहीं दिखाई देते जहाँ कैंसर सबसे अधिक पाया जाता है। यह क्षमता यह तय करने का एक नया तरीका प्रदान करती है कि किन जेनेटिक त्रुटियों पर आगे अध्ययन किया जाना चाहिए, जिससे डॉक्टरों को रोगी के ट्यूमर की अनूठी जीव विज्ञान को समझने में मदद मिल सकती है।

शोधकर्ताओं ने मानव प्रोटीन की जटिलता को संभालने के लिए FUSION का निर्माण किया है, जो अमीनो एसिड की लंबी श्रृंखलाएं हैं जो जटिल त्रि-आयामी आकारों में मुड़ती हैं। ऐसा करने के लिए, उन्होंने सिस्टम को तीन अलग-अलग प्रकार की जानकारी दी। पहला, यह प्रत्येक अमीनो एसिड के रासायनिक संदर्भ को समझने के लिए लाखों प्रोटीन अनुक्रमों पर प्रशिक्षित एक लैंग्वेज मॉडल का उपयोग करता है। दूसरा, यह प्रोटीन के भौतिक आकार को शामिल करता है, जिसे एक शक्तिशाली स्ट्रक्चर-प्रेडिक्शन टूल द्वारा उत्पन्न किया जाता है जो एक आणविक वास्तुकार (molecular architect) की तरह कार्य करता है। तीसरा, इसमें स्थानीय वातावरण का विवरण शामिल है, जैसे कि प्रोटीन का एक विशिष्ट हिस्सा एक कठोर हेलिक्स (helix) है या एक लचीला लूप (loop)। सिस्टम इन सभी टुकड़ों को एक नेटवर्क में जोड़ता है, जहाँ प्रत्येक अमीनो एसिड एक 'नोड' है और उनके बीच की भौतिक दूरियां 'लिंक' हैं। यह AI को यह देखने की अनुमति देता है कि एक स्थान पर होने वाला परिवर्तन पूरे ढांचे में कैसे प्रभाव डाल सकता है।

इस कार्य में एक प्रमुख नवाचार यह है कि सिस्टम इस तथ्य को कैसे संभालता है कि प्रोटीन स्थिर मूर्तियां नहीं हैं; वे हिलते-डुलते और बदलते रहते हैं। इस गति को पकड़ने के लिए, शोधकर्ताओं ने प्रत्येक प्रोटीन संरचना के हजारों थोड़े अलग संस्करण बनाने के लिए एक जनरेटिव तकनीक का उपयोग किया, जो अणु की प्राकृतिक लचीलेपन का अनुकरण करता है। उन्होंने इन विविधताओं का उपयोग AI को यह सिखाने के लिए किया कि प्रोटीन गति में कैसा दिखता है, न कि केवल एक स्थिर मुद्रा में। हालांकि, जब सिस्टम किसी नए रोगी के लिए अंतिम भविष्यवाणी करता है, तो उसे केवल एक ही सबसे संभावित संरचना की आवश्यकता होती है। कई गतिशील हिस्सों पर प्रशिक्षण केवल मॉडल को यह सीखने में मदद करता है कि प्रोटीन व्यवहार के अंतर्निहित नियम क्या हैं, जिससे यह नए, अनदेखे म्यूटेशन के मामले में अधिक मजबूत बन जाता है।

टीम ने दो प्रमुख चुनौतियों पर FUSION का परीक्षण किया। सबसे पहले, उन्होंने एक बड़े संग्रह के विरुद्ध इसका मूल्यांकन किया जिसमें प्रयोगशाला में प्रयोगिक रूप से सत्यापित म्यूटेशन थे कि क्या वे कैंसर का कारण बनते हैं। इन परीक्षणों में, सिस्टम ने उच्च सटीकता के साथ ड्राइवर म्यूटेशन की सही पहचान की, और मौजूदा तरीकों से बेहतर प्रदर्शन किया। यह उन दुर्लभ वेरिएंट्स को पकड़ने में विशेष रूप से अच्छा था जो बड़े डेटासेट में केवल एक या दो बार दिखाई देते हैं, जिन्हें अक्सर उन टूल्स द्वारा अनदेखा कर दिया जाता है जो आवृत्ति (frequency) पर निर्भर करते हैं। उदाहरण के लिए, सिस्टम ने POT1 नामक जीन में एक दुर्लभ म्यूटेशन को ड्राइवर के रूप में सही पहचाना, जो जैविक साक्ष्यों के अनुरूप था कि इसकी भूमिका डीएनए की रक्षा करने में है, भले ही यह म्यूटेशन इतना दुर्लभ था कि अन्य तरीके इसे चिह्नित नहीं कर सके।

शोधकर्ताओं ने विशेष रूप से पैन्क्रियाटिक डक्टल एडेनोकार्सिनोमा (pancreatic ductal adenocarcinoma), जो अग्नाशय के कैंसर का एक घातक रूप है, के लिए FUSION को लागू किया। इस संदर्भ में, सिस्टम ने और भी उच्च स्तर की सटीकता प्राप्त की, जिसने अधिकांश मामलों में ड्राइवरों और पैसेंजर्स के बीच सफलतापूर्वक अंतर किया। इसने KRAS और TP53 जैसे जीन में ज्ञात ड्राइवरों की सफलतापूर्वक पहचान की, लेकिन इसने अन्य जीन में दुर्लभ म्यूटेशन को भी उजागर किया जो पहले इस बीमारी से नहीं जुड़े थे। एक उल्लेखनीय खोज SASH1 नामक जीन में एक म्यूटेशन थी। यह म्यूटेशन प्रोटीन के एक लचीले, अव्यवस्थित क्षेत्र में स्थित था, जो सामान्य हॉटस्पॉट्स से बहुत दूर है जहाँ कैंसर के म्यूटेशन अक्सर पाए जाते हैं। सिस्टम ने इसे एक संभावित ड्राइवर के रूप में चिह्नित किया, और आगे के विश्लेषण से पता चला कि यह प्रोटीन की ट्यूमर वृद्धि को रोकने की क्षमता को बाधित कर सकता है, जो पैन्क्रियाटिक कैंसर में जांच का एक नया मार्ग खोलता है।

केवल भविष्यवाणियां करने के अलावा, यह सिस्टम यह देखने का एक तरीका भी प्रदान करता है कि इसने वे चुनाव क्यों किए। शोधकर्ताओं ने मॉडल के आंतरिक "अटेंशन" (attention) की जांच की, जो यह दिखाता है कि निर्णय लेते समय सिस्टम ने प्रोटीन के किन हिस्सों पर ध्यान केंद्रित किया। KRAS प्रोटीन में एक सामान्य म्यूटेशन के लिए, सिस्टम ने उन विशिष्ट क्षेत्रों पर गहरा ध्यान दिया जो प्रोटीन के कार्य के लिए महत्वपूर्ण माने जाते हैं, जिसमें वे क्षेत्र भी शामिल हैं जो कोशिका वृद्धि को नियंत्रित करने के लिए अन्य अणुओं के साथ परस्पर क्रिया करते हैं। इसने म्यूटेशन साइट के पास एक क्षणिक पॉकेट (transient pocket) को भी उजागर किया, जो एक संरचनात्मक विशेषता है जो हाल ही में नए कैंसर ड्रग्स के लक्ष्य के रूप में उभरी है। यह क्षमता कि सिस्टम जैविक रूप से सार्थक क्षेत्रों की ओर संकेत कर सकता है, यह सुझाव देती है कि सिस्टम केवल डेटा के पैटर्न के आधार पर अनुमान नहीं लगा रहा है, बल्कि वास्तव में उन भौतिक नियमों को सीख रहा है जो प्रोटीनों के काम करने के तरीके को नियंत्रित करते हैं।

यह अध्ययन प्रदर्शित करता है कि विभिन्न प्रकार की आणविक जानकारी को एक एकल ग्राफ-आधारित मॉडल में संयोजित करना कैंसर ड्राइवरों का पता लगाने में महत्वपूर्ण सुधार कर सकता है। म्यूटेशन की सरल सूचियों से आगे बढ़कर और प्रोटीन को एक गतिशील, परस्पर जुड़े ढांचे के रूप में मॉडल करके, FUSION यह समझने का एक पूर्ण चित्र प्रदान करता है कि जेनेटिक त्रुटियां रोग का कारण कैसे बनती हैं। हालांकि यह सिस्टम अपने आप में कोई इलाज नहीं है, लेकिन यह आधुनिक सीक्वेंसिंग द्वारा उत्पन्न भारी मात्रा में जेनेटिक डेटा को छांटने के लिए एक शक्तिशाली उपकरण के रूप में कार्य करता है। यह शोधकर्ताओं और चिकित्सकों को उन म्यूटेशन पर ध्यान केंद्रित करने में मदद करता है जिनके कैंसर को संचालित करने की सबसे अधिक संभावना है, जिससे लक्षित उपचारों (targeted therapies) और रोग की गहरी समझ का मार्ग प्रशस्त होता है। यह कार्य सुझाव देता है कि प्रिसिजन ऑन्कोलॉजी (precision oncology) का भविष्य उन उपकरणों में निहित है जो जीवन की जटिल, त्रि-आयामी भाषा की व्याख्या कर सकें, और कच्चे जेनेटिक डेटा को कार्रवाई योग्य जैविक अंतर्दृष्टि में बदल सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →