← नवीनतम पेपर
💻 bioinformatics

A strategy for ionic current analysis of nanopore protein readouts

यह शोध पत्र नैनोपोर प्रोटीन आयनिक करंट संकेतों के विश्लेषण के लिए एक एकीकृत कम्प्यूटेशनल रणनीति प्रस्तुत करता है जो चार्ज-आधारित बाइनरी वर्गीकरण में उच्च सटीकता प्राप्त करने और पेप्टाइड ट्रांसलोकेशन को मॉडल करने के लिए डिनोइजिंग (denoising), सेगमेंटेशन और मशीन लर्निंग तकनीकों को जोड़ता है, बावजूद इसके कि सभी 20 अमीनो एसिड के बीच अंतर करने में चुनौतियां मौजूद हैं।

मूल लेखक: Stein, A. J., Ghohabi Esfahani, N., Akeson, S., Kakhaki, P. D., Kontogiorgos-Heintz, D., Nivala, J., Jain, M.

प्रकाशित 2026-10-08
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Stein, A. J., Ghohabi Esfahani, N., Akeson, S., Kakhaki, P. D., Kontogiorgos-Heintz, D., Nivala, J., Jain, M.

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ⚕️ यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें

प्रोटीन जीवन के कार्यवाहक हैं, जो हमारे शरीर को सुचारू रूप से चलाने वाले अधिकांश कार्यों को करने का काम करते हैं। जबकि हमारा जेनेटिक कोड इन अणुओं के निर्माण के लिए एक ब्लूप्रिंट प्रदान करता है, अंतिम उत्पाद अक्सर निर्देशों की तुलना में अधिक जटिल होता है। प्रोटीन को बनाने के बाद रासायनिक रूप से बदला जा सकता है, उन्हें जटिल त्रि-आयामी आकारों में मोड़ा जा सकता है, या विभिन्न रूपों में अलग-अलग तरीकों से संयोजित किया जा सकता है ताकि विविध प्रकार के विशिष्ट रूप बनाए जा सकें। स्वास्थ्य और रोग को वास्तव में समझने के लिए, वैज्ञानिकों को केवल जेनेटिक डेटा से उनके अस्तित्व का अनुमान लगाने के बजाय, सीधे इन व्यक्तिगत प्रोटीन अणुओं को पढ़ने की आवश्यकता है। दशकों से, नैनोपोर सीक्वेंसिंग नामक एक तकनीक ने शोधकर्ताओं को एक सूक्ष्म छिद्र के माध्यम से गुजरते हुए देखकर डीएनए (DNA) और आरएनए (RNA) को उच्च सटीकता के साथ पढ़ने की अनुमति दी है। हालाँकि, इसी तकनीक को प्रोटीन पर लागू करना कहीं अधिक कठिन साबित हुआ है। डीएनए के चार-अक्षर वाले वर्णमाला के विपरीत, प्रोटीन बीस अलग-अलग निर्माण खंडों से बने होते हैं जिन्हें अमीनो एसिड कहा जाता है, जिनमें से प्रत्येक के अद्वितीय भौतिक गुण होते हैं। इसके अलावा, प्रोटीन अक्सर मुड़े हुए होते हैं और असमान विद्युत आवेश (इलेक्ट्रिकल चार्ज) वहन करते हैं, जिससे एक उलझा हुआ सिग्नल बनता है जिसे सुलझाना कठिन होता है।

शोधकर्ताओं की एक टीम ने अब एक नई कम्प्यूटेशनल रणनीति विकसित की है ताकि नैनोपोर से गुजरने वाले प्रोटीनों द्वारा उत्पन्न विद्युत संकेतों को समझा जा सके। उनका कार्य एक विशिष्ट विधि पर केंद्रित है जहाँ एक आणविक मोटर, जो एक छोटे इंजन की तरह कार्य करती है, प्रोटीन स्ट्रैंड को एक बार में एक कदम करके छिद्र के माध्यम से खींचती है। जैसे-जैसे प्रोटीन आगे बढ़ता है, यह बिजली के प्रवाह में इस तरह से व्यवधान डालता है जो इस बात पर निर्भर करता है कि वर्तमान में कौन से अमीनो एसिड छेद के भीतर हैं। चुनौती इस शोर भरे, उतार-चढ़ाव वाले करंट को डिकोड करने में निहित है ताकि अमीनो एसिड के अनुक्रम (सीक्वेंस) की पहचान की जा सके। शोधकर्ताओं ने कच्चे डेटा (रॉ डेटा) को साफ करने, इसे सार्थक हिस्सों में तोड़ने और फिर कंप्यूटर मॉडल का उपयोग करके उन विशिष्ट अमीनो एसिड की पहचान करने के लिए एक पाइपलाइन बनाई है जो सिग्नल के लिए जिम्मेदार हैं। उन्होंने पाया कि हालांकि हर एक अमीनो एसिड को अलग पहचानना एक कठिन कार्य बना हुआ है, लेकिन यह विधि विद्युत आवेश के आधार पर अमीनो एसिड के समूहों के बीच अंतर करने में अत्यधिक प्रभावी है।

अध्ययन की शुरुआत सिंथेटिक प्रोटीन स्ट्रैंड्स के एक सेट के साथ हुई जिन्हें विशेष रूप से इस तकनीक का परीक्षण करने के लिए डिज़ाइन किया गया था। इन स्ट्रैंड्स को दोहराव वाले खंडों के साथ इंजीनियर किया गया था, जिनमें से प्रत्येक में एक केंद्र में एक अद्वितीय अमीनो एसिड होता है, जो मार्करों द्वारा अलग किया जाता है जो विद्युत सिग्नल में एक विशिष्ट गिरावट पैदा करते हैं। इस डिज़ाइन ने शोधकर्ताओं को व्यक्तिगत अमीनो एसिड द्वारा उत्पन्न सिग्नल को अलग करने की अनुमति दी। सबसे पहले, उन्हें कच्चे विद्युत डेटा को साफ करना था, जो यादृच्छिक शोर (रैंडम नॉइज़) से भरा था जो वास्तविक जैविक सिग्नल को छिपा सकता था। उन्होंने इन आर्टिफैक्ट्स को हटाने के लिए एक बहु-चरणीय प्रक्रिया का उपयोग किया, जबकि उन तीक्ष्ण परिवर्तनों को सुरक्षित रखा जो प्रोटीन की गति को चिह्नित करते हैं। एक बार डेटा साफ हो जाने के बाद, उन्हें यह पता लगाना था कि एक अमीनो एसिड का सिग्नल कहाँ समाप्त होता है और अगले का कहाँ शुरू होता है। उन्होंने इन सीमाओं को खोजने के लिए दो अलग-अलग गणितीय दृष्टिकोणों का परीक्षण किया। एक विधि ने सिग्नल में होने वाले परिवर्तनों का स्वचालित रूप से पता लगाया, जबकि दूसरी ने डेटा को निरंतरता सुनिश्चित करने के लिए निश्चित संख्या में खंडों में विभाजित किया। दोनों विधियों ने विश्वसनीय परिणाम दिए, प्रोटीन की यात्रा को लगभग पैंतीस विशिष्ट चरणों में विभाजित किया, जो प्रोटीन को खींचने वाली आणविक मोटर की ज्ञात गति के अनुरूप है।

सिग्नल्स को विभाजित करने के बाद, शोधकर्ता पहचान के कार्य की ओर बढ़े। उन्होंने विद्युत पैटर्न का विश्लेषण करने के लिए दो अलग-अलग प्रकार के कंप्यूटर लर्निंग मॉडल्स का उपयोग किया। पहले दृष्टिकोण में एक डीप लर्निंग नेटवर्क को प्रशिक्षित करना शामिल था ताकि प्रत्येक खंड के भीतर सांख्यिकीय विशेषताओं, जैसे औसत करंट, उतार-चढ़ाव की सीमा और सिग्नल कर्व के आकार को पहचाना जा सके। जब एक साथ बीस अमीनो एसिड की पहचान करने के लिए कहा गया, तो मॉडल संघर्ष कर रहा था, और इसकी सटीकता लगभग इक्कीस प्रतिशत ही रही। यह परिणाम बताता है कि जब सभी बीस अमीनो एसिड एक-दूसरे के विरुद्ध प्रतिस्पर्धा कर रहे हों, तो कई अमीनो एसिड के विद्युत हस्ताक्षर इतने समान होते हैं कि उन्हें अलग करना मुश्किल होता है। हालाँकि, जब मॉडल को एक समय में केवल दो अमीनो एसिड के बीच चयन करने के लिए कहा गया, तो इसने बहुत बेहतर प्रदर्शन किया। इन आमने-सामने की तुलनाओं में, औसत सटीकता बढ़कर लगभग पचहत्तर प्रतिशत हो गई। कुछ अमीनो एसिड, विशेष रूप से वे जिनमें नकारात्मक विद्युत आवेश होता है, स्पष्ट रूप से उभर कर आए, जबकि अन्य जिनके भौतिक गुण, जैसे आकार या आवेश की कमी, समान थे, अक्सर एक-दूसरे के साथ भ्रमित कर दिए गए।

दूसरे दृष्टिकोण ने एक अलग प्रकार के मॉडल का उपयोग किया जो प्रोटीन की गति को चरणों के एक अनुक्रम के रूप में मानता है, ठीक वैसे ही जैसे एक छिपा हुआ नक्शा जिसे कंप्यूटर ट्रैक करने की कोशिश करता है। यह मॉडल प्रोटीन की यात्रा के समग्र पैटर्न को पकड़ने में विशेष रूप से अच्छा था, जिसमें वे क्षण भी शामिल थे जहाँ मोटर पीछे की ओर फिसल सकती है या रुक सकती है। डीप लर्निंग मॉडल की तरह, यह दृष्टिकोण बाइनरी टेस्ट में सकारात्मक और नकारात्मक रूप से आवेशित अमीनो एसिड के बीच अंतर करने में उत्कृष्ट रहा, जिसने नब्बे प्रतिशत से अधिक की सटीकता हासिल की। इसने आकार के आधार पर अमीनो एसिड को अलग करने में भी अच्छा प्रदर्शन किया, हालांकि मध्यम आकार के समूहों के साथ इसे संघर्ष करना पड़ा। शोधकर्ताओं ने पाया कि प्रोटीनों को पढ़ने का सबसे विश्वसनीय तरीका हर एक अक्षर को नाम देना नहीं था, बल्कि उन्हें उनके सबसे स्पष्ट भौतिक गुणों के आधार पर समूहबद्ध करना था। अमीनो एसिड का विद्युत आवेश सबसे मजबूत सिग्नल साबित हुआ, जिसने एक विशिष्ट फिंगरप्रिंट बनाया जिसे कंप्यूटर उच्च विश्वास के साथ पहचान सकता था।

अध्ययन इस निष्कर्ष पर पहुँचता है कि हालांकि शून्य से एक पूर्ण प्रोटीन अनुक्रम को पढ़ना अभी तक एक हल की गई समस्या नहीं है, लेकिन यह तकनीक लक्षित अनुप्रयोगों के लिए तैयार है। आवेशित और बिना आवेश वाले क्षेत्रों के बीच विश्वसनीय रूप से अंतर करने की क्षमता, या उन विशिष्ट उत्परिवर्तनों (म्यूटेशन) की पहचान करने की क्षमता जो प्रोटीन के आवेश को बदलते हैं, एक व्यावहारिक मार्ग प्रदान करती है। शोधकर्ताओं का सुझाव है कि भविष्य के सुधार बड़े डेटासेट का उपयोग करने और ऐसे प्रोटीन स्ट्रैंड्स डिजाइन करने से आएंगे जो अमीनो एसिड को अधिक विविध संदर्भों में प्रदर्शित करते हैं। फिलहाल, यह कार्य प्रोटीनों के नैनोपोर के साथ होने वाले इंटरैक्शन को समझने के लिए एक ठोस आधार प्रदान करता है। यह प्रदर्शित करता है कि जटिल, शोर वाले डेटा के साथ भी, सावधानीपूर्वक सिग्नल प्रोसेसिंग और स्मार्ट कम्प्यूटेशनल मॉडल्स को जोड़कर सार्थक जैविक जानकारी निकाली जा सकती है। पूर्ण प्रोटीन सीक्वेंसिंग का मार्ग लंबा है, लेकिन यह रणनीति प्रोटिओम के विद्युत परिदृश्य को नेविगेट करने के लिए एक स्पष्ट, चरण-दर-चरण विधि प्रदान करती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →