← नवीनतम पेपर
💻 bioinformatics

EMITS: expectation-maximization abundance estimation for fungal ITS communities from long-read sequencing

EMITS एक उच्च-प्रदर्शन वाला Rust-आधारित टूल है जो लॉन्ग-रीड सीक्वेंसिंग से फंगल ITS समुदायों में प्रजाति-स्तर के प्रचुरता अनुमान (abundance estimation) को सुधारने और अस्पष्ट रीड मैपिंग को हल करने के लिए एक्सपेक्टेशन-मैक्सिमाइजेशन एल्गोरिदम का उपयोग करता है, जो सटीकता और त्रुटि न्यूनीकरण में सरल काउंटिंग विधियों की तुलना में काफी बेहतर प्रदर्शन करता है।

मूल लेखक: O'Brien, A., Lagos, C., Fernandez, K., Ojeda, B., Parada, P.

प्रकाशित 2026-04-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: O'Brien, A., Lagos, C., Fernandez, K., Ojeda, B., Parada, P.

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ⚕️ यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जासूस हैं जो धुंधले, एक-दूसरे के ऊपर चढ़े हुए सुरक्षा कैमरा पदचिह्नों (footprints) के एक क्रम के आधार पर यह पता लगाने की कोशिश कर रहे हैं कि एक भीड़ वाले कमरे में कौन मौजूद था।

फंगल बायोलॉजी (कवक जीव विज्ञान) की दुनिया में, वैज्ञानिक मशरूम और मोल्ड्स की विभिन्न प्रजातियों की पहचान करने के लिए DNA में एक विशिष्ट "बारकोड" जिसे ITS कहा जाता है, का उपयोग करते हैं। हाल ही में, वैज्ञानिकों ने "लॉन्ग-रीड" (long-read) अनुक्रमकर्ताओं (जैसे Oxford Nanopore या PacBio) का उपयोग करना शुरू कर दिया है जो इस बारकोड को एक बार में पढ़ने में माहिर हैं। हालाँकि, एक समस्या है: कई कवक (fungi) लगभग जुड़वा भाइयों की तरह दिखते हैं। उनके DNA बारकोड इतने समान होते हैं कि कंप्यूटर भ्रमित हो जाता है।

पुराना तरीका: "सबसे अच्छा अनुमान" वाली गलती

पारंपरिक रूप से, जब कंप्यूटर एक धुंधला पदचिह्न देखता है, तो वह बस उपलब्ध सबसे अच्छे मिलान को चुन लेता है और कहता है, "यह निश्चित रूप से प्रजाति A है।"

यह एक जासूस की तरह है जो एक धुंधली फोटो को देखकर कहता है, "यह जॉन जैसा दिखता है, इसलिए यह जरूर जॉन ही होगा," भले ही जॉन का जुड़वा भाई माइक 99% उसके जैसा ही दिखता हो।

  • समस्या: यदि कंप्यूटर गलत है, तो वह भीड़ की गिनती गलत कर देता है। उसे लग सकता है कि वहां 100 जॉन हैं, जबकि वास्तव में वहां 50 जॉन और 50 माइक थे।
  • डेटाबेस का झमेला: इसके अलावा, संदर्भ लाइब्रेरी (UNITE) में एक ही प्रजाति के लिए कई प्रविष्टियाँ (entries) हैं (जैसे जॉन के पास 20 अलग-अलग आईडी कार्ड होना)। पुराना तरीका "जॉन" की गिनती को सभी 20 कार्डों में विभाजित कर देता है, जिससे ऐसा लगता है जैसे बहुत से अलग-अलग लोग मौजूद हैं, जबकि वास्तव में वह केवल एक ही व्यक्ति है।

नया समाधान: EMITS (द "ग्रुप थिंक" डिटेक्टिव)

इस शोध पत्र के लेखकों ने एक नया टूल बनाया है जिसे EMITS कहा जाता है। एक त्वरित निर्णय लेने के बजाय, EMITS एक स्मार्ट, पुनरावृत्ति प्रक्रिया (iterative process) का उपयोग करता है जिसे एक्सपेक्टेशन-मैक्सिमाइजेशन (EM) कहा जाता है।

EMITS को एक ऐसे जासूस के रूप में सोचें जो केवल एक संदिग्ध को नहीं चुनता। इसके बजाय, वे:

  1. एक अनुमान लगाते हैं: "ठीक है, मान लेते हैं कि 50% पदचिह्न जॉन के हैं और 50% माइक के।"
  2. सबूतों की जाँच करते हैं: वे पदचिह्नों को फिर से देखते हैं। "यदि यह 50/50 है, तो क्या यह धुंधला निशान जॉन या माइक में से किसी के अधिक करीब है?"
  3. अनुमान को समायोजित करते हैं: "वास्तव में, यह निशान थोड़ा जॉन जैसा दिखता है, इसलिए चलिए संभावनाओं को बदलकर 60% जॉन कर देते हैं।"
  4. दोहराते हैं: वे इसे बार-बार करते हैं, नंबरों को तब तक परिष्कृत करते हैं जब तक कि गणित सबसे संभावित सत्य पर स्थिर न हो जाए।

यह टूल यह कहने में सक्षम है कि, "हम इस विशिष्ट पदचिह्न पर 100% निश्चित नहीं हो सकते, लेकिन सांख्यिकीय रूप से, इसकी संभावना माइक की तुलना में जॉन होने की अधिक है," और यह दोनों के बीच "क्रेडिट" को निष्पक्ष रूप से वितरित करता है।

उन्होंने इसका परीक्षण कैसे किया

टीम ने तीन तरीकों से EMITS का परीक्षण किया:

  1. सिमुलेशन (Simulation): उन्होंने एक नकली डिजिटल भीड़ बनाई जहाँ वे जानते थे कि वहां वास्तव में कौन मौजूद था। उन्होंने डेटा में "शोर" (धुंधलापन) जोड़ा। पुराना तरीका भ्रमित हो गया और बड़ी गलतियाँ कीं, जबकि EMITS शांत और सटीक रहा, जिससे त्रुटियों में 92% तक की कमी आई।
  2. "मॉक" कम्युनिटी: उन्होंने 10 ज्ञात कवक (fungi) का एक वास्तविक जार लिया, उसका अनुक्रमण (sequencing) किया, और टूल्स को अनुमान लगाने दिया। EMITS ने कठिन समूहों (जैसे Trichophyton और Penicillium) में विशिष्ट प्रजातियों की सही पहचान की, जबकि पुराने तरीके ने उन्हें आपस में मिला दिया।
  3. सिंथेटिक भीड़: उन्होंने 21 प्रजातियों का एक जटिल मिश्रण बनाया। EMITS ने न केवल सही प्रजातियों को खोजा बल्कि कंप्यूटर को उन "भूतिया" (ghost) प्रजातियों को भी बनाने से रोका जो वहां मौजूद ही नहीं थीं (गलत सूचनाओं को 54% तक कम किया)।

यह क्यों महत्वपूर्ण है

  • यह तेज़ है: यह टूल Rust में लिखा गया है, जो एक प्रोग्रामिंग भाषा है जो अपनी अत्यधिक गति और दक्षता के लिए जानी जाती है।
  • यह स्मार्ट है: यह जानता है कि विभिन्न कैमरे (अनुक्रमकर्ता) अलग-अलग प्रकार के धुंधलेपन पैदा करते हैं, इसलिए इसके पास अपने जासूसी कार्य को समायोजित करने के लिए "प्रीसेट्स" (presets) हैं।
  • यह झमेले को साफ करता है: यह स्वचालित रूप से एक ही प्रजाति के लिए कई आईडी कार्डों को जोड़ देता है ताकि आपको डेटाबेस प्रविष्टियों के बजाय वास्तविक प्रजातियों की स्पष्ट गिनती मिल सके।

निचोड़ (The Bottom Line)

EMITS कवक DNA के लिए एक नया, सुपर-स्मार्ट कैलकुलेटर है। यह हमें एक जैसी दिखने वाली कवक प्रजातियों को गलत पहचानने और एक ही प्रजाति को दोबारा गिनने से रोकता है। "बेस्ट गेस" (सबसे अच्छे अनुमान) के बजाय "ग्रुप थिंक" (सामूहिक विचार) दृष्टिकोण का उपयोग करके, यह वैज्ञानिकों को कवक जगत की बहुत स्पष्ट और अधिक सटीक तस्वीर प्रदान करता है, जो चिकित्सा, कृषि और पारिस्थितिकी के लिए अत्यंत महत्वपूर्ण है।

यह ITSxRust नामक दूसरे टूल के साथ मिलकर सबसे अच्छा काम करता है, जो लॉन्ग-रीड सीक्वेंसिंग से कवक समुदायों का विश्लेषण करने के लिए एक पूर्ण, उच्च-गति पाइपलाइन बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →