← नवीनतम पेपर
🧬 biology

HiDAC: A Hierarchical Dictionary-Aided Compression Framework for Genomic Sequences

यह शोध पत्र HiDAC का प्रस्ताव करता है, जो एक पदानुक्रमित शब्दकोश-सहायता प्राप्त संपीड़न ढांचा (hierarchical dictionary-aided compression framework) है, जो प्रतिस्पर्धी DNA संपीड़न अनुपात प्राप्त करने के साथ-साथ पूर्ण डिकंप्रेशन के बिना सीधे संपीड़ित टोकनाइज्ड प्रतिनिधित्व पर सबस्ट्रिंग-फ्रीक्वेंसी क्वेरी जैसे डाउनस्ट्रीम विश्लेषणों को काफी तेज़ बनाने में सक्षम बनाता है।

मूल लेखक: Manthan Shah, Rahul Semwal, Imlimaong Aier, Prabhat Tripathi, Pritish Kumar Vardwaj

प्रकाशित 2026-09-25
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Manthan Shah, Rahul Semwal, Imlimaong Aier, Prabhat Tripathi, Pritish Kumar Vardwaj

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ⚕️ यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें

जीवन की कहानी केवल चार अक्षरों के एक कोड में लिखी गई है: A, C, G, और T। ये अक्षर, जो रासायनिक आधारों (chemical bases) का प्रतिनिधित्व करते हैं, एक जीवित जीव की प्रत्येक कोशिका को निर्देश देने वाले DNA बनाने के लिए लंबी कड़ियों में एक साथ जुड़ते हैं। दशकों से, वैज्ञानिक इन कड़ियों को पढ़ने में सक्षम रहे हैं, लेकिन आधुनिक अनुक्रमण (sequencing) मशीनों द्वारा उत्पन्न डेटा की विशाल मात्रा ने एक बड़ी लॉजिस्टिक समस्या खड़ी कर दी है। इन आनुवंशिक निर्देशों को रखने वाली फाइलें बहुत बड़ी हैं, जिससे उन्हें स्टोर करना कठिन, नेटवर्क पर भेजना धीमा और विश्लेषण करना बोझिल हो जाता है। हालांकि टेक्स्ट फाइलों को छोटा करने के लिए मानक कंप्यूटर उपकरण मौजूद हैं, लेकिन वे DNA में पाए जाने वाले अद्वितीय पैटर्न के लिए डिज़ाइन नहीं किए गए हैं, और अक्सर उन गहरे, दोहराव वाले संरचनाओं को पकड़ने में विफल रहते हैं जो एक जीनोम को परिभाषित करते हैं। शोधकर्ताओं ने इस डेटा को कंप्रेस करने के लिए विभिन्न विशेष तरीकों का प्रयास किया है, लेकिन इनमें से कई दृष्टिकोण केवल भंडारण (storage) के लिए बनाए गए हैं; डेटा के बारे में कोई प्रश्न पूछने के लिए, जैसे कि किसी विशिष्ट आनुवंशिक मार्कर को खोजना, पूरी फाइल को पहले अनकंप्रेस करना पड़ता है, जो समय और कंप्यूटिंग शक्ति को बर्बाद करता है।

शोधकर्ताओं के एक दल ने HiDAC नामक एक नया ढांचा विकसित किया है जिसका लक्ष्य भंडारण और विश्लेषण दोनों समस्याओं को एक साथ हल करना है। फाइल को केवल छोटा करने के बजाय, यह विधि इसे सहेजने से पहले एक अधिक कुशल भाषा में फिर से लिखती है। प्रक्रिया एक DNA अनुक्रम को उन पैटर्न को खोजने के लिए स्कैन करने से शुरू होती है जो बार-बार दोहराए जाते हैं, जैसे कि अक्षरों के छोटे अनुक्रम जो बार-बार दिखाई देते हैं। इसके बाद सिस्टम इन बार-बार आने वाले पैटर्न को एकल, अद्वितीय प्रतीकों (symbols) से बदल देता है, जिससे एक डिक्शनरी बनती है जो नए प्रतीकों को मूल अक्षरों से जोड़ती है। यह केवल एक बार का बदलाव नहीं है; सिस्टम एक पदानुक्रम (hierarchy) बनाता है, जहाँ एक नया प्रतीक स्वयं एक बड़े पैटर्न का हिस्सा बन सकता है, जिससे यह विधि उन जटिल, नेस्टेड दोहरावों को पकड़ पाती है जिन्हें सरल उपकरण छोड़ देते हैं। एक बार जब अनुक्रम को इन प्रतीकों का उपयोग करके फिर से लिखा जाता है, तो सिस्टम एक परिष्कृत एन्कोडिंग तकनीक लागू करता है जो प्रतीकों को सबसे कम संभव स्थान में पैक करती है, ठीक वैसे ही जैसे कपड़ों को कसकर मोड़कर और हर खाली जगह को भरकर एक सूटकेस को पैक किया जाता है।

जो इस दृष्टिकोण को विशिष्ट बनाता है वह यह है कि पुनर्गठित, कंप्रेस किया गया संस्करण बिना पूरी तरह से अनपैक किए विश्लेषण के लिए उपयोगी रहता है। क्योंकि नए प्रतीक मूल अनुक्रम के टुकड़ों का प्रतिनिधित्व करते हैं, इसलिए एक कंप्यूटर पहले प्रतीकों को देखकर एक विशिष्ट पैटर्न खोज सकता है। यदि कोई प्रतीक खोजे जा रहे पैटर्न को बिल्कुल भी नहीं रख सकता, तो सिस्टम उसे पूरी तरह से छोड़ देता है, जिससे बहुत सारा समय बचता है। शोधकर्ताओं ने मानव, बैक्टीरिया और अन्य जीवों के जीनोम पर इस पद्धति का परीक्षण किया, और सामान्य-उद्देश्य वाले कंप्रेशन टूल और विशेष जीनोमिक सॉफ्टवेयर दोनों के साथ इसकी तुलना की। परिणामों ने दिखाया कि HiDAC ने अन्य तरीकों की तुलना में फाइलों के आकार को अधिक प्रभावी ढंग से कम किया, कुछ मामलों में लगभग 76 प्रतिशत की कमी हासिल की। इससे भी महत्वपूर्ण बात यह है कि जब टीम ने विशिष्ट आनुवंशिक अनुक्रमों को खोजने के लिए कंप्रेस किए गए डेटा का उपयोग किया, तो यह प्रक्रिया मूल, अनकंप्रेस डेटा की तुलना में लगभग तीन गुना तेज़ थी।

अध्ययन ने यह भी खुलासा किया कि सिस्टम द्वारा सीखे गए पैटर्न यादृच्छिक (random) नहीं थे। कंप्यूटर द्वारा बनाए गए सबसे सामान्य प्रतीक उन बहुत छोटे, दोहराव वाले अक्षर संयोजनों के अनुरूप थे जिन्हें कई अलग-अलग प्रजातियों में DNA के मौलिक निर्माण खंडों के रूप में जाना जाता है। यह सुझाव देता है कि यह विधि केवल मनमाने डेटा गुणों के बजाय वास्तविक जैविक संरचनाओं को पकड़ रही है। यह सिद्ध करके कि डेटा को कुशलतापूर्वक कंप्रेस किया जा सकता है और साथ ही अपने कंप्रेस रूप में खोजने योग्य भी रखा जा सकता है, यह कार्य आनुवंशिक जानकारी के बढ़ते प्रवाह को संभालने का एक नया तरीका प्रदान करता है। यह वैज्ञानिकों को बड़ी मात्रा में डेटा को कम स्थान में स्टोर करने की अनुमति देता है जबकि उस संग्रहीत डेटा पर सीधे जटिल प्रश्नों को चलाने की क्षमता बनाए रखता है, जिससे भारी, ऊर्जा-गहन कंप्यूटिंग संसाधनों की आवश्यकता के बिना आनुवंशिकी और चिकित्सा में खोजों को गति दी जा सकती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →