← नवीनतम पेपर
💻 bioinformatics

DNA-MGC+: A versatile codec for reliable and resource-efficient data storage on synthetic DNA

यह शोध पत्र DNA-MGC+ को प्रस्तुत करता है, जो एक बहुमुखी कोडेक है जो उच्च त्रुटि दरों और कम अनुक्रमण गहराई (sequencing depth) के बावजूद, विविध अनुक्रमण प्लेटफार्मों पर सिंथेटिक डीएनए से विश्वसनीय और संसाधन-कुशल डेटा पुनर्प्राप्ति को सक्षम करके मौजूदा समाधानों से काफी बेहतर प्रदर्शन करता है।

मूल लेखक: Khabbaz, R., Mateos, J., Antonini, M., Kas Hanna, S.

प्रकाशित 2026-03-13
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Khabbaz, R., Mateos, J., Antonini, M., Kas Hanna, S.

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ⚕️ यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप अपने जीवन भर की सभी फोटो, वीडियो और दस्तावेज़ों को रेत के एक अकेले कण में स्टोर करना चाहते हैं। यह DNA डेटा स्टोरेज का वादा है। अपने फोन में इस्तेमाल होने वाले सिलिकॉन चिप्स के बजाय, हम डेटा को DNA के चार रासायनिक अक्षरों में लिखते हैं: A, C, G, और T। यह अविश्वसनीय रूप से सघन (dense) है और हजारों वर्षों तक रह सकता है।

लेकिन एक समस्या है: DNA बहुत अव्यवस्थित (messy) है।

इसे लिखना (synthesis), इसकी नकल करना (amplification), और इसे पढ़ना (sequencing) ऐसा है जैसे किसी ऐसे व्यक्ति द्वारा हाथ से लिखे पत्र की नकल करने की कोशिश करना जो मेज को हिला रहा हो, कागज पर छींक रहा हो, या बीच-बीच में शब्द फाड़ रहा हो। अंत में आपको गायब अक्षर, अतिरिक्त अक्षर, या बदले हुए अक्षर मिलेंगे। यदि आप फाइल को वापस पढ़ने की कोशिश करेंगे, तो वह अर्थहीन (gibberish) हो सकती है।

यहाँ आता है DNA-MGC+, जो इस पेपर में पेश किया गया एक नया "सुपर-हीरो" टूल है। इसे एक स्मार्ट, जादुई अनुवादक (translator) के रूप में समझें जो आपके संदेश को फिर से बना सकता है, भले ही DNA की कॉपी एक आपदा जैसी क्यों न हो।

यह कैसे काम करता है, इसे सरल अवधारणाओं में नीचे दिया गया है:

1. समस्या: "शोर भरी फोन कॉल" (The Noisy Phone Call)

कल्पना कीजिए कि आप एक बहुत ही खराब फोन कनेक्शन के माध्यम से अपने दोस्त को एक रहस्य बता रहे हैं।

  • Substitutions (प्रतिस्थापन): आपने "Cat" कहा, उसने "Bat" सुना।
  • Insertions (सम्मिलन): आपने "Cat" कहा, उसने "C-a-t-t" सुना।
  • Deletions (लोप): आपने "Cat" कहा, उसने "Ca" सुना।
  • Dropouts (ड्रॉपआउट): लाइन पूरी तरह कट गई, और उसने पूरा वाक्य ही मिस कर दिया।

पुराने तरीकों ने इसे ठीक करने के लिए "हाई-फिडेलिटी" उपकरणों (महंगी, धीमी, सटीक मशीनें) का उपयोग करने की कोशिश की। लेकिन यह एक पत्र की नकल करने के लिए 100 पेशेवर लिपियों (scribes) की टीम को काम पर रखने जैसा है। इंटरनेट को स्टोर करने के लिए यह बहुत धीमा और महंगा है।

DNA-MGC+ कहता है: "आइए सस्ती, तेज़, अव्यवस्थित मशीनों का उपयोग करें, लेकिन संदेश को इस तरह लिखें कि वह शोर (noise) के बीच भी जीवित रह सके।"

2. समाधान: एक दो-परतीय सुरक्षा जाल (A Two-Layer Safety Net)

DNA-MGC+ एक चतुर दो-चरणीय रणनीति का उपयोग करता है, जैसे कि एक झटकों वाली ट्रक यात्रा के लिए एक नाजुक फूलदान को पैक करना।

लेयर 1: आंतरिक कोड (द "श्रिंक रैप")

फूलदान को पैक करने से पहले, आप उसे बबल रैप से लपेटते हैं।

  • यह कैसे काम करता है: सिस्टम आपकी फाइल को छोटे-छोटे टुकड़ों में तोड़ देता है। हर टुकड़े के लिए, यह एक विशेष "चेकसम" (एक गुप्त कोड की तरह) जोड़ता है जो यह पहचानने में मदद करता है कि क्या उस विशिष्ट टुकड़े के भीतर अक्षर बदले गए, जोड़े गए या हटाए गए हैं।
  • जादू: भले ही DNA मशीन उस टुकड़े के भीतर अक्षरों का क्रम बिगाड़ दे, यह लेयर मूल क्रम का अनुमान लगा सकती है और उसे ठीक कर सकती है। यह एक पहेली के टुकड़े की तरह है जो जानता है कि उसे कहाँ फिट होना है, भले ही तस्वीर धुंधली हो।

लेयर 2: बाहरी कोड (द "बैकअप कॉपियां")

अब, कल्पना कीजिए कि आपके पास उस लिपटे हुए फूलदान की 100 कॉपियां हैं।

  • यह कैसे काम करता है: सिस्टम अतिरिक्त "रिडंडेंट" (redundant) टुकड़े बनाता है। यदि ट्रक दुर्घटनाग्रस्त हो जाता है और 30% फूलदान पूरी तरह से खो जाते हैं (एक "ड्रॉपआउट"), तो बाहरी कोड शेष 70% से उन लापता टुकड़ों को गणितीय रूप से पुनर्गठित कर सकता है।
  • जादू: इससे कोई फर्क नहीं पड़ता कि आप कुछ टुकड़ों को पूरी तरह से खो देते हैं; जब तक आपके पास अन्य टुकड़ों का पर्याप्त हिस्सा है, पूरी फाइल वापस आ जाएगी।

3. "फिल्टरिंग" का तरीका: सबसे अच्छे फूलदान चुनना

कभी-कभी, DNA अणु स्वयं "अभागे" (unlucky) होते हैं (वे रासायनिक रूप से अस्थिर होते हैं या उन्हें पढ़ना कठिन होता है)।

  • रणनीति: DNA-MGC+ वास्तव में जितनी आवश्यकता है, उससे कहीं अधिक "उम्मीदवार अनुक्रम" (candidate sequences) उत्पन्न कर सकता है। इसके बाद यह एक सख्त लाइब्रेरियन की तरह कार्य करता है, और किसी भी ऐसे अनुक्रम को फेंक देता है जो "जोखिम भरा" दिखता है (जैसे कि जिसमें बहुत अधिक दोहराए गए अक्षर हों या जो अजीब तरह से मुड़ जाता हो)।
  • परिणाम: यह केवल "सबसे अच्छे व्यवहार वाले" DNA अणुओं का ही संश्लेषण करता है, जिससे पढ़ने की प्रक्रिया और भी आसान हो जाती है।

4. यह पेपर क्यों महत्वपूर्ण है

शोधकर्ताओं ने इस नए कोडेक का परीक्षण दो तरीकों से किया:

  1. कंप्यूटर सिमुलेशन: उन्होंने लाखों "बुरे DNA दिनों" (उच्च त्रुटि दर, लापता डेटा) का अनुकरण किया। DNA-MGC+ 24% तक की त्रुटि दर (जो कि अविश्वसनीय है—अधिकांश अन्य उपकरण 5-10% पर हार मान लेते हैं) में भी जीवित रहा।
  2. वास्तविक लैब प्रयोग: उन्होंने वास्तव में डेटा को DNA में लिखा, उसे स्टोर किया, और दो अलग-अलग तकनीकों का उपयोग करके उसे वापस पढ़ा:
    • Illumina: एक मानक, उच्च-गुणवत्ता वाला स्कैनर।
    • Nanopore: एक सस्ता, तेज़, लेकिन बहुत अधिक "शोर वाला" स्कैनर (जैसे हवा के तूफान में किताब पढ़ने जैसा)।

परिणाम:

  • सस्ता: फाइल को वापस पढ़ने के लिए आपको DNA की कम कॉपियों की आवश्यकता होती है (पैसे बचाते हैं)।
  • तेज़: यह पिछले तरीकों की तुलना में बहुत तेज़ी से डेटा डिकोड करता है।
  • अधिक सघन (Denser): आप DNA के एक ग्राम में अधिक डेटा पैक कर सकते हैं (सैद्धांतिक रूप से 57 Exabytes प्रति ग्राम तक—जो कि अरबों हार्ड ड्राइव के बराबर है!)।
  • बहुमुखी: यह महंगे, शांत स्कैनर और सस्ते, शोर वाले स्कैनर दोनों पर बहुत अच्छा काम करता है।

निचोड़ (The Bottom Line)

इससे पहले, DNA में डेटा स्टोर करना एक संदेशवाहक कबूतर के माध्यम से संदेश भेजने जैसा था जिसे शायद खो दिया जाए, जिसके पंख काट दिए जाएं, या जो हवा से भ्रमित हो जाए। इसे सफल बनाने के लिए आपको एक बहुत ही महंगे, पूर्ण कबूतर की आवश्यकता थी।

DNA-MGC+ उस कबूतर को एक GPS ट्रैकर, एक बैकअप मैप और दोस्तों की एक ऐसी टीम देने जैसा है जो संदेश को फिर से बना सके यदि कबूतर खो जाए। यह DNA स्टोरेज को इतना विश्वसनीय बनाता है कि यह व्यावहारिक हो सके और इतना सस्ता बनाता है कि इसे बड़े पैमाने पर लागू किया जा सके, जो हमें तरल की एक बूंद में दुनिया का सारा डेटा स्टोर करने के एक कदम करीब ले आता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →