← नवीनतम पेपर
🧬 biology

LDARNet: DNA Adaptive Representation Network with Learnable Tokenization for Genomic Modeling

LDARNet एक 120M-पैरामीटर वाला पदानुक्रमित जीनोमिक फाउंडेशन मॉडल है जो डायनेमिक चंकिंग और लर्नड रूटिंग के माध्यम से अनसुपरवाइज्ड, लर्नबल टोकनाइजेशन पेश करता है, जो प्रमोटर मोटिफ्स और स्प्लिस जंक्शनों जैसी जैविक रूप से प्रासंगिक संरचनाओं के साथ एडेप्टिव सीक्वेंस बाउंड्रीज़ को संरेखित करके हिस्टोन मॉडिफिकेशन कार्यों पर अत्याधुनिक प्रदर्शन प्राप्त करता है और 20 गुना बड़े मॉडलों से बेहतर प्रदर्शन करता है।

मूल लेखक: Daria Ledneva, Denis Kuznetsov

प्रकाशित 2026-06-04
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Daria Ledneva, Denis Kuznetsov

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ⚕️ यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक कंप्यूटर को जीवन की भाषा, यानी DNA, समझना सिखाने की कोशिश कर रहे हैं। DNA अक्षरों (A, C, G, T) की एक लंबी श्रृंखला है जो कोशिकाओं को यह बताती है कि एक जीवित जीव का निर्माण और संचालन कैसे करना है।

लंबे समय तक, कंप्यूटरों ने इस "भाषा" को पढ़ने के लिए DNA को निश्चित आकार के टुकड़ों में काटने की कोशिश की है, जैसे कि एक लंबे वाक्य को हर बार तीन अक्षरों के सटीक समूहों में काट देना, चाहे उन अक्षरों का अर्थ कुछ भी हो। यह एक किताब को हर 10 इंच की पट्टियों में काटने जैसा है, भले ही कोई वाक्य पट्टी के बीच में ही समाप्त हो जाए। यह काम तो करता है, लेकिन यह अव्यवस्थित है और कहानी की प्राकृतिक संरचना को छोड़ देता है।

LDARNet से मिलिए: स्मार्ट रीडर

यह शोध पत्र LDARNet नामक एक नया AI मॉडल पेश करता है। DNA को काटने के लिए एक कठोर रूलर (पैमाने) का उपयोग करने के बजाय, LDARNet यह सीखता है कि टेक्स्ट को तोड़ने के लिए प्राकृतिक स्थान कहाँ हैं, ठीक वैसे ही जैसे एक मानव पाठक स्वाभाविक रूप से एक वाक्य या पैराग्राफ के अंत में रुकता है।

यह कैसे काम करता है, इसके लिए सरल उपमाओं का उपयोग किया गया है:

1. "स्मार्ट हाइलाइटर" (सीखने योग्य टोकनाइज़ेशन - Learnable Tokenization)

अधिकांश DNA मॉडल एक "फिक्स्ड ग्रिड" का उपयोग करते हैं। एक कन्वेयर बेल्ट की कल्पना करें जहाँ एक मशीन ब्रेड के एक लंबे लोफ को हमेशा 2 इंच के स्लाइस में काटती है। कभी-कभी एक स्लाइस स्वादिष्ट फिलिंग (एक जैविक संकेत) के बीच से कट जाता है, और कभी-सीएम पूरा फिलिंग क्रस्ट के साथ ही छूट जाता है।

LDARNet अलग है। इसमें एक स्मार्ट हाइलाइटर है जो DNA को स्कैन करता है और निर्णय लेता है, "ठीक है, अक्षरों का यह समूह एक सार्थक इकाई बनाता है, इसलिए मैं यहीं रुकूँगा। अगला हिस्सा अलग है, इसलिए मैं एक नया चंक (chunk) शुरू करूँगा।" यह मजबूर करने के बजाय प्राकृतिक "सीमाओं" को पहचानना सीख जाता है।

2. "दो-तरफा रास्ता" (द्विदिश पठन - Bidirectional Reading)

मानव शरीर में, जीन कैसे काम करते हैं यह समझने के लिए DNA को दोनों दिशाओं (आगे और पीछे) से पढ़ा जाता है। पुराने मॉडल अक्सर एक-तरफा सड़क की तरह होते थे, जो केवल आगे देखते थे। LDARNet एक दो-तरफा रास्ते की तरह बना है। यह एक साथ बाएं और दाएं, दोनों तरफ से संदर्भ (context) को देखता है। यह इसे एक जीन की पूरी तस्वीर समझने में मदद करता है, न कि केवल यह कि आगे क्या आने वाला है।

3. "कंप्रेशन ट्रिक" (दक्षता - Efficiency)

DNA अविश्वसनीय रूप से लंबा होता है। हर एक अक्षर को पढ़ना कंप्यूटर के लिए धीमा और महंगा है।

  • पुराना तरीका: हर अक्षर को एक-एक करके पढ़ना।
  • LDARNet का तरीका: यह अक्षरों को समूहों (chunks) में बाँटने के लिए अपने "स्मार्ट हाइलाइटर" का उपयोग करता है। फिर यह इन समूहों को एकल इकाइयों के रूप में प्रोसेस करता है।

इसे एक किताब के हर शब्द को पढ़ने के बजाय उसकी सारांश पढ़ने जैसा समझें। LDARNet जानकारी को संकुचित (compress) करता है ताकि यह बहुत तेज़ी से प्रोसेस हो सके, लेकिन क्योंकि इसने कहाँ संकुचित करना है, यह सीख लिया है, इसलिए यह महत्वपूर्ण विवरणों को नहीं खोता है।

उन्हें क्या मिला?

शोधकर्ताओं ने LDARNet का परीक्षण अन्य शीर्ष मॉडलों के विरुद्ध किया, जिनमें कुछ मॉडल 20 गुना बड़े (बहुत अधिक मेमोरी और कंप्यूटिंग पावर वाले) भी शामिल थे।

  • द अंडरडॉग की जीत: भले ही LDARNet छोटा है (केवल 120 मिलियन "पैरामीटर्स", या मस्तिष्क कोशिकाओं वाला), इसने कई कार्यों में विशाल मॉडलों को हरा दिया। इसने "न्यूक्लियोटाइड ट्रांसफॉर्मर" प्रतियोगिता में 18 प्रमुख चुनौतियों में से 11 में जीत हासिल की।
  • हिस्टोन विशेषज्ञता (The Histone Special): यह "हिस्टोन संशोधनों" (histone modifications) की भविष्यवाणी करने में विशेष रूप से अच्छा था। हिस्टोन को उन स्पूल (spools) के रूप में समझें जिनके चारों ओर DNA लिपटा होता है। जब स्पूल अपना आकार बदलता है, तो वह जीन को चालू या बंद कर देता है। LDARNet इन परिवर्तनों की भविष्यवाणी करने में सर्वश्रेष्ठ था, जिसने इससे 20 गुना बड़े मॉडलों से बेहतर प्रदर्शन किया।
  • "क्यों" प्रयोग: यह साबित करने के लिए कि यह केवल भाग्य नहीं था, उन्होंने एक नियंत्रित परीक्षण चलाया। उन्होंने मॉडल का एक संस्करण लिया और उसे पुराने "फिक्स्ड रूलर" तरीके (हर 4 अक्षर पर काटने) का उपयोग करने के लिए मजबूर किया।
    • परिणाम: मॉडल जिसमें सीखी हुई सीमाएं थीं (स्मार्ट हाइलाइटर वाला), वह फिक्स्ड रूलर वाले मॉडल की तुलना में जैविक संकेतों को खोजने में काफी बेहतर था। पेपर का दावा है कि सुधार का 14 प्रतिशत तक केवल टेक्स्ट को काटने का स्थान सीखने से आया, न कि अधिक कंप्यूटिंग पावर से।

जैविक "अहा!" क्षण (The Biological "Aha!" Moment)

सबसे रोमांचक बात यह है कि कंप्यूटर ने केवल अनुमान नहीं लगाया। जब शोधकर्ताओं ने देखा कि LDARNet ने कहाँ कट लगाने का निर्णय लिया, तो उन्होंने पाया कि वह बिल्कुल वास्तविक जैविक लैंडमार्क्स पर पहुँच रहा था।

  • यह प्रमोटर्स (जीन के लिए "स्टार्ट" बटन) पर ठीक वहीं रुका।
  • यह स्प्लिस जंक्शनों (जहाँ कोशिका जेनेटिक संदेश को एडिट करती है) पर ठीक वहीं रुका।

मॉडल ने बिना किसी को स्पष्ट रूप से सिखाए, जीवन के नियमों को खुद ही समझ लिया। इसने जीवन के "शब्दों" को अपने आप देखना सीख लिया।

सारांश

LDARNet एक छोटा, कुशल AI है जो एक कठोर, पूर्व-निर्धारित पैटर्न का पालन करने के बजाय, अपने स्वयं के प्राकृतिक वाक्य ब्रेक खोजने को सीखकर DNA को पढ़ता है। ऐसा करके, यह बहुत बड़े और महंगे मॉडलों की तुलना में जैविक कहानी को बेहतर ढंग से समझता है, जो यह सिद्ध करता है कि कैसे पढ़ना है, यह जानना केवल एक बड़े मस्तिष्क के होने से अधिक महत्वपूर्ण है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →