← नवीनतम पेपर
🧬 biology

LucaCell: a sequence-centric foundation model for cross-species single-cell analysis

LucaCell एक अनुक्रम-केंद्रित (sequence-centric) फाउंडेशन मॉडल है जो स्थिर जीन पहचानकर्ताओं के बजाय पूर्व-प्रशिक्षित mRNA अनुक्रम एम्बेडिंग का उपयोग करता है ताकि सटीक कोशिका प्रकार स्थानांतरण (cell type transfer), सूक्ष्मजीव प्रजाति विभेदन (microbial species differentiation), और होस्ट-वायरस इंटरेक्शन भविष्यवाणी सहित मजबूत क्रॉस-स्पीशीज, क्रॉस-मोडल और क्रॉस-कॉन्टेक्स्ट सिंगल-सेल विश्लेषण सक्षम किया जा सके।

मूल लेखक: Yan Sun, Yong He, Minsi Ren, Yanhui Wang, Penghao Xu, Yong Hou, Yu Kang, Tingjun Hou, Jieping Ye, Huanming Yang, Zheng Wang

प्रकाशित 2026-09-25
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yan Sun, Yong He, Minsi Ren, Yanhui Wang, Penghao Xu, Yong Hou, Yu Kang, Tingjun Hou, Jieping Ye, Huanming Yang, Zheng Wang

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ⚕️ यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें

प्रत्येक जीवित कोशिका के भीतर, निर्देशों का एक जटिल पुस्तकालय यह निर्धारित करता है कि वह कोशिका कैसे कार्य करती है, बढ़ती है और अपने परिवेश के प्रति प्रतिक्रिया देती है। ये निर्देश एक रासायनिक भाषा में लिखे गए हैं जिसे आरएनए (RNA) कहा जाता है, जो कोशिका के मास्टर ब्लूप्रिंट से आदेश ले जाने वाले एक संदेशवाहक के रूप में कार्य करता है। दशकों से, वैज्ञानिकों ने इन संदेशों को पढ़ने के लिए उपकरण विकसित किए हैं, जिससे उन्हें मानव शरीर में विभिन्न प्रकार की कोशिकाओं को सूचीबद्ध करने और यह समझने में मदद मिली है कि बीमारियाँ उनके सामान्य संचालन को कैसे बाधित करती हैं। हालाँकि, एक बड़ी बाधा हमेशा बनी रही है: ये उपकरण जीन के लिए निश्चित नामों और लेबल पर निर्भर करते हैं, ठीक वैसे ही जैसे एक लाइब्रेरी तभी काम करती है जब हर किताब पर एक विशिष्ट, पूर्व-निर्धारित कॉल नंबर हो। यदि कोई वैज्ञानिक मानव कोशिका की तुलना चूहे की कोशिका से करने का प्रयास करता है, या मानव कोशिका की तुलना किसी सूक्ष्मजीव से करता है, तो पुराने सिस्टम अक्सर विफल हो जाते हैं क्योंकि नाम मेल नहीं खाते, या डेटा पूरी तरह से अलग प्रकार के माप से आता है। इस सीमा ने विभिन्न प्रजातियों और जैविक संदर्भों में काम करने वाले एक एकल, सार्वभौमिक जीवन की समझ बनाने को कठिन बना दिया है।

शोधकर्ताओं की एक टीम ने अब एक नया दृष्टिकोण पेश किया है जो इन नामकरण की समस्याओं को पूरी तरह से दरकिनार कर देता है। स्थिर लेबल पर निर्भर रहने के बजाय, उन्होंने एक कंप्यूटर मॉडल बनाया है जो सीधे आनुवंशिक कोड को बनाने वाले अक्षरों के कच्चे अनुक्रम (raw sequence) से सीखता है। मॉडल को रासायनिक अक्षरों में पैटर्न पहचानने के लिए सिखाकर, शोधकर्ताओं ने एक ऐसी प्रणाली बनाई है जो बिना यह जाने कि उसका विशिष्ट नाम या प्रजाति क्या है, जीन के सार को समझ सकती है। लूकासेल (LucaCell) नामक यह नया मॉडल, आनुवंशिक कोड को विच्छेदित वस्तुओं की सूची के बजाय एक निरंतर भाषा के रूप में मानता है। इसका परिणाम एक ऐसा उपकरण है जो प्रजातियों के बीच जैविक जानकारी का अनुवाद कर सकता है, यह भविष्यवाणी कर सकता है कि कोशिकाएं परिवर्तनों के प्रति कैसी प्रतिक्रिया देंगी, और यहाँ तक कि संक्रमणों की पहचान भी कर सकता है इससे पहले कि वे स्पष्ट हों, जो जीवन के निर्माण खंडों का अध्ययन करने का एक अधिक लचीला और शक्तिशाली तरीका प्रदान करता है।

इस सफलता का मूल आधार यह है कि मॉडल जीनों का प्रतिनिधित्व कैसे करता है। पारंपरिक तरीके प्रत्येक जीन को एक अद्वितीय प्रतीक के रूप में देखते हैं, जैसे कि शब्दकोश में एक शब्द। यदि शब्दकोश बदल जाता है या यदि आप किसी अलग भाषा में किताब पढ़ रहे हैं, तो प्रतीक अब समझ में नहीं आते। हालाँकि, लूकासेल उन वास्तविक अक्षरों के अनुक्रम को देखता है जो जीन बनाते हैं। यह इन अनुक्रमों को गणितीय आकृतियों में बदलने के लिए एक पूर्व-प्रशिक्षित प्रणाली का उपयोग करता है जो उनके अर्थ और संबंधों को पकड़ती है। जब मॉडल को एक जीन का सामना करना पड़ता है, तो वह उसके लेबल के आधार पर नहीं, बल्कि उसकी रासायनिक संरचना के आधार पर उसके कार्य को समझता है। यह इसे पहचानने की अनुमति देता है कि मानव किडनी में एक जीन और चूहे की किडनी में एक समान जीन संबंधित हैं, भले ही उनके नाम अलग हों या डेटा विभिन्न तकनीकों का उपयोग करके एकत्र किया गया हो। शोधकर्ताओं ने इसे प्रशिक्षित करने के लिए मनुष्यों और चूहों के पचास मिलियन से अधिक कोशिकाओं के विशाल डेटासेट का उपयोग किया, जिसमें दर्जनों ऊतक और रोग अवस्थाएं शामिल थीं। इस प्रशिक्षण ने मॉडल को यह गहरी, सामान्य समझ दी कि कोशिकाएं कैसे व्यवहार करती हैं।

प्रशिक्षित होने के बाद, मॉडल को कई चुनौतीपूर्ण परिदृश्यों में परीक्षण के लिए रखा गया जहाँ पुराने सिस्टम आमतौर पर संघर्ष करते हैं। एक प्रयोग में, शोधकर्ताओं ने मॉडल को मनुष्यों, चूहों और ग्रे माउस लेमुर नामक एक छोटे प्राइमेट की किडनी में कोशिका प्रकारों की पहचान करने के लिए कहा। मॉडल ने विभिन्न प्रजातियों के बीच कोशिका प्रकारों को सफलतापूर्वक मिलाया, भले ही डेटा अलग-अलग प्रकार के मापों से आया हो, जैसे कि आनुवंशिक कोड को सीधे पढ़ना बनाम डीएनए की सुलभता को पढ़ना। इसने अनदेखे चूहे के डेटा पर विशेष रूप से अच्छा प्रदर्शन किया, जो सुझाव देता है कि अनुक्रम-आधारित दृष्टिकोण उन मौलिक जैविक सत्यों को पकड़ता है जो प्रजातियों के बीच लागू होते हैं। मॉडल सूक्ष्मजीवों के साथ काम करने में भी सक्षम सिद्ध हुआ। एकल बैक्टीरिया से जुड़े एक परीक्षण में, मॉडल ने उन्हें किसी संदर्भ जीनोम के साथ संरेखित (align) किए बिना कच्चे आनुवंशिक रीड्स का विश्लेषण किया। इसने पचास से अधिक विभिन्न बैक्टीरिया प्रजातियों के बीच सफलतापूर्वक अंतर किया और बैक्टीरिया की आंतरिक स्थिति में सूक्ष्म परिवर्तनों, जैसे कि एंटीबायोटिक तनाव के प्रति उनकी प्रतिक्रिया को, केवल उनके आनुवंशिक अनुक्रमों में पैटर्न देखकर भी पहचान सका।

अनुक्रम-केंद्रित दृष्टिकोण की शक्ति विशिष्ट परिवर्तनों के प्रति कोशिकाओं की प्रतिक्रिया की भविष्यवाणी करने में भी फैली हुई थी। शोधकर्ताओं ने मॉडल का उपयोग यह सिम्युलेट करने के लिए किया कि क्या होगा यदि किसी विशिष्ट जीन को बंद या परिवर्तित कर दिया जाए, जिसे 'परटर्बेशन' (perturbation) कहा जाता है। इन परीक्षणों में, मॉडल ने पिछले सिस्टम की तुलना में जीन गतिविधि में होने वाले परिवर्तनों की अधिक सटीकता से भविष्यवाणी की। यह व्यक्तियों के बीच आनुवंशिक कोड में सूक्ष्म भिन्नताओं, जिन्हें सिंगल-न्यूक्लियोटाइड पॉलीमॉर्फिज्म (single-nucleotide polymorphisms) कहा जाता है, को भी ध्यान में रख सकता था। इन छोटे अंतरों को शामिल करके, मॉडल ने विशिष्ट लोगों के लिए जीन अभिव्यक्ति स्तरों की भविष्यवाणी करने की अपनी क्षमता में सुधार किया, जिससे यह पता चला कि आनुवंशिक अनुक्रम में मामूली बदलाव भी इस बात पर प्रभाव डाल सकते हैं कि एक कोशिका कैसे कार्य करती है। विवरण का यह स्तर बताता है कि मॉडल उन बारीकियों को पकड़ लेता है जिन्हें व्यापक, लेबल-आधारित सिस्टम अक्सर छोड़ देते हैं।

शायद सबसे उल्लेखनीय अनुप्रयोगों में से एक होस्ट-वायरस इंटरैक्शन (मेजबान-वायरस अंतःक्रिया) के क्षेत्र में था। शोधकर्ताओं ने इन्फ्लुएंजा वायरस के विभिन्न स्ट्रेन से संक्रमित व्यक्तिगत कोशिकाओं में वायरल लोड की भविष्यवाणी करने के लिए मॉडल को प्रशिक्षित किया। जब मॉडल के सामने नए वायरस-होस्ट संयोजन आए जिन्हें उसने पहले कभी नहीं देखा था, तो इसने सभी मौजूदा उपकरणों से बेहतर प्रदर्शन किया, और संक्रमण पैटर्न की सही पहचान की जहाँ अन्य विफल रहे। यह उन कोशिकाओं को देखने में भी सक्षम था जो वायरस के संपर्क में नहीं आई थीं और उन सूक्ष्म उप-जनसंख्या की पहचान की जो पहले से ही आसन्न संक्रमण के आनुवंशिक संकेतों को प्रदर्शित कर रही थी। यह खोज बताती है कि मॉडल कोशिकाओं में मौजूद सूक्ष्म, पूर्व-स्थित अवस्थाओं का पता लगा सकता है जो उन्हें संक्रमण के प्रति अधिक संवेदनशील बनाती हैं, एक ऐसी क्षमता जो यह समझने के लिए महत्वपूर्ण हो सकती है कि कोशिकीय स्तर पर बीमारियाँ कैसे फैलती हैं।

लूकासेल की सफलता यह सुझाव देती है कि आनुवंशिक अक्षरों का अनुक्रम जीव विज्ञान को समझने के लिए एक हस्तांतरणीय आधार है। स्थिर पहचानकर्ताओं से दूर हटकर और अंतर्निहित रासायनिक भाषा पर ध्यान केंद्रित करके, शोधकर्ताओं ने एक ऐसा मॉडल बनाया है जो अधिक अनुकूलन योग्य और मजबूत है। हालांकि वर्तमान संस्करण मानव और चूहे के डेटा पर निर्भर है और आनुवंशिक अनुक्रम के सरलीकृत दृश्य का उपयोग करता है, परिणाम संकेत देते हैं कि यह दृष्टिकोण प्रजातियों, डेटा प्रकारों और जैविक संदर्भों के बीच की खाई को पाट सकता है। यह दुनिया को देखने का एक नया तरीका प्रदान करता है, जहाँ जीवन की मौलिक भाषा को बिना किसी अनुवाद या कठोर वर्गीकरण के सीधे समझा जाता है। लेबल से अनुक्रम की ओर यह बदलाव भविष्य में यह खोजने के लिए एक मानक बन सकता है कि कोशिकाएं कैसे संचालित होती हैं, परस्पर क्रिया करती हैं और जीवन की चुनौतियों के प्रति प्रतिक्रिया देती हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →