← नवीनतम पेपर
🧬 biology

Predictive single cell foundation model for gene regulation and aging with privacy-preserving tabular learning

यह शोध पत्र Tabula को प्रस्तुत करता है, जो एक गोपनीयता-संरक्षित सिंगल-सेल फाउंडेशन मॉडल है जो जीनोमिक डेटा की सारणीबद्ध (tabular) संरचना को स्पष्ट रूप से कैप्चर करने के लिए फेडरेटेड लर्निंग का लाभ उठाता है, जिससे संस्थानों के बीच कच्चे डेटा को साझा किए बिना नियामक तर्क (regulatory logic) की खोज और कायाकल्प कारकों (rejuvenation factors) की पहचान करना सक्षम होता है।

मूल लेखक: Xiaojie Qiu, Jiayuan Ding, Jianhui Lin, Ziyang Miao, Nils Mechtel, Shiyu Jiang, Yixin Wang, Zhaoyu Fang, Jorge Martin-Rufino, Chen Weng, Reuben Saunders, Weize Xu, Jonathan Weissman, Min Li, Jiliang T
प्रकाशित 2026-07-09
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xiaojie Qiu, Jiayuan Ding, Jianhui Lin, Ziyang Miao, Nils Mechtel, Shiyu Jiang, Yixin Wang, Zhaoyu Fang, Jorge Martin-Rufino, Chen Weng, Reuben Saunders, Weize Xu, Jonathan Weissman, Min Li, Jiliang Tang, Wei Ouyang, Yuancheng Ryan Lu

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ⚕️ यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें

यहाँ "Tabula" पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) का उपयोग करते हुए हिंदी अनुवाद दिया गया है।

एक बड़ी तस्वीर: एक नए प्रकार का "सेल ब्रेन" (कोशिका मस्तिष्क)

कल्पना कीजिए कि आपके शरीर की हर कोशिका एक छोटे, जटिल कारखाने की तरह है। प्रत्येक कारखाने के भीतर, हजारों कर्मचारी (जीन) लगातार एक-दूसरे को नोट्स भेज रहे हैं ताकि यह तय किया जा सके कि कारखाने को क्या करना चाहिए—क्या इसे त्वचा बनानी चाहिए, संक्रमण से लड़ना चाहिए, या क्षति की मरम्मत करनी चाहिए?

वैज्ञानिक एक "सुपर-ब्रेन" (एक AI मॉडल) बनाने की कोशिश कर रहे हैं जो इन नोट्स को पढ़ सके और समझ सके कि कारखाने कैसे काम करते हैं। इस सुपर-ब्रेन के पिछले प्रयासों में दो बड़ी समस्याएँ थीं:

  1. "प्राइवेसी लीक" (गोपनीयता का रिसाव): सीखने के लिए, इन मस्तिष्कों को एक साथ सभी कारखानों की निजी नोटबुक देखने की आवश्यकता थी। यह हर अस्पताल से उनके रोगी रिकॉर्ड को एक केंद्रीय सर्वर पर भेजने के समान है, जो गोपनीयता के लिए एक बड़ा जोखिम है।
  2. "गलत बुक फॉर्मेट" (गलत पुस्तक प्रारूप): ये मस्तिष्क ऐसे प्रशिक्षित किए गए थे जैसे वे एक उपन्यास (टेक्स्ट) पढ़ रहे हों। उन्होंने जीन को एक विशिष्ट क्रम में रखने की कोशिश की, जैसे कि किताब में वाक्य होते हैं। लेकिन जीन वाक्य नहीं हैं; वे एक स्प्रेडशीट के कॉलम की तरह हैं। यहाँ क्रम मायने नहीं रखता; कॉलम के मान (values) मायने रखते हैं।

Tabula एक नया समाधान है जो इन दोनों समस्याओं को ठीक करता है। यह एक "फाउंडेशन मॉडल" (एक विशाल, प्री-ट्रेन्ड AI) है जिसे विशेष रूप से सिंगल-सेल डेटा के लिए डिज़ाइन किया गया है, लेकिन यह इस तरह से सीखता है कि यह गोपनीयता का सम्मान करता है और डेटा की वास्तविक संरचना को समझता है।


1. गोपनीयता का समाधान: "सीक्रेट रेसिपी" कुक-ऑफ

समस्या: आमतौर पर, एक स्मार्ट AI को प्रशिक्षित करने के लिए, आप सारा डेटा एक जगह इकट्ठा करते हैं। लेकिन मेडिकल डेटा के साथ, आप करोड़ों रोगी रिकॉर्ड को एक केंद्रीय सर्वर पर नहीं भेज सकते।

Tabula का समाधान (फेडरेटेड लर्निंग):
एक कुकिंग प्रतियोगिता की कल्पना करें जहाँ 8 अलग-अलग शेफ (अस्पताल या अनुसंधान संस्थान) दुनिया की सबसे अच्छी सूप रेसिपी बनाना चाहते हैं।

  • पुराना तरीका: हर कोई अपनी गुप्त सामग्री एक विशाल रसोई में भेज देता है। मुख्य शेफ उन सभी को आपस में मिला देता है। (इससे राज खुल जाते हैं)।
  • Tabula का तरीका: प्रत्येक शेफ अपनी खुद की रसोई में रहता है। वे अपनी गुप्त सामग्रियों का उपयोग करके सूप का एक बैच बनाते हैं। फिर, वे मुख्य शेफ को केवल रेसिपी नोट्स (गणित कि उन्होंने नमक, गर्मी और मसालों को कैसे समायोजित किया) भेजते हैं।
  • मुख्य शेफ इन नोट्स को मिलाकर एक "मास्टर रेसिपी" बनाता है।
  • मास्टर रेसिपी को वापस सभी शेफों को भेजा जाता है, जो अपने अगले बैच को बेहतर बनाने के लिए इसका उपयोग करते हैं।

परिणाम: AI सभी डेटा से सीखता है, लेकिन कोई भी कच्चा डेटा (raw data) अस्पताल से बाहर नहीं जाता। रोगियों की गोपनीयता से कभी समझौता नहीं किया जाता।

2. संरचना का समाधान: "स्प्रेडशीट" बनाम "उपन्यास"

समस्या: पिछले AI मॉडल ने एक कोशिका के साथ एक वाक्य की तरह व्यवहार किया। उन्होंने कहा, "जीन A पहले आता है, फिर जीन B, फिर जीन C।" लेकिन एक कोशिका में, जीन का कोई निश्चित क्रम नहीं होता। यह एक स्प्रेडशीट की तरह है जहाँ आप कॉलम को इधर-उधर बदल सकते हैं, और कोशिका फिर भी वही कोशिका रहती है।

Tabula का समाधान (टेबुलर लर्निंग):
Tabula डेटा के साथ बिल्कुल एक स्प्रेडशीट की तरह व्यवहार करता है।

  • पंक्तियाँ (Rows): प्रत्येक पंक्ति एक एकल कोशिका है।
  • कॉलम (Columns): प्रत्येक कॉलम एक जीन है।
  • ट्रिक: कहानी की तरह बाएँ-से-दाएँ पढ़ने के बजाय, Tabula पूरी पंक्ति को एक साथ देखता है। यह समझता है कि यदि आप कॉलम 5 और कॉलम 10 को आपस में बदल देते हैं, तो कोशिका का अर्थ नहीं बदलता है।

इस "स्प्रेडशीट" प्रकृति का सम्मान करके, Tabula उन संबंधों को बहुत बेहतर तरीके से सीखता है जिन्हें अन्य मॉडल एक कहानी के रूप में थोपने की कोशिश करते हैं।

3. प्लेटफॉर्म: "Chiron" – डिजिटल मीटिंग रूम

इस गोपनीयता-अनुकूल कुकिंग कॉम्पिटिशन को आसान बनाने के लिए, लेखकों ने Chiron नामक एक प्लेटफॉर्म बनाया है।

  • Chiron को एक डिजिटल मीटिंग रूम के रूप में सोचें जिसमें एक अंतर्निर्मित "AI एजेंट" (एक सहायक रोबोट असिस्टेंट) है।
  • कोई भी अस्पताल एक सिंगल क्लिक के साथ इस कमरे में शामिल हो सकता है। उन्हें सर्वर सेट करने के लिए इंजीनियरों की टीम की आवश्यकता नहीं है।
  • रोबोट असिस्टेंट उनका मार्गदर्शन करता है: "यह आपका डेटा है, यह आपका मॉडल है, चलिए प्रशिक्षण शुरू करते हैं।"
  • एक बार प्रशिक्षण पूरा हो जाने के बाद, नई "मास्टर रेसिपी" (बेहतर AI मॉडल) को एक सार्वजनिक लाइब्रेरी (मॉडल हब) में प्रकाशित किया जाता है ताकि कोई भी इसका उपयोग कर सके, बिना अस्पतालों के कच्चे डेटा को देखे।

4. Tabula वास्तव में क्या कर सकता है?

पेपर दिखाता है कि Tabula केवल एक प्राइवेसी टूल नहीं है; यह पिछले मॉडलों की तुलना में जीव विज्ञान (biology) में वास्तव में अधिक स्मार्ट है।

  • "ज़ीरो-शॉट" डिटेक्टिव (जासूस): Tabula यह भविष्यवाणी कर सकता है कि जीन आपस में कैसे बात करते हैं, भले ही उन्हें उन विशिष्ट नियमों के बारे में स्पष्ट रूप से न सिखाया गया हो।
    • उपमा: कल्पना कीजिए कि आप एक जासूस को तर्क के नियम सिखाते हैं और उसे कुछ अपराध स्थल दिखाते हैं। फिर, आप उसे एक बिल्कुल नया अपराध स्थल दिखाते हैं जिसे उसने पहले कभी नहीं देखा है, और वह तुरंत अनुमान लगा लेता है कि अपराधी कौन है और उसने यह कैसे किया। Tabula ने चार जटिल जैविक प्रणालियों (रक्त निर्माण, हृदय विकास, मस्तिष्क विकास और अग्न्याशय विकास) के लिए यह किया और लगभग हर बार "ग्राउंड ट्रुथ" (वास्तविक सत्य) को सही पाया।
  • एंटी-एजिंग (बुढ़ापा रोकने वाले) कुंजियों की खोज: शोधकर्ताओं ने एक विशिष्ट पहेली को सुलझाने के लिए Tabula का उपयोग किया: हम अपनी पहचान खोए बिना पुरानी त्वचा कोशिकाओं को फिर से युवा कैसे बना सकते हैं?
    • उन्होंने युवा और वृद्ध मानव त्वचा कोशिकाओं का डेटा लिया।
    • उन्होंने Tabula से एक "कायाकल्प" (rejuvenation) प्रक्रिया का अनुकरण करने के लिए कहा: "यदि हम इन जीन्स को ट्यून करें, तो क्या हम पुरानी कोशिका को युवा दिखा सकते हैं, लेकिन वह अभी भी एक त्वचा कोशिका ही रहे?"
    • Tabula ने विशिष्ट जीन (जैसे CPE, POSTN, और OLFM2) सुझाए, जिन्हें यदि बढ़ाया जाए, तो वे उम्र बढ़ने के संकेतों को उलट सकते हैं।
    • सत्यापन (Validation): जब उन्होंने लैब में इन जीनों का परीक्षण किया, तो वे काम कर रहे थे। दिलचस्प बात यह है कि ये जीन प्रसिद्ध "यामानाका फैक्टर्स" (एक ज्ञात रीप्रोग्रामिंग विधि) से अलग काम करते हैं, जिससे पता चलता है कि Tabula ने कायाकल्प का एक नया रास्ता खोजा है जो कोशिका की पहचान को बरकरार रखता है।

सारांश

Tabula जीव विज्ञान के लिए एक नया AI है जो:

  1. गोपनीयता की रक्षा करता है: यह अस्पतालों से सीखता है लेकिन उनके निजी रोगी डेटा को कभी नहीं देखता (इस "सीक्रेट रेसिपी" पद्धति का उपयोग करके)।
  2. डेटा को सही ढंग से समझता है: यह कोशिकाओं को कहानियों के बजाय स्प्रेडशीट की तरह मानता है, जिससे यह जीन इंटरैक्शन को समझने में अधिक स्मार्ट बनता है।
  3. उपयोग में आसान है: Chiron प्लेटफॉर्म किसी भी लैब को एक सिंगल क्लिक के साथ प्रशिक्षण प्रयास में शामिल होने की अनुमति देता है।
  4. परिणाम देता है: इसने सफलतापूर्वक जटिल जीन नियमों की भविष्यवाणी की और त्वचा के बुढ़ापे को उलटने के लिए नए उम्मीदवारों की पहचान की, जिससे यह साबित हुआ कि यह चिकित्सा खोज के लिए एक शक्तिशाली उपकरण हो सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →