cyto: ultra high-throughput processing of 10x-flex single cell sequencing
यह शोध पत्र **cyto** को प्रस्तुत करता है, जो 10x Genomics Flex सिंगल-सेल सीक्वेंसिंग के लिए एक ओपन-सोर्स, अल्ट्रा हाई-थ्रूपुट प्रोसेसर है, जो डायरेक्ट k-mer लुकअप और नवीन बाइनरी फॉर्मेट्स का उपयोग करके CellRanger की तुलना में 16.5 गुना गति वृद्धि और काफी कम संसाधन उपयोग प्राप्त करता है, जबकि अरबों कोशिकाओं वाले एटलस के स्केलेबल और लागत प्रभावी निर्माण को सक्षम करने के लिए मानक आउटपुट के साथ 99.85% समानता बनाए रखता है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप अरबों सूक्ष्म, अद्वितीय पुस्तकों वाली एक विशाल लाइब्रेरी को व्यवस्थित करने की कोशिश कर रहे हैं। प्रत्येक पुस्तक एक जीवित जीव की एकल कोशिका (cell) का प्रतिनिधित्व करती है, और प्रत्येक पुस्तक के भीतर निर्देश (जेनेटिक डेटा) हैं जो बताते हैं कि वह कोशिका क्या करती है। अतीत में, वैज्ञानिकों ने इन किताबों को पढ़ने और व्यवस्थित करने के लिए "CellRanger" नामक एक विधि का उपयोग किया था। हालाँकि, जैसे-जैसे किताबों की संख्या अरबों में बढ़ी, यह विधि हर एक किताब के हर एक शब्द को एक-एक करके पढ़ने जैसा हो गई। इसे पूरा करने में घंटों लग जाते थे, इसके लिए एक सुपरकंप्यूटर की आवश्यकता होती थी, और यह अविश्वसनीय रूप से महंगा था।
यहाँ cyto आता है, जो इस बाधा को दूर करने के लिए बनाया गया एक नया, अत्यंत तीव्र उपकरण है। यह कैसे काम करता है, इसके कुछ रोजमर्रा के उदाहरण यहाँ दिए गए हैं:
1. "पैटर्न रिकग्निशन" का तरीका (सब कुछ पढ़ने के बजाय)
पारंपरिक उपकरण डेटा के हर हिस्से को एक संदर्भ मानचित्र (reference map) के साथ संरेखित करने की कोशिश करते हैं, जैसे कि एक लाइब्रेरियन कैटलॉग के विरुद्ध हर शेल्फ की जाँच करके किताब खोजने की कोशिश कर रहा हो। cyto अधिक स्मार्ट है। क्योंकि नए "10x Flex" लाइब्रेरी का एक निश्चित, अनुमानित लेआउट होता है (जैसे कि किताबें हमेशा एक ही रंग के कोड वाले बक्सों में आती हैं), cyto को पूरी कहानी पढ़ने की आवश्यकता नहीं होती है। इसके बजाय, यह एक "डायरेक्ट लुकअप" सिस्टम का उपयोग करता है। इसे किराने की दुकान पर बारकोड स्कैनर की तरह समझें: यह सामग्री की सूची नहीं पढ़ता; यह बस कोड को स्कैन करता है और तुरंत जान जाता है कि वस्तु को कहाँ रखना है। यह पारंपरिक अलाइनमेंट की धीमी और भारी मेहनत को छोड़ देता है।
2. "कॉम्पैक्ट सूटकेस" (IBU फॉर्मेट)
डेटा को इधर-उधर ले जाने के लिए, cyto IBU (Indexed-Barcode-UMI) नामक एक नया फॉर्मेट उपयोग करता है। कल्पना करें कि आप फर्नीचर से भरे घर को स्थानांतरित करने की कोशिश कर रहे हैं। पुराना तरीका हर वस्तु को बबल रैप और कार्डबोर्ड की परतों में लपेटने जैसा था, जिससे एक बहुत बड़ा ट्रक लग जाता था। Cyto का IBU फॉर्मेट एक हाई-टेक, वैक्यूम-सील्ड सूटकेस की तरह है। यह डेटा को एक छोटे, कुशल बाइनरी पैकेज में कंप्रेस कर देता है, जिससे इसे लोड करना, ले जाना और अनपैक करना बहुत तेज़ हो जाता है।
3. "असेंबली लाइन" (BINSEQ फॉर्मेट)
अधिकांश कंप्यूटर फाइलें एक सिंगल-फाइल जिप (gzip) की तरह कंप्रेस होती हैं, जिसे एक बार में केवल एक ही व्यक्ति खोल सकता है। यदि आपके पास एक बड़ी फाइल है, तो आपको अगले व्यक्ति के शुरू करने से पहले उस एक व्यक्ति के समाप्त करने का इंतजार करना होगा। Cyto BINSEQ नामक एक फॉर्मेट का उपयोग करता है, जो एक विशाल असेंबली लाइन की तरह है। एक व्यक्ति द्वारा बॉक्स खोलने के बजाय, यह सैकड़ों श्रमिकों को एक साथ बॉक्स के विभिन्न हिस्सों को खोलने की अनुमति देता है। यह "सिंगल-थ्रेडेड" सीमा को तोड़ देता है, जिससे कंप्यूटर एक साथ अपनी पूरी शक्ति का उपयोग कर पाता है।
परिणाम: एक बिजली जैसी तेज़ क्रांति
पेपर ने एक विशाल डेटासेट पर cyto का परीक्षण किया जिसमें 320,000 कोशिकाएं (एक "मल्टीप्लेक्सड" समूह) शामिल थीं।
- गति: जबकि पुराने टूल (CellRanger) को काम पूरा करने में 3.7 घंटे लगे, cyto ने इसे केवल 13 मिनट में कर दिखाया। यह 16.5 गुना तेज़ है।
- दक्षता: इसने आधे से भी कम मेमोरी का उपयोग किया और बहुत कम "डिस्क I/O" (जो कंप्यूटर के हार्ड ड्राइव द्वारा की जाने वाली भारी मेहनत है) किया।
- सटीकता: इतनी तेज़ होने के बावजूद, cyto ने कोई शॉर्टकट नहीं अपनाया। इसने पुराने टूल के परिणामों से 99.85% बार मेल खाया। जब वैज्ञानिकों ने कोशिकाओं के अंतिम समूहों (क्लस्टरिंग) को देखा, तो परिणाम बिल्कुल समान थे।
यह क्यों महत्वपूर्ण है
पेपर का दावा है कि cyto केवल इसलिए तेज़ नहीं है क्योंकि यह अधिक कंप्यूटरों का उपयोग करता है; यह मौलिक रूप से अधिक कुशल है, जो 31.7 गुना कम CPU-घंटों का उपयोग करता है। इसका मतलब है कि वैज्ञानिक अब महंगे सुपरकंप्यूटरों के बजाय छोटे, सस्ते क्लाउड कंप्यूटरों पर इन विशाल प्रयोगों को चला सकते हैं। यह उन परियोजनाओं को, जो पहले बहुत धीमी या बहुत महंगी होने के कारण संभव नहीं थीं, एक नियमित कार्य में बदल देता है, जिससे "बिलियन-सेल एटलस" और बड़े पैमाने पर जेनेटिक स्क्रीन का मार्ग प्रशस्त होता है।
संक्षेप में, cyto दुनिया के सबसे जटिल जैविक डेटा को व्यवस्थित करने के लिए धीमी, भाप से चलने वाली लोकोमोटिव (रेल इंजन) की जगह लेने वाली एक हाई-स्पीड ट्रेन है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।