TaxoFormer: Hierarchical Transformer for Predicting the Full Taxonomic Lineage of Protein Sequences
यह शोध पत्र TaxoFormer को प्रस्तुत करता है, जो एक पदानुक्रमित (hierarchical) ट्रांसफॉर्मर आर्किटेक्चर है जो विशाल NCBI फाइलोजेनेटिक ट्री (phylogenetic tree) को हानिरहित रूप से (losslessly) प्रदर्शित करने के लिए एक संरचित टोकनाइज़ेशन योजना का उपयोग करता है, जिससे एक सरल जनरेटिव मॉडल 188 मिलियन अनुक्रमों (sequences) से पूर्ण प्रोटीन टैक्सोनोमिक वंशों की सटीक भविष्यवाणी करने और सार्थक फाइलोजेनेटिक निरूपण सीखने में सक्षम होता है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक विशाल, प्राचीन वंशावली (family tree) है जिसमें पृथ्वी पर मौजूद हर जीवित प्राणी शामिल है, जो अरबों साल पीछे तक जाती है। यह पेड़ इतना बड़ा है कि इसमें 13 लाख से अधिक शाखाएं और पत्तियां हैं। अब, कल्पना कीजिए कि आपको एक रहस्यमय प्रोटीन (जीवन का एक छोटा सा निर्माण खंड) मिलता है और आपका काम यह पता लगाना है कि वह इस विशाल वंशावली में ठीक कहाँ फिट बैठता है।
यही वह चुनौती है जिसे पेपर TaxoFormer हल करता है। उन्होंने इसे कैसे हल किया, इसका सरल विवरण यहाँ दिया गया है:
समस्या: बहुत सारी किताबों वाली एक लाइब्रेरी
आमतौर पर, जब कंप्यूटर किसी चीज़ की श्रेणी (category) का अनुमान लगाने की कोशिश करते हैं, तो वे हर श्रेणी को एक अलग, असंबंधित विकल्प के रूप में देखते हैं। लेकिन जीव विज्ञान में, श्रेणियाँ एक वंशावली की तरह जुड़ी होती हैं। यदि आप जानते हैं कि कोई चीज़ एक "स्तनधारी" (mammal) है, तो आप स्वतः ही जानते हैं कि वह एक "जानवर" और एक "यूकेरियोट" भी है।
शोधकर्ता कंप्यूटर को केवल अंतिम लेबल का अनुमान लगाने के बजाय, प्रोटीन के पूरे पारिवारिक इतिहास की भविष्यवाणी करना सिखाना चाहते थे, और यह सब केवल उसके अनुक्रम (sequence - उसके जेनेटिक कोड) को देखकर करना था।
समाधान: पेड़ के लिए एक विशेष "ज़िपर" (Zipper)
टीम ने एक नया AI मॉडल बनाया जिसे TaxoFormer कहा जाता है। उनका सबसे बड़ा कमाल यह था कि उन्होंने कंप्यूटर को वंशावली को "पढ़ना" कैसे सिखाया।
- पुराना तरीका: कल्पना कीजिए कि 13 लाख पन्नों की एक किताब का वर्णन करने के लिए हर पन्ने पर मौजूद हर एक शब्द को सूचीबद्ध करना। यह बहुत विशाल और अस्त-व्यस्त होगा।
- TaxoFormer का तरीका: उन्होंने एक विशेष "शब्दावली" (15,000 अद्वितीय कोडों का एक सेट) बनाई जो एक ज़िपर की तरह काम करती है। यह ज़िपर पूरी 13-लाख-नोड वाली वंशावली को बिना किसी विवरण को खोए, एक संक्षिप्त और व्यवस्थित प्रारूप में लॉक कर सकती है। यह एक फैले हुए, उलझे हुए जंगल को मोतियों की एक साफ, एकल माला में बदलने जैसा है, जहाँ मोतियों का क्रम पूरी कहानी बताता है।
यह कैसे काम करता है: कहानीकार (The Storyteller)
उन्होंने एक स्मार्ट AI लिया जो पहले से ही प्रोटीनों के बारे में बहुत कुछ जानता है (जिसे ESM-2 कहा जाता है) और उसे एक नया काम दिया: कहानी सुनाना।
केवल एक लेबल की ओर इशारा करने के बजाय, AI से प्रोटीन के पारिवारिक इतिहास को, सबसे व्यापक श्रेणी से लेकर सबसे विशिष्ट श्रेणी तक, शब्द दर शब्द लिखने के लिए कहा जाता है। यह एक जासूस से किसी संदिग्ध की पूरी यात्रा को चरण-दर-चरण पुनर्गठित करने के लिए कहने जैसा है, बजाय इसके कि केवल उसके अंतिम गंतव्य का अनुमान लगाया जाए।
उन्होंने इस कहानीकार को 188 मिलियन प्रोटीनों के एक विशाल पुस्तकालय का उपयोग करके प्रशिक्षित किया। उन्होंने किसी जटिल, कस्टम नियमों का उपयोग नहीं किया; उन्होंने बस एक मानक "गलतियों को सुधारने" वाले तरीके (cross-entropy) का उपयोग किया।
परिणाम: मानचित्र को सीखना
परिणाम प्रभावशाली थे। मॉडल ने न केवल सही उत्तर दिए; बल्कि इसने वास्तव में मानचित्र को सीख लिया।
चूंकि AI को उत्तर पाने के लिए पूरी वंशावली को लिखना पड़ता था, इसलिए इसने स्वाभाविक रूप से यह समझ लिया कि जीवन के विभिन्न समूह एक-दूसरे से कैसे संबंधित हैं। इसने एक मानसिक स्थान (mental space) बनाया जहाँ निकट संबंधी प्रोटीन एक-दूसरे के पास स्थित होते हैं, और दूर के प्रोटीन दूर होते हैं, और यह सब बिना किसी स्पष्ट निर्देश के हुआ।
निष्कर्ष
यह पेपर दिखाता है कि यदि आप किसी AI को पूरी तस्वीर (पूरी वंशावली) देखने का एक स्पष्ट, संरचित तरीका देते हैं और उससे उस तस्वीर का चरण-दर-चरण वर्णन करने के लिए कहते हैं, तो वह प्रकृति के छिपे हुए संबंधों को समझने में अविश्वसनीय रूप से कुशल हो जाता है। यह प्रत्येक प्रोटीन की एक-एक करके तुलना किए बिना प्रोटीनों को लेबल करने का एक तेज़ और कुशल तरीका है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।