Ancestral Sequences Cannot be Accurately Reconstructed via Interpolation in a Variational Autoencoder's Latent Space
यह अध्ययन प्रदर्शित करता है कि एपिस्टैटिक इंटरैक्शन (epistatic interactions) को मॉडल करने की वेरिएशनल ऑटोएनकोडर्स (variational autoencoders) की क्षमता के बावजूद, डिकोडिंग प्रक्रिया के दौरान होने वाला उनका अंतर्निहित सूचना नुकसान उन्हें पूर्वज अनुक्रमों (ancestral sequences) को सटीक रूप से पुनर्गठित करने से रोकता है, क्योंकि वे मानक संभावना-आधारित (likelihood-based) और पार्सिमोनी (parsimony) विधियों द्वारा लगातार पीछे छोड़ दी जाती हैं।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें
जीवन के इतिहास की गहराइयों में, हर जीवित प्राणी अपने पूर्वजों का एक आणविक रिकॉर्ड (molecular record) अपने साथ लेकर चलता है। वैज्ञानिक लंबे समय से इस रिकॉर्ड को पढ़ने की कोशिश कर रहे हैं, जिसे 'एन्सेस्ट्रल सीक्वेंस रिकंस्ट्रक्शन' (ancestral sequence reconstruction) कहा जाता है। कल्पना कीजिए कि आप अपने परदादा द्वारा लिखे गए एक पत्र के सटीक शब्दों का अनुमान लगाने की कोशिश कर रहे हैं, जो केवल उनके कई प्रपौत्रों द्वारा रखे गए प्रतियों (copies) के आधार पर है। जीव विज्ञान में, ये "अक्षर" अमीनो एसिड की वे कड़ियाँ हैं जो प्रोटीनों को बनाती हैं, जो प्रत्येक कोशिका के कार्यवाहक होते हैं। दशकों से, शोधकर्ताओं ने इन लुप्त शब्दों को भरने के लिए सांख्यिकीय मॉडलों (statistical models) का उपयोग किया है, यह मानते हुए कि श्रृंखला में प्रत्येक अक्षर दूसरे से स्वतंत्र रूप से बदलता है, जैसे कि एक वाक्य में एक शब्द को बिना पूरे अर्थ को प्रभावित किए बदला जा रहा हो। यह दृष्टिकोण लाखों वर्षों में प्रोटीन कैसे विकसित हुए, इसे समझने के लिए एक मानक उपकरण रहा है।
हालाँकि, जीव विज्ञान शायद ही कभी इतना सरल होता है। वास्तव में, एक प्रोटीन श्रृंखला में अक्षर अक्सर एक-दूसरे पर निर्भर होते हैं; एक अमीनो एसिड में बदलाव तभी सुरक्षित हो सकता है जब पास में कोई विशिष्ट बदलाव भी हुआ हो। यह जटिल परस्पर निर्भरता, जिसे एपिस्टेसिस (epistasis) कहा जाता है, पारंपरिक सांख्यिकीय उपकरणों के लिए पकड़ना कठिन है। हाल ही में, आर्टिफिशियल इंटेलिजेंस के एक नए युग के उपकरणों ने, विशेष रूप से 'वेरिएशनल ऑटोएनकोडर' (variational autoencoder) नामक एक प्रकार के डीप लर्निंग मॉडल ने, एक अलग मार्ग प्रदान किया है। ये मॉडल डेटा की विशाल मात्रा में छिपे हुए पैटर्न खोजने में उत्कृष्ट हैं। वे एक लंबी प्रोटीन अनुक्रम (sequence) को एक संक्षिप्त, गणितीय सारांश, या "एम्बेडिंग" (embedding) में संकुचित कर सकते हैं, और फिर उस सारांश से मूल अनुक्रम को पुनर्गठित करने का प्रयास करते हैं। क्योंकि ये मॉडल सीधे डेटा से सीखते हैं और उन्हें अक्षरों के बीच के संबंधों को अनदेखा करने के लिए नहीं बताया जाता है, इसलिए कई वैज्ञानिकों को उम्मीद थी कि वे एपिस्टेसिस की समस्या को हल कर सकेंगे और अभूतपूर्व सटीकता के साथ प्राचीन प्रोटीनों का पुनर्निर्माण कर सकेंगे।
शोधकर्ताओं की एक टीम ने इस उम्मीद का सीधे परीक्षण करने के लिए एक कार्यप्रणाली तैयार की। उन्होंने इन AI मॉडलों का उपयोग करके प्राचीन प्रोटीनों के अनुक्रमों का अनुमान लगाने के लिए एक पाइपलाइन बनाई। विचार सीधा था: हमारे पास आज जो आधुनिक प्रोटीन हैं उन्हें लें, उन्हें इन गणितीय सारांशों में संकुचित करें, और फिर प्रोटीनों के ज्ञात वंशावली वृक्ष (family tree) का उपयोग करके यह अनुमान लगाएं कि प्राचीन पूर्वजों के सारांश कैसे दिखते होंगे। एक बार जब उनके पास ये अनुमानित सारांश आ गए, तो वे वास्तविक अमीनो एसिड अनुक्रम उत्पन्न करने के लिए उन्हें वापस AI में फीड करेंगे। यदि यह सफल रहा, तो इसका अर्थ होगा कि डीप लर्निंग पारंपरिक सांख्यिकी की सीमाओं को पार कर सकती है और प्राचीन प्रोटीनों के वास्तविक इतिहास को प्रकट कर सकती है, भले ही वे इतिहास अणु के विभिन्न हिस्सों के बीच जटिल अंतःक्रियाओं द्वारा आकार दिए गए हों।
शोधकर्ताओं ने इस विचार का परीक्षण कंप्यूटर सिमुलेशन का उपयोग करके किया। उन्होंने हजारों नकली प्रोटीन परिवार बनाए जो समय के साथ विकसित हुए, पहले सरल, स्वतंत्र नियमों का उपयोग करके जिन्हें पारंपरिक मॉडल मानते हैं, और फिर जटिल नियमों का उपयोग करके जिनमें प्रकृति में पाए जाने वाले परस्पर निर्भर परिवर्तन शामिल थे। फिर उन्होंने इन नकली परिवारों के पूर्वजों के पुनर्निर्माण के लिए नए AI तरीके और स्थापित सांख्यिकीय तरीकों दोनों का उपयोग किया। परिणाम स्पष्ट और सुसंगत थे। हर परिदृश्य में, चाहे प्रोटीन सरल रूप से विकसित हुए हों या जटिल निर्भरताओं के साथ, पारंपरिक सांख्यिकीय तरीकों ने AI दृष्टिकोण से बेहतर प्रदर्शन किया। डीप लर्निंग मॉडल सटीक पूर्वज अनुक्रमों को बनाने में विफल रहा, यहाँ तक कि उन स्थितियों में भी जहाँ उसे चमकना चाहिए था।
अध्ययन यह समझने के लिए और गहराई में गया कि AI क्यों विफल हुआ। यह पता चला कि समस्या यह नहीं थी कि AI ने वंशावली वृक्ष की संरचना को मिस कर दिया। जब शोधकर्ताओं ने गणितीय सारांशों को देखा, तो उन्होंने पाया कि AI ने वास्तव में प्रोटीनों को इस तरह व्यवस्थित करने में सफलता पाई थी जो उनके विकासवादी संबंधों को दर्शाता है। विफलता स्वयं पुनर्निर्माण चरण में थी। AI मॉडल ने, डेटा को एक छोटे सारांश में संकुचित करने के प्रयास में, मूल अनुक्रम के सूक्ष्म विवरणों को अनिवार्य रूप से खो दिया। जब शोधकर्ताओं ने इन सारांशों से प्राचीन प्रोटीनों को फिर से बनाने की कोशिश की, तो जानकारी बहुत धुंधली थी। मॉडल उस सटीकता के साथ एक अनुक्रम उत्पन्न करने में सक्षम नहीं था जो वास्तविक इतिहास से मेल खा सके। यहाँ तक कि जब शोधकर्ताओं ने अधिक जानकारी रखने के लिए गणितीय सारांश का आकार बढ़ाया, तो लाभ बहुत कम थे, और मॉडल सामान्य विकास के नियमों को सीखने के बजाय आधुनिक प्रोटीनों को केवल याद करने (memorize) लगा।
शोधकर्ताओं ने AI का एक अधिक उन्नत संस्करण भी परखा जिसे प्रशिक्षण के दौरान स्पष्ट रूप से वंशावली वृक्ष सिखाया गया था। उन्हें उम्मीद थी कि यह अतिरिक्त मार्गदर्शन मदद करेगा, लेकिन इससे परिणामों में सुधार नहीं हुआ। मौलिक बाधा वही बनी रही: अनुक्रम को एक सारांश में संकुचित करने और फिर उसे वापस विस्तारित करने की प्रक्रिया अतीत का अनुमान लगाने के नाजुक कार्य के लिए बहुत अधिक सूचनात्मक नुकसान (lossy) वाली थी। अध्ययन यह निष्कर्ष निकालता है कि हालांकि ये AI एम्बेडिंग्स प्रोटीन परिवारों को देखने और आधुनिक प्रोटीनों के व्यवहार की भविष्यवाणी करने के लिए शक्तिशाली उपकरण हैं, लेकिन वे अभी तक अतीत के पुनर्निर्माण के लिए स्थापित सांख्यिकीय तरीकों को बदलने के लिए तैयार नहीं हैं। यह उम्मीद कि डीप लर्निंग जटिल विकासवादी अंतःक्रियाओं को सहजता से हल कर देगी, इस विशिष्ट अनुप्रयोग में, एक बंद गली (dead end) साबित हुई। पारंपरिक तरीके, अपनी सरल धारणाओं के बावजूद, जीवन के आणविक इतिहास को पढ़ने का अधिक विश्वसनीय तरीका बने हुए हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।