Additive-input encoding fails operator-level target-held-out prediction on current Perturb-seq screens
यह अध्ययन प्रदर्शित करता है कि वर्तमान पर्टर्ब-seq (Perturb-seq) स्क्रीन्स में उपयोग किए जाने वाले एडिटिव-इनपुट एनकोडिंग मॉडल नए, होल्ड-आउट पर्टर्बेशन लक्ष्यों (held-out perturbation targets) के लिए सामान्यीकरण करने में विफल रहते हैं, जो यह प्रकट करता है कि अनुमानित नियामक ऑपरेटरों (regulatory operators) को उनकी गणितीय पहचान क्षमता (mathematical identifiability) के बावजूद अनदेखे जीनों के प्रति प्रतिक्रियाओं की भविष्यवाणी करने के लिए सत्यापित नहीं किया गया है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें
एक ऐसी दुनिया की कल्पना करें जहाँ वैज्ञानिक एक ही समय में एक कोशिका के व्यक्तिगत जीन को बंद कर सकते हैं और देख सकते हैं कि क्या होता है। यह 'परटर्ब-seq' (Perturb-seq) नामक एक तकनीक का वादा है। विशिष्ट जीन को शांत करने के लिए एक आणविक उपकरण का उपयोग करके और फिर कोशिका की संपूर्ण आनुवंशिक प्रतिक्रिया को पढ़कर, शोधकर्ता यह मानचित्र बनाने की आशा करते हैं कि जीन आपस में कैसे संवाद करते हैं। इसका अंतिम लक्ष्य जीवन के छिपे हुए नियमों को समझना है: यदि आप एक धागे को खींचते हैं, तो कौन से अन्य धागे कस जाते हैं, और कौन से ढीले हो जाते हैं? वर्षों से, इन विशाल प्रयोगों की व्याख्या करने का मानक तरीका यह रहा है कि यह मान लिया जाता है कि कोशिका की प्रतिक्रिया हिस्सों का एक सरल योग है। विचार यह है कि यदि आप जीन A को बंद करते हैं, तो यह परिवर्तन की एक विशिष्ट मात्रा जोड़ता है; यदि आप जीन B को बंद करते हैं, तो यह एक और विशिष्ट मात्रा जोड़ता है। यदि आप दोनों को बंद करते हैं, तो परिणाम केवल उन दो परिवर्तनों का योग होना चाहिए। यह "योगात्मक" (additive) दृष्टिकोण आकर्षक है क्योंकि यह गणितीय रूप से स्वच्छ और गणना करने में आसान है, जिससे वैज्ञानिक कोशिका के आंतरिक वायरिंग का एक मास्टर कंट्रोल मैप निकाल सकते हैं।
हालाँकि, ब्रिघम यंग यूनिवर्सिटी के शोधकर्ताओं के एक नए अध्ययन से पता चलता है कि वास्तविक जैविक डेटा पर लागू होने पर यह सरल योग नियम मौलिक रूप से टूट सकता है। ब्रिगहम यंग यूनिवर्सिटी के कायलर फुलमर, डाल्टन कुत्ज़ेन और टॉमी डब्ल्यू. टेरोटेया के नेतृत्व वाली टीम ने अब तक किए गए सबसे बड़े और सबसे सम्मानित जीन-साइलेंसिंग प्रयोगों में से तीन को लिया और परीक्षण किया कि क्या योगात्मक मॉडल वास्तव में उस जीन के व्यवहार की भविष्यवाणी कर सकता था जिसे शोधकर्ताओं ने पहले कभी नहीं देखा था। उन्होंने केवल डेटा को नहीं देखा; उन्होंने एक कठोर परीक्षण स्थल बनाया ताकि यह देखा जा सके कि क्या मॉडल सामान्यीकृत (generalize) हो सकता है। उन्होंने एक सीधा सवाल पूछा: यदि एक कंप्यूटर ज्ञात जीनों के एक सेट से खेल के नियमों को सीखता है, तो क्या वह एक बिल्कुल नए जीन के लिए परिणाम का सही अनुमान लगा सकता है जिसे उसने पहले कभी नहीं देखा?
इसका उत्तर, उन्होंने पाया, एक जोरदार 'ना' था। जब शोधकर्ताओं ने योगात्मक मॉडल का उपयोग अनदेखे जीनों के व्यवहार की भविष्यवाणी करने के लिए किया, तो मॉडल पूरी तरह विफल रहा। वास्तव में, मॉडल का प्रदर्शन उस व्यक्ति से भी बेहतर नहीं था जो केवल यह अनुमान लगाता कि कुछ भी नहीं बदलेगा। यह सुनिश्चित करने के लिए कि यह विफलता केवल एक इत्तेफाक या अव्यवस्थित डेटा का परिणाम नहीं थी, टीम ने एक आदर्श सिमुलेशन बनाया। उन्होंने नकली डेटा उत्पन्न किया जहाँ नियम पूरी तरह से योगात्मक थे, ठीक वैसे ही जैसे सिद्धांत दावा करता है। जब उन्होंने इस नकली डेटा पर अपना मॉडल चलाया, तो यह बहुत खूबसूरती से काम कर गया, और इसने छिपे हुए नियमों को उच्च सटीकता के साथ पुनः प्राप्त किया। इसने सिद्ध किया कि उनकी परीक्षण पद्धति सुदृढ़ थी और कंप्यूटर सीखने में सक्षम था। इसलिए, समस्या गणित या डेटा के शोर (noise) के साथ नहीं थी, बल्कि इस धारणा के साथ थी कि वास्तविक कोशिकाएं सरल योग की तरह व्यवहार करती हैं।
शोधकर्ताओं ने तीन अलग-अलग डेटासेट पर इसका परीक्षण किया: मानव कोशिकाओं को डिश में उगाकर किए गए दो बड़े स्क्रीन और एक जिसने जीन-साइलेंसिंग के विभिन्न डोज़ का परीक्षण किया। हर मामले में, मॉडल जिसने माना कि जीन बस अपने प्रभावों को जोड़ते हैं, एक नए जीन के परिणाम की भविष्यवाणी करने में विफल रहा। त्रुटि दर इतनी अधिक थी कि मॉडल की भविष्यवाणियां यादृच्छिक अनुमान (random guessing) से अलग नहीं थीं। टीम ने इस विफलता के कई संभावित कारणों को खारिज कर दिया। उन्होंने यह जांचा कि क्या समस्या अध्ययन के लिए "सबसे आसान" जीन चुनने से हुई थी, और पाया कि जब उन्होंने यादृछिक रूप से जीन चुने, तब भी मॉडल विफल रहा। उन्होंने यह भी जांचा कि क्या समस्या अध्ययन किए जा रहे जीनों की संख्या या जीनों को मापने के विशिष्ट तरीके के कारण थी, और पाया कि विफलता इन कारकों के बावजूद बनी रही। यहाँ तक कि जब उन्होंने जीन साइलेंसिंग की मजबूती के विवरण को हटा दिया और केवल परिवर्तन की दिशा को देखा, तब भी मॉडल परिणाम की भविष्यवाणी करने में विफल रहा।
उम्मीद की एक छोटी सी किरण भी मिली, लेकिन वह मामूली थी। कोशिकाओं के एक विशिष्ट सेट पर, मॉडल नए जीनों के परिणाम की औसत परिणाम के अनुमान से थोड़ा बेहतर भविष्यवाणी कर सका। हालाँकि, इस सर्वोत्तम स्थिति में भी, मॉडल ने केवल सात प्रतिशत सूचना को ही पुनः प्राप्त किया जो एक पूर्ण, सुव्यवस्थित प्रणाली प्रदान करती। यह एक असफल समुद्र में एक छोटी सी जीत थी। शोधकर्ताओं ने जीन की जानकारी को एन्कोड करने के अधिक परिष्कृत तरीकों का भी परीक्षण किया, जिसमें वे तरीके शामिल थे जो देखते थे कि जीन कोशिका के प्राकृतिक अवस्था में कैसे जुड़े हुए हैं या डेटा से जीन के "फिंगरप्रिंट" को सीखने के लिए मशीन लर्निंग का उपयोग करते हैं। इनमें से कोई भी उन्नत विधि मौलिक समस्या को दूर करने में सक्षम नहीं थी। वे परीक्षण किए गए तीन सेल प्रकारों में से दो पर नए जीन की भविष्यवाणी करने में विफल रहे, और तीसरे पर, वे केवल एक छोटा सा सुधार करने में सफल रहे जो सिद्धांत के वादे से बहुत दूर था।
अध्ययन निष्कर्ष निकालता है कि इन विशाल जीन-साइलेंसिंग स्क्रीन्स की व्याख्या करने का वर्तमान तरीका संभवतः त्रुटिपूर्ण है। यह धारणा कि जीन स्वतंत्र स्विच के रूप में कार्य करते हैं जो केवल अपने प्रभावों को जोड़ते हैं, अनदेखे लक्ष्यों के विरुद्ध परीक्षण किए जाने पर टिक नहीं पाती है। शोधकर्ता इसके दो मुख्य कारणों का सुझाव देते हैं। पहला, जिस तरह से वे एक जीन की पहचान को गणितीय इनपुट में बदलते हैं, वह अधिकांश महत्वपूर्ण जानकारी को फेंक देता है, जैसे कि एक जटिल परिदृश्य को केवल एक धुंधली फोटो देखकर वर्णित करना। दूसरा, जैविक वास्तविकता यह हो सकती है कि जीन सरल, रैखिक (linear) तरीके से कार्य नहीं करते हैं; इसके बजाय, उनके प्रभाव संतृप्त (saturate) हो सकते हैं या एक सीमा (threshold) तक पहुँच सकते हैं, जिसका अर्थ है कि एक जीन को बंद करने से एक स्थिर, अनुमानित परिवर्तन नहीं होता है।
यह कार्य यह नहीं कहता कि जीन-साइलेंसिंग स्क्रीन बेकार हैं, लेकिन यह यह जरूर कहता है कि अब तक हमने उनसे जो मानचित्र बनाए हैं, वे नए जीनों को लक्षित करने पर क्या होगा, इसकी भविष्यवाणी करने के लिए विश्वसनीय मार्गदर्शक नहीं हो सकते हैं। शोधकर्ताओं ने अन्य वैज्ञानिकों की मदद के लिए एक नया टूलकिट जारी किया है ताकि वे अपने स्वयं के मॉडलों को इन कड़े मानकों के विरुद्ध जांच सकें, जिससे यह सुनिश्चित हो सके कि भविष्य की खोजें ठोस आधार पर बनी हों। सबक स्पष्ट है: जीव विज्ञान अक्सर हमारी सरलतम समीकरणों की तुलना में अधिक जटिल होता है, और जब तक हम उस जटिलता को पकड़ने का तरीका नहीं खोज लेते, तब तक नए हस्तक्षेपों के प्रति कोशिकाएं कैसी प्रतिक्रिया देंगी, इसकी हमारी भविष्यवाणियां अनिश्चित रहेंगी।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।