Efficient, Few-shot Directed Evolution with Energy Rank Alignment
यह शोध पत्र एक कुशल, फ्यू-शॉट निर्देशित विकास (डायरेक्टेड इवोल्यूशन) पद्धति प्रस्तुत करता है जो सांख्यिकीय भौतिकी-आधारित पोस्ट-ट्रेनिंग एल्गोरिदम का उपयोग करके बड़े पैमाने पर प्री-ट्रेंड प्रोटीन लैंग्वेज मॉडल्स को अनुकूलित करता है, ताकि विरल प्रयोगात्मक रैंकिंग से विविध, उच्च-फिटनेस वाले प्रोटीन अनुक्रम उत्पन्न किए जा सकें और साथ ही उनके बायोफिजिकल गुणों में व्याख्यात्मक अंतर्दृष्टि प्रदान की जा सके।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप केक की एक बेहतरीन रेसिपी खोजने की कोशिश कर रहे हैं, लेकिन आपके पास कोई कुकबुक नहीं है। इसके बजाय, आपको हजारों केक बनाने होंगे, उन्हें चखना होगा, और जो सबसे अच्छे हों उन्हें अगले दौर के लिए सुधारने के लिए रखना होगा। प्रोटीन इंजीनियरिंग में निर्देशित विकास (directed evolution) मूल रूप से इसी तरह काम करता है: वैज्ञानिक लैब में कई विविधताओं का परीक्षण करके बेहतर प्रोटीन को "विकसित" करने की कोशिश करते हैं। हालाँकि, हर एक संभावना को बेक करना (या टेस्ट करना) अविश्वसनीय रूप से महंगा, समय लेने वाला और धीमा है।
हाल ही में, वैज्ञानिकों ने यह अनुमान लगाने के लिए AI का उपयोग करने की कोशिश की कि परीक्षण करने से पहले कौन सी केक रेसिपी सबसे अच्छी लगेगी। इसने मदद तो की, लेकिन इसमें एक पेंच था: AI के पास परीक्षण के प्रत्येक दौर से बहुत कम डेटा था। यह ऐसा था जैसे किसी शेफ को केवल तीन टेस्ट टेस्ट के आधार पर सिखाना; AI को बहुत सरल होना पड़ा और वह बहुत अधिक सीख नहीं सका।
यह पेपर AI का उपयोग करने का एक स्मार्ट तरीका पेश करता है, विशेष रूप से एक प्रकार का AI जिसे प्रोटीन लैंग्वेज मॉडल कहा जाता है। इस मॉडल को एक ऐसे शेफ के रूप में सोचें जिसने अब तक की सभी कुकबुक्स पढ़ ली हैं और उसे पता है कि प्रोटीन स्वाभाविक रूप से कैसे काम करते हैं, उनकी "व्याकरण" क्या है। शून्य से शुरुआत करने के बजाय, शोधकर्ता इस विशेषज्ञ शेफ को वर्तमान प्रोजेक्ट से कुछ विशिष्ट टेस्ट टेस्ट (प्रायोगिक डेटा) देते हैं।
यहाँ उनका तरीका दिया गया है, कुछ उपमाओं का उपयोग करते हुए:
- "पोस्ट-ट्रेनिंग" ट्यून-अप: AI को उस छोटे से डेटासेट से सब कुछ सीखने के लिए मजबूर करने के बजाय, वे एक विशेष एल्गोरिदम (भौतिकी के नियमों पर आधारित) का उपयोग करते हैं ताकि विशेषज्ञ शेफ की सहज बुद्धि को धीरे से "ट्यून" किया जा सके। यह एक विश्व स्तरीय संगीतकार को कुछ विशिष्ट नोट्स देने जैसा है जिन्हें बजाना है; वे शैली को तुरंत समझ जाते हैं और बिना पूरा संगीत सुने भी, पूरी तरह से फिट बैठने वाला एक नया गाना बनाना शुरू कर देते हैं।
- स्कोरिंग के बजाय रैंकिंग: AI केवल एक प्रोटीन के लिए एक एकल "स्कोर" का अनुमान नहीं लगाता है। इसके बजाय, यह लैब द्वारा प्रदान की गई रैंकिंग को देखता है (जैसे, "रेसिपी A, B से बेहतर थी, जो C से बेहतर थी")। इन रैंकिंग का उपयोग करके, AI नए, विविध और उच्च गुणवत्ता वाले प्रोटीन रेसिपी का एक "मेन्यू" तैयार करना सीखता है।
- कम सामग्रियों की आवश्यकता: सबसे बड़ी जीत दक्षता है। क्योंकि AI पहले से ही प्रोटीनों की "भाषा" जानता है, इसलिए इसे अन्य तरीकों की तुलना में जीतने वाली रेसिपी खोजने के लिए बहुत कम प्रायोगिक टेस्ट टेस्ट की आवश्यकता होती है। यह संभावित प्रोटीनों के विशाल और जटिल परिदृश्य में बहुत आसानी से रास्ता खोज लेता है।
अंत में, पेपर में उल्लेख किया गया है कि क्योंकि यह अनुकूलित AI प्रोटीन जीवन के प्राकृतिक नियमों पर बना है, इसलिए वैज्ञानिक यह समझने के लिए इसके "मस्तिष्क" के भीतर देख सकते हैं कि कुछ प्रोटीन इतने अच्छे क्यों काम करते हैं। यह उन भौतिक विशेषताओं पर प्रकाश डालता है जो एक प्रोटीन को सफल बनाते हैं, और जीव विज्ञान पर एक आवर्धक लेंस की तरह काम करता है।
संक्षेप में: शोधकर्ताओं ने एक तरीका खोजा है जिससे वे एक सुपर-स्मार्ट AI का उपयोग कर सकते हैं जो पहले से जानता है कि प्रोटीन कैसे काम करते हैं, उन्हें कुछ वास्तविक दुनिया के संकेत दें, और पहले की तुलना में बहुत कम लैब वर्क के साथ सबसे अच्छे नए प्रोटीन डिजाइन तेजी से तैयार कर सकें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।