High Diversity Gene Libraries Facilitate Machine Learning Guided Exploration of Fluorescent Protein Sequence Space
यह अध्ययन प्रदर्शित करता है कि बड़े पैमाने पर जीन संश्लेषण और डीएनए शफलिंग के माध्यम से प्रशिक्षण डेटा की विविधता का प्रयोगात्मक रूप से विस्तार करना मशीन लर्निंग मॉडलों को एक्सट्रपलेशन (extrapolation) सीमाओं को पार करने में सक्षम बनाता है, जिससे अनुक्रम स्थान (sequence space) के पहले से अनछुए क्षेत्रों में नवीन कार्यात्मक फ्लोरोसेंट प्रोटीन की खोज को सफलतापूर्वक निर्देशित किया जा सकता है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट शेफ को एक आदर्श ब्लूबेरी पाई (blueberry pie) बनाना सिखाने की कोशिश कर रहे हैं।
समस्या: रोबोट केवल एक ही रेसिपी जानता है
प्रोटीन इंजीनियरिंग की दुनिया में (नए जैविक अणु बनाना), वैज्ञानिक नए प्रोटीन डिजाइन करने के लिए आर्टिफिशियल इंटेलिजेंस (AI) का उपयोग करते हैं। इस AI को उस रोबोट शेफ की तरह समझें। समस्या यह है कि रोबोट ने अब तक केवल कुछ सौ "ब्लूबेरी पाई" (प्राकृतिक फ्लोरोसेंट प्रोटीन) की रेसिपी ही देखी हैं।
यदि आप रोबोट से एक नया पाई बनाने के लिए कहते हैं जो थोड़ा अलग हो, तो वह इसमें अच्छा है। लेकिन यदि आप उसे एक ऐसा नया पाई बनाने के लिए कहते हैं जो पूरी तरह से अनोखा हो—कुछ ऐसा जिसे दुनिया ने पहले कभी नहीं देखा—तो वह भ्रमित हो जाता है। वह उन कुछ रेसिपीज़ के आधार पर अनुमान लगाने की कोशिश करता है जिन्हें वह जानता है, लेकिन क्योंकि वे रेसिपीज़ आपस में बहुत समान हैं, इसलिए रोबोट अनिवार्य रूप से अंधेरे में तीर चला रहा है। वैज्ञानिक शब्दों में, AI एक्सट्रपलेशन (extrapolate) (अपने अनुभव से बाहर जाकर अनुमान लगाना) करने की कोशिश कर रहा है, जो जोखिम भरा है और अक्सर विफल हो जाता है।
समाधान: एक विशाल, विविध लाइब्रेरी बनाना
शोधकर्ताओं ने पूछा: "क्या होगा अगर हम रोबोट को केवल अधिक रेसिपी न दें? क्या होगा अगर हम उसे लाखों अलग-अलग पाई वेरिएशंस की एक लाइब्रेरी दें, जिसमें कुछ ऐसे भी हों जो पूरी तरह से अलग प्रकार के पाई के अवयवों (ingredients) को मिलाते-जुलते हों?"
उन्होंने इसे कैसे किया, चरण-दर-चरण यहाँ दिया गया है:
1. "ड्रॉपसिंथ" (DropSynth) बेकरी (सामग्री एकत्र करना)
सबसे पहले, उन्होंने डेटाबेस से 620 अलग-अलग ज्ञात नीले और हरे फ्लोरोसेंट प्रोटीन (वे "पाई रेसिपीज़") लिए। DropSynth नामक एक उच्च-तकनीकी विधि का उपयोग करके, उन्होंने प्रयोगशाला में इन जीन (genes) को संश्लेषित किया।
- उपमा: कल्पना कीजिए कि उन्होंने केवल रेसिपी की फोटोकॉपी नहीं की; उन्होंने उन्हें दो अलग-अलग भाषाओं (कोडोन वर्शन्स) में प्रिंट किया ताकि सुनिश्चित किया जा सके कि उन्हें "बेकर" (बैक्टीरिया) द्वारा बिना किसी अनुवाद त्रुटि के पढ़ा जा सके। इसने एक विशाल, विविध शुरुआती लाइब्रेरी बनाई।
2. "डीएनए शफल" (DNA Shuffle) मिक्सर (नए संयोजन बनाना)
इसके बाद, उन्होंने DNA Shuffling नामक तकनीक का उपयोग किया। उन्होंने उन सभी अलग-अलग प्रोटीन जीन को लिया, उन्हें पहेली के टुकड़ों की तरह छोटे-छोटे हिस्सों में काटा, और फिर उन्हें बेतरतीब ढंग से पुनर्गठित किया।
- उपमा: कल्पना कीजिए कि आप एक ब्लूबेरी पाई के क्रस्ट (crust) को लेते हैं, चेरी पाई की फिलिंग लेते हैं, और लेमन मेरिंग्यू पाई की टॉपिंग लेते हैं, और उन्हें यह देखने के लिए आपस में मिला देते हैं कि क्या होता है।
- परिणाम: इससे लाखों "काइमेरिक" (chimeric) प्रोटीन बने—नए, अजीब संयोजन जिन्हें प्रकृति ने कभी नहीं बनाया। इनमें से अधिकांश नए निर्माण बेकार थे (वे चमकते नहीं थे), लेकिन कुछ आश्चर्यजनक रूप से कार्यात्मक थे। यह चरण महत्वपूर्ण था क्योंकि इसने ज्ञात रेसिपीज़ के बीच के "अंतरालों" को भर दिया, जिससे AI के भविष्य के काम को "अंधेरे में अनुमान लगाने" से बदलकर "बिंदुओं को जोड़ने" में बदल दिया।
3. "ब्लू लाइट" फ़िल्टर (विजेताओं को चुनना)
उन्होंने इन लाखों नए प्रोटीन मिश्रणों को बैक्टीरिया में डाला और उन पर नीली रोशनी डाली। उन्होंने एक FACS सॉर्टर (सोचिए कि यह एक क्लब के हाई-स्पीड बाउंसर की तरह है) का उपयोग किया ताकि केवल उन्हीं बैक्टीरिया को चुना जा सके जो चमकीले नीले रंग में चमकते थे।
- उपमा: कल्पना कीजिए कि एक मिलियन लोगों वाला एक विशाल डांस फ्लोर है। आप केवल उन लोगों को चाहते हैं जिन्होंने नीले जूते पहने हैं। आप बाकी सबको बाहर निकाल देते हैं, और केवल नीले जूते पहनने वाले ही रुक पाते हैं।
- परिणाम: अंत में उनके पास हजारों काम करने वाले नीले प्रोटीनों की एक क्यूरेटेड सूची थी। महत्वपूर्ण बात यह है कि ये केवल मूल प्रोटीनों के मामूली बदलाव नहीं थे; वे जंगली, नए संयोजन थे जिन्हें AI ने पहले कभी नहीं देखा था।
4. AI को सिखाना (फाइन-ट्यूनिंग)
अब, उन्होंने इस विशाल, विविध काम करने वाले नीले प्रोटीनों की सूची को AI मॉडल (ProtGPT2) में फीड किया।
- बदलाव: चूंकि AI ने अब बहुत सारे विविध सफल नीले प्रोटीनों को देख लिया था, इसलिए उसने अनुमान लगाना बंद कर दिया। उसने "नियमों" को सीख लिया कि क्या चीज़ एक प्रोटीन को नीला चमकाती है, भले ही रेसिपी बहुत अजीब क्यों न दिखे। यह एक्सट्रपलेशन (अनुमान लगाने) से इंटरपोलेशन (ज्ञात डेटा के बीच के खाली स्थानों को भरने) की ओर बढ़ गया।
5. AI के नए मास्टरपीस
इसके बाद AI ने 1,500 बिल्कुल नए प्रोटीन डिज़ाइन तैयार किए।
- आश्चर्य: जब वैज्ञानिकों ने इन AI डिजाइनों को लैब में बनाया, तो वे वास्तव में काम कर गए! वे नीले रंग में चमक रहे थे।
- जादू: जब उन्होंने इन नए प्रोटीनों की संरचना को देखा, तो उन्हें एहसास हुआ कि AI ने ऐसी चीजें बनाई हैं जो किसी भी प्राकृतिक प्रोटीन जैसी नहीं दिखती थीं। वे "एलियन" पाई की तरह थे जो किसी तरह एकदम सही स्वाद देते थे। इनमें से कुछ डिज़ाइन इतने अलग थे कि मानक कंप्यूटर प्रोग्राम भी यह अनुमान नहीं लगा सकते थे कि वे कैसे फोल्ड होंगे, फिर भी वे काम कर गए।
मुख्य निष्कर्ष
यह पेपर यह सिद्ध करता है कि आप केवल AI को स्मार्ट होने पर निर्भर नहीं रह सकते; आपको उसे एक बेहतर शिक्षा देनी होगी।
प्रायोगिक डेटा (शफल किए गए प्रोटीन) की एक विशाल, विविध लाइब्रेरी सक्रिय रूप से बनाकर, शोधकर्ताओं ने एक कठिन समस्या (नए प्रोटीन का अनुमान लगाना) को एक आसान समस्या (उन बिंदुओं को जोड़ना जिन्हें वे पहले से जानते थे) में बदल दिया।
संक्षेप में:
- पुराना तरीका: AI को कुछ रेसिपी दें और उससे एक नई रेसिपी बनाने के लिए कहें। (यह विफल हो जाता है या अजीब, टूटी हुई चीजें बनाता है)।
- नया तरीका: पहले अजीब, काम करने वाली रेसिपी की एक विशाल लाइब्रेरी बनाएं। AI को उन सभी को सिखाएं। फिर, AI को एक नई रेसिपी बनाने के लिए कहें। (यह सफल होता है और ऐसी चीजें बनाता है जो प्रकृति ने कभी नहीं सोचीं)।
यह दृष्टिकोण दवाओं, सेंसरों और सामग्रियों के लिए प्रोटीन डिजाइन करने के द्वार खोलता है जो आज के समय में प्रकृति में पाए जाने वाले किसी भी चीज़ से कहीं अधिक उन्नत हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।