← नवीनतम पेपर
🤖 machine learning

Towards A Generative Protein Evolution Machine with DPLM-Evo

यह शोध पत्र DPLM-Evo को प्रस्तुत करता है, जो एक नवीन विकासवादी डिस्क्रीट डिफ्यूजन फ्रेमवर्क (evolutionary discrete diffusion framework) है, जो एक डिकपल्ड लेटेंट स्पेस (decoupled latent space) के भीतर प्रतिस्थापन (substitution), प्रविष्टि (insertion) और विलोपन (deletion) कार्यों को स्पष्ट रूप से मॉडल करके प्रोटीन जनरेशन को जैविक अंतर्ज्ञान के साथ संरेखित करता है, जिससे यह अत्याधुनिक उत्परिवर्तन भविष्यवाणी (mutation prediction) प्राप्त करता है और लचीला, परिवर्तनशील-लंबाई वाला प्रोटीन डिज़ाइन सक्षम करता है।

मूल लेखक: Xinyou Wang, Liang Hong, Jiasheng Ye, Zaixiang Zheng, Yu Li, Shujian Huang, Quanquan Gu

प्रकाशित 2026-05-04
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xinyou Wang, Liang Hong, Jiasheng Ye, Zaixiang Zheng, Yu Li, Shujian Huang, Quanquan Gu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य चित्र: AI को प्रोटीन को "एडिट" करना सिखाना, ठीक वैसे ही जैसे प्रकृति करती है

कल्पना कीजिए कि प्रोटीन 20 अक्षरों वाली वर्णमाला (अमीनो एसिड) में लिखे गए लंबे वाक्यों की तरह हैं। दशकों से, वैज्ञानिक कंप्यूटर को नए, कार्यात्मक प्रोटीन वाक्य लिखना सिखाने की कोशिश कर रहे हैं।

अधिकांश वर्तमान AI मॉडल "मैड लिब्स" (Mad Libs) खेल की तरह काम करते हैं। वे एक वाक्य लेते हैं, कुछ शब्दों को काले बक्सों (मास्क) से ढक देते हैं, और AI से पूछते हैं कि उन बक्सों में क्या होना चाहिए। हालांकि यह खाली जगहों को भरने के लिए अच्छा काम करता है, लेकिन यह वास्तव में इस बात की नकल नहीं करता कि प्रकृति वास्तव में कैसे विकसित होती है। प्रकृति में, विकास केवल शब्दों को बदलने के बारे में नहीं है; यह नए शब्द जोड़ने, पुराने शब्दों को हटाने और वाक्य की लंबाई बदलने के बारे में है ताकि वह बेहतर काम कर सके।

DPLM-Evo एक नया AI मॉडल है जो "मैड लिब्स" खेलना बंद करता है और एक वास्तविक संपादक (Editor) की तरह काम करना शुरू करता है। यह स्पष्ट रूप से प्रतिस्थापित करने (अक्षर बदलना), सम्मिलित करने (अक्षर जोड़ना), और हटाने (अक्षर हटाना) को सीखता है, ठीक वैसे ही जैसे जैविक विकास करता है।


मुख्य समस्या: "निश्चित-आकार का कैनवास" जाल

मौजूदा प्रोटीन AI मॉडलों को एक निश्चित-आकार के कैनवास पर काम करने वाले कलाकारों के रूप में सोचें। वे चाहे जो भी पेंट करें, कैनवास का आकार हमेशा एक जैसा रहता है। यदि प्रकृति किसी लूप को लंबा बनाने के लिए कुछ अतिरिक्त अमीनो एसिड जोड़कर प्रोटीन को विकसित करना चाहती है, तो ये मॉडल संघर्ष करते हैं क्योंकि वे कैनवास को फैला नहीं सकते। उन्हें लंबाई को समान रखने के लिए मजबूर किया जाता है, जो उनके "विकास" को कितना वास्तविक बना सकता है, इसकी सीमा तय कर देता है।

समाधान: "विस्तार योग्य स्केचबुक" (Latent Alignment)

DPLM-Evo इसे लेटेंट अलाइनमेंट (Latent Alignment) नामक एक चतुर तकनीक का उपयोग करके हल करता है।

कल्पना कीजिए कि आपके पास एक स्केचबुक है जहाँ हर पन्ने पर हर एक अक्षर के बीच अतिरिक्त खाली जगह (गैप्स) बनी हुई है।

  • देखा गया अनुक्रम (Observed Sequence): यह वह अंतिम वाक्य है जिसे आप देखते हैं (जैसे, "CAT")।
  • लेटेंट स्पेस (Latent Space): यह गैप्स वाला स्केचबुक पेज है (जैसे, "C _ A _ T _")।

AI अपना भारी काम इस "गैप्स वाले स्केचबुक" पर करता है।

  1. सम्मिलित करने के लिए (To Insert): AI बस एक खाली गैप _ को एक अक्षर में बदल देता है। वाक्य लंबा हो जाता है।
  2. हटाने के लिए (To Delete): AI एक अक्षर को खाली गैप _ में बदल देता है। वाक्य छोटा हो जाता है।
  3. प्रतिस्थापित करने के लिए (To Substitute): AI एक अक्षर को दूसरे अक्षर से बदल देता है।

क्योंकि AI गैप्स वाले स्केचबुक पर काम करता है, इसलिए यह गणित को तोड़े बिना प्रोटीन को स्वाभाविक रूप से बढ़ा या घटा सकता है। यह एक अक्षरों की चुंबकीय पट्टी की तरह है जहाँ आप नए अक्षरों को अंदर खिसका सकते हैं या पुराने को बाहर निकाल सकते है, बजाय इसके कि आप एक कठोर ग्रिड में फंसे रहें।

"स्मार्ट नॉइज़" इंजन

इन मॉडलों को प्रशिक्षित करते समय, कंप्यूटर आमतौर पर एक साफ प्रोटीन लेता है और उसमें "नॉइज़" (यादृच्छिक परिवर्तन) जोड़ता है, फिर उसे वापस ठीक करना सीखने की कोशिश करता है।

  • पुराना तरीका (Uniform Noise): एक प्रोटीन पर निशाना साधकर किसी भी अन्य अक्षर को यादृच्छिक रूप से बदलने की कल्पना करें। यह एक "ल्यूसीन" (एक वसायुक्त, तैलीय अमीनो एसिड) को "आर्जिनिन" (एक आवेशित, नमकीन एक) में बदलने जैसा है। जीव विज्ञान में, यह अक्सर एक आपदा होती है जो प्रोटीन को तोड़ देती है। यह कार के इंजन को ठीक करने के लिए टायर को टोस्टर से बदलने जैसा है।
  • DPLM-Evo का तरीका (Contextualized Evolutionary Noise): यह मॉडल एक स्मार्ट नॉइज़ इंजन का उपयोग करता है। कोई बदलाव करने से पहले, यह आसपास के अक्षरों को देखता है और पूछता है, "प्रकृति यहाँ क्या करेगी?" यह केवल उन्हीं परिवर्तनों का सुझाव देता है जो जैविक रूप से संभव हों (जैसे एक तैलीय अक्षर को दूसरे तैलीय अक्षर से बदलना)।

यह एक ट्यूटर (शिक्षक) की तरह है जो व्याकरण और भौतिकी के नियमों को जानता है, बजाय उस यादृच्छिक व्यक्ति के जो डार्ट फेंक रहा है। AI तेजी से सीखता है और जीवन के "नियमों" को बेहतर समझता है क्योंकि जो गलतियाँ वह ठीक करने की कोशिश करता है, वे वास्तविक हैं, असंभव नहीं।

यह मॉडल वास्तव में क्या कर सकता है?

यह पेपर तीन मुख्य महाशक्तियों का प्रदर्शन करता है:

  1. उत्परिवर्तन (Mutations) की भविष्यवाणी करना (द क्रिस्टल बॉल):
    यदि आप मॉडल को एक प्रोटीन देते हैं और पूछते हैं, "क्या होगा यदि मैं इस एक अक्षर को बदल दूँ?" तो यह लगभग किसी भी अन्य एकल-अनुक्रम मॉडल की तुलना में प्रभाव की बेहतर भविष्यवाणी करता है। यह इतना अच्छा है कि यह जटिल 3D संरचना डेटा का उपयोग करने वाले मॉडलों को भी मात दे देता है, केवल विकास की "भाषा" को समझकर।

  2. प्रोटीन को बढ़ाना और सिकोड़ना (द शेप-शिफ्टर):
    चूंकि यह सम्मिलित और हटा सकता है, इसलिए यह विभिन्न लंबाई के प्रोटीन उत्पन्न कर सकता है। आप इसे 100-अक्षर वाले प्रोटीन से शुरू करने और इसे 120-अक्षर के प्रोटीन में विकसित करने, या 90 तक सिकोड़ने के लिए कह सकते हैं, जबकि मूल संरचना को बरकरार रखा जाए। यह एक मूर्तिकार की तरह है जो आकार बदलने के लिए मिट्टी जोड़ सकता है या उसे तराश कर निकाल सकता है, बजाय इसके कि वह केवल एक निश्चित ब्लॉक पर पेंट करे।

  3. मौजूदा प्रोटीनों को अनुकूलित करना (द ट्यूनर):
    लेखकों ने इसका परीक्षण ग्रीन फ्लोरोसेंट प्रोटीन (GFP) पर किया, जो एक प्रोटीन है जो हरा चमकता है। उन्होंने कंप्यूटर सिमुलेशन में प्रोटीन को "प्रत्यक्ष रूप से विकसित" करने के लिए मॉडल का उपयोग किया।

    • उन्होंने मूल GFP से शुरुआत की।
    • मॉडल ने छोटे बदलाव किए (बदलाव, जोड़, हटाना)।
    • उन्होंने सबसे अच्छे संस्करणों को रखा और प्रक्रिया को दोहराया।
    • परिणाम: मॉडल ने GFP का एक ऐसा संस्करण बनाया जो मूल की तुलना में काफी अधिक स्थिर (मजबूत संरचना) था, और इसने यह पिछले तरीकों की तुलना में अधिक तेज़ी से किया। यह कान से गिटार के तार को तब तक ट्यून करने जैसा है जब तक कि स्वर एकदम सही न हो जाए, बजाय इसके कि केवल रैंडम तारों का अनुमान लगाया जाए।

सारांश

DPLM-Evo एक नया उपकरण है जो AI को सिखाता है कि प्रोटीन विकास को खाली स्थान भरने के खेल के रूप में नहीं, बल्कि एडिट करने, जोड़ने और हटाने की एक गतिशील प्रक्रिया के रूप में समझा जाए। एक लचीली "स्केचबुक" प्रणाली और प्रशिक्षण के लिए "स्मार्ट ट्यूटर" का उपयोग करके, यह अधिक वास्तविक, विविध और अनुकूलित प्रोटीन बनाता है, जो कंप्यूटर विज्ञान और जिस तरह से प्रकृति वास्तव में जीवन का निर्माण करती है, उसके बीच के अंतर को पाटता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →