← नवीनतम पेपर
💻 computer science

DynaPPI: A Large-scale Dynamic Protein Dataset for AI-driven Advances in Protein Interactomics

यह शोध पत्र DynaPPI प्रस्तुत करता है, जो आणविक गतिशीलता (molecular dynamics) के प्रक्षेप पथों का एक बड़े पैमाने का डेटासेट है जो प्रोटीन परिसरों के गतिशील निर्माण को कैप्चर करता है, ताकि डिफ्यूजन मॉडल बाइंडिंग प्रक्रियाओं को सीख सकें और अज्ञात मल्टी-चेन प्रोटीन एग्रीगेट्स की संरचनाओं की सटीक भविष्यवाणी कर सकें।

मूल लेखक: Jiabao Wei, Zilong Geng, Yuze Wang, Jianjun Li, Ning Ding, Bowen Zhou, Bing Zhang, Zhiyuan Ma

प्रकाशित 2026-08-12
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jiabao Wei, Zilong Geng, Yuze Wang, Jianjun Li, Ning Ding, Bowen Zhou, Bing Zhang, Zhiyuan Ma

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मानव शरीर की कल्पना एक हलचल भरे शहर के रूप में करें जो प्रोटीन नामक नन्हे, अदृश्य लेगो (LEGO) ईंटों से बना है। इनमें से कुछ ईंटें अकेले काम करती हैं, लेकिन अधिकांश विशेष टीमों की तरह होती हैं जिन्हें मशीनें बनाने, संकेत भेजने या हमलावरों से लड़ने के लिए एक साथ जुड़ना पड़ता है। दशकों से, वैज्ञानिक इन टीमों की तस्वीरें लेने में बहुत कुशल रहे हैं जब वे पहले से ही बनी हुई और आपस में जुड़ी होती हैं। यह एक तैयार लेगो किले की तस्वीर होने जैसा है, लेकिन इस बात का कोई अंदाज़ा नहीं कि कैसे टुकड़े हवा में उड़े, एक-दूसरे से टकराए और फिर अपनी जगह पर फिट हुए। यह एक बड़ी समस्या है क्योंकि "क्या" से कहीं अधिक "कैसे" मायने रखता है। यदि आप वायरस को रोकने के लिए एक नई दवा बनाना चाहते हैं, तो आपको यह जानने की आवश्यकता है कि वायरस के प्रोटीन अपने लक्ष्यों को कैसे ढूंढते हैं, न कि केवल यह कि वे एक साथ जुड़े होने पर कैसे दिखते हैं।

हाल ही में, कंप्यूटर "डिफ्यूजन मॉडल्स" (diffusion models) नामक आर्टिफिशियल इंटेलिजेंस का उपयोग करके यह अनुमान लगाने में बहुत अच्छे हो गए हैं कि ये प्रोटीन टीमें कैसी दिखती हैं। इन मॉडल्स को एक जादुई कलाकार की तरह समझें जो एक धुंधले, बिखरे हुए स्केच को एक स्पष्ट, सटीक चित्र में बदल सकता है। लेकिन यहाँ एक पेंच है: इन कलाकारों को केवल स्थिर स्नैपशॉट या अकेले घूमते हुए एकल ईंटों पर प्रशिक्षित किया गया है। वे दो अलग-अलग टीमों के एक-दूसरे की ओर दौड़ने, नाचने और अंततः एक जटिल मशीन बनने के लिए गले मिलने के "मूवी" (फिल्म) को चित्रित करना नहीं जानते। बिना इस "मूवी" के, AI यह भविष्यवाणी नहीं कर सकता कि नए, अज्ञात समूह कैसे बनेंगे, जो दवाओं को डिजाइन करने या जीवन को उसके सबसे मौलिक स्तर पर समझने की हमारी क्षमता में एक बड़ी कमी छोड़ देता है।

यहाँ DynaPPI आता है, एक विशाल नया डेटासेट जिसे AI को इन प्रोटीन नृत्यों को देखना और भविष्यवाणी करना सिखाने के लिए डिज़ाइन किया गया है। इस प्रोजेक्ट के पीछे के शोधकर्ताओं ने महसूस किया कि AI की इस अदृश्य दृष्टि को ठीक करने के लिए, उन्हें एक ऐसी लाइब्रेरी की आवश्यकता है जो दिखा सके कि प्रोटीन श्रृंखलाएं कैसे दूर से लेकर मजबूती से बंधने तक की यात्रा करती हैं। केवल अंतिम हाथ मिलाने (handshake) को देखने के बजाय, उन्होंने पूरी यात्रा का अनुकरण (simulate) किया। उन्होंने ज्ञात प्रोटीन टीमों को लिया, उन्हें अलग किया, और फिर उन्हें देखने के लिए शक्तिशाली कंप्यूटर सिमुलेशन का उपयोग किया कि वे कैसे तैरते, टकराते और पुन: संगठित होते हैं।

टीम ने लगभग 10,000 प्रोटीन कॉम्प्लेक्स वाला एक डेटासेट बनाया, जिसमें प्रोटीन-प्रोटीन, प्रोटीन-लिगैंड (प्रोटीन का एक छोटी दवा अणु से मिलना), और प्रोटीन-न्यूक्लिक एसिड (प्रोटीन का DNA या RNA से मिलना) जैसे विभिन्न प्रकार की साझेदारियां शामिल हैं। यह सुनिश्चित करने के लिए कि सिमुलेशन यथार्थवादी हों, उन्होंने केवल अनुमान नहीं लगाया; उन्होंने हजारों विस्तृत कंप्यूटर प्रयोग चलाए। प्रत्येक प्रयोग ने 10 नैनोसेकंड से 1 मिलीसेकंड तक की समय अवधि में परमाणुओं की गति को ट्रैक किया। हालांकि यह छोटा लग सकता है, लेकिन परमाणुओं की दुनिया में, यह एक अनंत काल है—उन्हें हिलने, घूमने और एक-दूसरे को खोजने के लिए पर्याप्त समय है। इस डेटासेट में 10 बिलियन से अधिक फ्रेम शामिल हैं, जो स्थिति, गति और ऊर्जा में हर सूक्ष्म बदलाव को कैप्चर करते हैं।

DynaPPI को क्या खास बनाता है, वह यह है कि यह स्पष्ट रूप से AI को बंधन (binding) की प्रक्रिया सिखाता है। अतीत में, AI मॉडल उन छात्रों की तरह थे जिन्होंने केवल अंतिम परीक्षा के उत्तरों का अध्ययन किया था। अब, DynaPPI के साथ, उन्हें चरण-दर-चरण होमवर्क करने का मौका मिलता है। यह डेटासेट AI को दिखाता है कि प्रोटीन दूर होने पर कैसा व्यवहार करते हैं, करीब आने पर उनका आकार कैसे बदलता है, और लॉक होने से पहले का "मध्य" हिस्सा कैसा दिखता है। उन्होंने इन घटनाओं का अनुकरण करने के लिए ज्ञात संरचनाओं को लिया, श्रृंखलाओं को अलग किया, और फिर उन्हें पानी और नमक के आभासी महासागर में यह देखने के लिए छोड़ दिया कि क्या वे एक-दूसरे को फिर से ढूंढ पाते हैं। उन्होंने प्रकृति की यादृच्छिकता (randomness) को पकड़ने के लिए ये सिमुलेशन कई बार (रेप्लिका) चलाए, ठीक वैसे ही जैसे सभी संभावित परिणामों को देखने के लिए कई बार पासा फेंका जाता है।

पेपर सुझाव देता है कि इस डायनेमिक डेटा को डिफ्यूजन मॉडल्स में फीड करके, AI न केवल एक प्रोटीन कॉम्प्लेक्स के अंतिम आकार की भविष्यवाणी करना सीख सकता है, बल्कि उस पथ की भी भविष्यवाणी कर सकता है जो उसे वहां तक ले जाता है। यह ड्रग डिजाइन के लिए गेम-चेंजर हो सकता है। कल्पना कीजिए कि एक नई दवा अणु कैसे किसी बीमारी पैदा करने वाले प्रोटीन का पीछा करेगी, बंद दरवाजे को देखने के बजाय उन अस्थायी जेबों (pockets) को पहचान लेगी जो नृत्य के दौरान ही खुलते हैं। लेखक प्रस्ताव देते हैं कि यह वैज्ञानिकों को बेहतर दवाएं डिजाइन करने, नए जैविक मशीनें बनाने और भविष्य की महामारियों के लिए तैयार होने में मदद कर सकता है, यह समझते हुए कि वायरस मानव कोशिकाओं के साथ कैसे इंटरैक्ट करते हैं।

हालाँकि, यह ध्यान रखना महत्वपूर्ण है कि यह एक प्रस्ताव और एक संसाधन का निर्माण है, न कि एक तैयार उत्पाद जिसने पहले से ही हर रहस्य को सुलझा लिया है। पेपर एक डेटासेट बनाने की योजना की रूपरेखा तैयार करता है, यह वर्णन करता है कि वे प्रोटीनों का चयन कैसे करेंगे, डेटा को कैसे साफ करेंगे और सिमुलेशन कैसे चलाएंगे। उन्होंने विशिष्ट लक्ष्य भी निर्धारित किए हैं, जैसे यह सुनिश्चित करना कि डेटा विभिन्न प्रकार के प्रोटीनों को कवर करता है और सिमुलेशन वास्तविक दुनिया के प्रयोगों से मेल खाने के लिए पर्याप्त सटीक है। वे यह भी स्वीकार करते हैं कि जबकि हम इन प्रक्रियाओं का अनुकरण कर सकते हैं, वास्तविक परीक्षण तब होगा जब अन्य वैज्ञानिक इस डेटा का उपयोग अपने स्वयं के AI मॉडल को प्रशिक्षित करने के लिए करेंगे और देखेंगे कि क्या वे मॉडल उन संरचनाओं की सफलतापूर्वक भविष्यवाणी कर सकते हैं जो पहले कभी नहीं देखी गई हैं। डेटासेट को खुला और सुलभ बनाने के लिए डिज़ाइन किया गया है, जिससे वैश्विक वैज्ञानिक समुदाय इस नींव पर निर्माण कर सके और AI के साथ क्या किया जा सकता है, इसकी सीमाओं को आगे बढ़ा सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →