← नवीनतम पेपर
💻 bioinformatics

Protenix-v1: Toward High-Accuracy Open-Source Biomolecular Structure Prediction

Protenix-v1 पहला पूर्ण रूप से ओपन-सोर्स बायोमॉलिक्यूलर स्ट्रक्चर प्रेडिक्शन मॉडल है जो इसके बाधाओं (constraints) से मेल खाते हुए अल्फाफोल्ड3 (AlphaFold3) की सटीकता को भी पीछे छोड़ देता है, जिसमें इन्फरेंस-टाइम स्केलिंग, विस्तारित टेम्पलेट और आरएनए (RNA) क्षमताएं, और बेहतर बेंचमार्किंग टूल्स के साथ एक बड़ा 2025-प्रशिक्षित वेरिएंट शामिल है।

मूल लेखक: Zhang, Y., Gong, C., Zhang, H., Ma, W., Liu, Z., Chen, X., Guan, J., Wang, L., Yang, Y., Xia, Y., Xiao, W.

प्रकाशित 2026-02-22
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhang, Y., Gong, C., Zhang, H., Ma, W., Liu, Z., Chen, X., Guan, J., Wang, L., Yang, Y., Xia, Y., Xiao, W.

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ⚕️ यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जटिल 3D पहेली बनाने की कोशिश कर रहे हैं, लेकिन कार्डबोर्ड के टुकड़ों के बजाय, आप प्रोटीन, RNA और अन्य सूक्ष्म जैविक मशीनों को जोड़ रहे हैं। लंबे समय तक, केवल एक ही कंपनी (DeepMind) के पास वह "मास्टर ब्लूप्रिंट" (AlphaFold3) था जो इन पहेलियों को लगभग सटीक रूप से हल कर सकता था। बाकी सभी लोग अपने स्वयं के ब्लूप्रिंट बनाने की कोशिश कर रहे थे, जो ओपन-सोर्स टूल्स का उपयोग करके बनाए जा रहे थे, लेकिन वे उस मास्टर स्तर तक पहुँचने में विफल रहे।

मिलिए Protenix-v1 से।

Protenix-v1 को ऐसे समझें जैसे कि यह पहला पूरी तरह से ओपन-सोर्स दल है जिसने अंततः एक ऐसा ब्लूप्रिंट बनाया है जो मास्टर ब्लूप्रिंट के समान ही अच्छा है, और कुछ मामलों में उससे भी बेहतर है। उन्होंने यह कैसे किया, इसे सरल उपमाओं के माध्यम से यहाँ समझाया गया है:

1. "निष्पक्ष दौड़" (कठोर नियम)

आमतौर पर, जब लोग इन मॉडलों की तुलना करते हैं, तो यह एक ऐसी दौड़ की तरह होता है जहाँ एक धावक को बढ़त मिलती है या वह एक अलग ट्रैक का उपयोग करता है। DeepMind का मॉडल एक निश्चित तारीख तक के डेटा पर प्रशिक्षित था, जबकि अन्य लोगों ने नए डेटा की ओर झाँक लिया होगा।

Protenix-v1 ने एक बिल्कुल निष्पक्ष दौड़ चलाने का निर्णय लिया। उन्होंने कहा, "हम बिल्कुल उसी ट्रेनिंग डेटा कटऑफ, उसी कंप्यूटर पावर और उसी समय सीमा का उपयोग करेंगे जो मास्टर मॉडल का था।" इन सख्त नियमों के बावजूद, Protenix-v1 ने न केवल बराबरी की, बल्कि विशिष्ट श्रेणियों में जीतना भी शुरू कर दिया, जिससे यह साबित हुआ कि "ओपन-सोर्स" और "टॉप-टियर" के बीच का अंतर भौतिकी का कोई मौलिक नियम नहीं है—यह केवल इंजीनियरिंग का अंतर था।

2. "अभ्यास ही पूर्णता है" की महाशक्ति (इन्फरेंस स्केलिंग)

अधिकांश ओपन-सोर्स मॉडल एक ऐसे छात्र की तरह हैं जो कड़ी मेहनत से पढ़ाई करता है, एक परीक्षा देता है और अपना उत्तर जमा कर देता है। यदि वे गलत होते हैं, तो वे बिना दोबारा अध्ययन किए इसे ठीक नहीं कर सकते।

Protenix-v1 अलग है। इसमें एक महाशक्ति है जिसे इन्फरेंस-टाइम स्केलिंग (Inference-Time Scaling) कहा जाता है। कल्पना कीजिए कि आप किसी छिपी हुई वस्तु के आकार का अनुमान लगाने की कोशिश कर रहे हैं।

  • पुराना तरीका: आप एक बार अनुमान लगाते हैं और उम्मीद करते हैं कि आप सही होंगे।
  • Protenix का तरीका: आप 100 बार अनुमान लगाते हैं। आप उन सभी 100 अनुमानों को देखते हैं, सबसे अच्छे को चुनते हैं, और महसूस करते हैं, "अरे, मैं जितनी अधिक बार कोशिश करूँगा, मेरा अंतिम उत्तर उतना ही बेहतर होता जाएगा!"

पेपर दिखाता है कि यदि आप Protexix-v1 को अधिक "अनुमान" (सैंपल्स) उत्पन्न करने के लिए अधिक कंप्यूटर समय देते हैं, तो इसकी सटीकता एक सीधी, अनुमानित रेखा में बढ़ती है। यह एक ऐसी विशेषता है जो पहले केवल क्लोज्ड-सोर्स "मास्टर" मॉडलों में देखी गई थी। यह उपयोगकर्ताओं को एक "वॉल्यूम नॉब" देता है: अधिक सटीकता चाहिए? बस अधिक अनुमानों के लिए अपने बजट को बढ़ा दें।

3. "स्विस आर्मी नाइफ" (नई सुविधाएँ)

पिछले ओपन-सोर्स मॉडल एक बुनियादी पेचकस की तरह थे। Protenix-v1 एक स्विस आर्मी नाइफ है।

  • RNA सपोर्ट: यह अब प्रोटीन के साथ-साथ RNA (जो DNA का एक संबंधी है) को भी संभाल सकता है।
  • टेम्पलेट्स: यह नए पहेलियों को सुलझाने में मदद के लिए पुराने, समान पझाओं को देख सकता है (जैसे कि एक संदर्भ फोटो का उपयोग करना)।
  • ड्रग डिस्कवरी: उन्होंने एक विशेष "प्रो" संस्करण (Protenix-v1-20250630) जारी किया है जिसे और भी हालिया डेटा पर प्रशिक्षित किया गया है। यह एक जासूस को कल ही अपडेट की गई फाइल कैबिनेट देने जैसा है, जिससे वे हाल ही में खोजी गई बीमारियों (जैसे नई दवाओं को डिजाइन करने) के नए अपराधों को सुलझाने में बेहतर बनते हैं।

4. स्कोरबोर्ड को साफ करना (बेहतर बेंचमार्क)

लेखकों ने देखा कि मॉडलों को आंकने के लिए उपयोग किए जाने वाले "स्कोरबोर्ड" अव्यवस्थित थे। कभी-कभी, एक मॉडल किसी विशिष्ट पहेली पर चलने में विफल हो जाता था, लेकिन स्कोरबोर्ड उसे "पास" के रूप में गिनता था क्योंकि उसने विवरणों की जाँच नहीं की थी। यह गणित की परीक्षा को ग्रेड देने जैसा था लेकिन छात्र द्वारा छोड़े गए प्रश्नों को अनदेखा कर देना।

Protenix टीम ने एक नया, स्वच्छ स्कोरबोर्ड बनाया। उन्होंने सुनिश्चित किया कि प्रत्येक मॉडल का परीक्षण बिल्कुल समान सेट की पहेलियों पर किया जाए, और उन्होंने "किस्मत" के कारक को कम करने के लिए सांख्यिकी का उपयोग किया। उन्होंने एंटीबॉडीज (शरीर के रक्षा सैनिक) और ड्रग मॉलिक्यूल्स जैसी कठिन चीजों के लिए विशेष परीक्षण भी बनाए, जिन्हें पहले सटीक रूप से मापना बहुत कठिन था।

यह क्यों मायने रखता है?

  • वैज्ञानिकों के लिए: इसका मतलब है कि अब वे महंगे, क्लोज्ड टूल्स के समान आत्मविश्वास के साथ दवाएं डिजाइन करने और बीमारियों को समझने के लिए एक मुफ्त, ओपन टूल का उपयोग कर सकते हैं।
  • भविष्य के लिए: यह साबित करता है कि ओपन-सोर्स सहयोग विज्ञान के उच्चतम स्तरों तक पहुँच सकता है।
  • आपके लिए: बेहतर टूल्स का अर्थ है नई दवाओं की खोज में तेजी और जीवन के काम करने के तरीके की गहरी समझ।

संक्षेप में: Protenix-v1 ओपन-सोर्स समुदाय का "गोल्डन टिकट" है। यह एक मुफ्त, शक्तिशाली और अनुकूलन योग्य उपकरण है जो अंततः दिग्गजों के साथ एक ही मैदान पर खेल रहा है, लेकिन पारदर्शिता, अनुकूलन क्षमता और निरंतर सुधार के अतिरिक्त लाभ के साथ।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →