Folding, Reasoning, and Scaling with Open-source Drug Discovery Engine
यह शोध पत्र OpenDDE को प्रस्तुत करता है, जो एक ओपन-सोर्स, ऑल-एटम बायोमॉलिक्यूलर फाउंडेशन मॉडल है जो उन्नत ड्रग डिस्कवरी क्षमताओं तक पहुंच को लोकतांत्रिक बनाने के लिए को-फोल्डिंग (co-folding) को एक स्केलेबल स्ट्रक्चरल रीजनिंग लेयर के रूप में उपयोग करता है, जो न केवल सटीक कॉम्प्लेक्स स्ट्रक्चर प्रेडिक्शन को सक्षम बनाता है बल्कि डी नोवो डिज़ाइन, एफिनिटी एस्टीमेशन और चिकित्सीय अनुकूलन के लिए एक फाउंडेशनल प्लेटफॉर्म के रूप में भी कार्य करता है।
मूल पेपर CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) के तहत सार्वजनिक डोमेन को समर्पित है। यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें
यहाँ OpenDDE पेपर का हिंदी अनुवाद दिया गया है:
बड़ी तस्वीर: एक नया ओपन-सोर्स "आणविक वास्तुकार" (Molecular Architect)
कल्पically कल्पना कीजिए कि जीव विज्ञान (biology) एक विशाल, जटिल निर्माण स्थल (construction site) है। वर्षों से, वैज्ञानिक इस बात की भविष्यवाणी करने के लिए संघर्ष कर रहे हैं कि विभिन्न निर्माण खंड (प्रोटीन, डीएनए और दवाएं) एक स्थिर संरचना बनाने के लिए एक साथ कैसे फिट होते हैं। यह नई दवाओं की खोज में एक "अवरोध" (bottleneck) रहा है।
अब तक, इस काम के लिए सबसे अच्छे उपकरण उन गुप्त ब्लूप्रिंट्स की तरह थे जो कुछ बड़ी कंपनियों द्वारा तिजोरी में रखे जाते थे। वे अविश्वसनीय रूप से अच्छा काम करते थे, लेकिन कोई और यह नहीं देख सकता था कि वे कैसे काम करते हैं, उन्हें कैसे बदला जा सकता है, या उन पर कैसे निर्माण किया जा सकता है।
OpenDDE एक नया, ओपन-सोर्स टूल (जैसे ब्लूप्रिंट का एक सार्वजनिक पुस्तकालय) है, जो दावा करता है कि वह उन टॉप-सीक्रेट सिस्टम के प्रदर्शन से मेल खाता है। इसे एक ड्रग डिस्कवरी इंजन के "मस्तिष्क" के रूप में डिज़ाइन किया गया है, जो न केवल यह अनुमान लगाने में सक्षम है कि अणु (molecules) कैसे मुड़ते हैं, बल्कि अंततः वैज्ञानिकों को नए अणुओं को डिजाइन करने में मदद करने में भी सक्षम है।
1. यह कैसे काम करता है: "परिष्करण" (Refining) का रूपक
अधिकांश पुराने AI मॉडल एक ही बड़ी छलांग में अणु के अंतिम आकार का अनुमान लगाने की कोशिश करते थे। OpenDDE अलग है। यह एक "कोर्स-टू-फाइन" (Coarse-to-Fine) दृष्टिकोण का उपयोग करता है, जिसे पेपर में एटॉमिक लेटेंट रीजनिंग (Atomic Latent Reasoning) कहा गया है।
- रूपक: कल्पना कीजिए कि एक मूर्तिकार संगमरमर के एक ब्लॉक से मूर्ति तराशने की कोशिश कर रहा है।
- पुराना तरीका: मूर्तिकार तुरंत अंतिम विवरण (आंखें, उंगलियां) तराशने की कोशिश करता है। यदि वे शुरुआत में गलती करते हैं, तो पूरी मूर्ति खराब हो जाती है।
- OpenDDE का तरीका: मूर्तिकार पहले शरीर की एक रफ रूपरेखा (residue tokens) बनाता है। फिर, वे हाथ और पैरों की मुद्रा (structural tokens) को परिष्कृत करते हैं। अंत में, वे त्वचा की बनावट और उंगलियों जैसे बारीक विवरणों (all-atom coordinates) को तराशते हैं।
- यह क्यों मायने रखता है: हर एक परमाणु को रखने से पहले सामान्य आकार और रासायनिक संदर्भ के बारे में "सोचकर", OpenDDE कम गलतियाँ करता है और अधिक सटीक संरचनाएं बनाता है।
2. "लॉक एंड की" (ताला और चाबी) प्रशिक्षण
पेपर एक विशिष्ट प्रशिक्षण पद्धति पर प्रकाश डालता है जिसे शेप-कॉम्प्लीमेंटैरिटी (Shape-Complementarity) कहा जाता है।
- रूपक: ताले और चाबी के बारे में सोचें। यह पर्याप्त नहीं है कि चाबी बस ताले के पास हो; चाबी के उभार ताले के खांचों से पूरी तरह मेल खाने चाहिए। यदि वे आपस में टकराते हैं (एक "स्टेरिक क्लैश"), तो चाबी नहीं घूमेगी।
- AI का काम: OpenDDE को एक विशेष "शिक्षक" के साथ प्रशिक्षित किया गया है जो AI को तब पुरस्कृत करता है जब अणु एक आदर्श ताले और चाबी की तरह फिट होते हैं, और तब दंडित करता है जब वे आपस में टकराते हैं या अजीब अंतराल छोड़ देते हैं। यह AI को वास्तविक दुनिया में अणु वास्तव में कैसे परस्पर क्रिया करते हैं, इसके भौतिक नियमों को सिखाता है।
3. "अभ्यास ही पूर्णता लाता है" स्केलिंग लॉ (Scaling Law)
शोधकर्ताओं ने पाया कि OpenDDE जितना अधिक अभ्यास करता है, उतना ही स्मार्ट होता जाता है, यह एक नियम का पालन करता है जो बड़े भाषा मॉडलों (जैसे कि आप जिससे अभी बात कर रहे हैं) के स्मार्ट होने के समान है।
- रूपक: कल्पना कीजिए कि एक छात्र परीक्षा दे रहा है।
- कम स्केल: यदि छात्र एक पाठ्यपुस्तक पढ़ता है, तो वह 60% प्राप्त कर सकता है।
- उच्च स्केल: यदि छात्र 100 पाठ्यपुस्तकें पढ़ता है और एक विशाल अध्ययन समूह के साथ अभ्यास करता है, तो उसका स्कोर उछलकर 90% हो जाता है।
- निष्कर्ष: पेपर दिखाता है कि जैसे-जैसे OpenDDE अधिक डेटा प्रोसेस करता है और अधिक कंप्यूटर पावर का उपयोग करता है, जटिल संरचनाओं (जैसे वायरस से लड़ने वाले एंटीबॉडी) की भविष्यवाणी करने की इसकी क्षमता लगातार सुधरती जाती है। यह वर्तमान में सबसे शक्तिशाली ओपन मॉडल है, जो सटीकता के मामले में सर्वश्रेष्ठ क्लोज्ड (गुप्त) मॉडलों के ठीक बगल में खड़ा है।
4. टेस्ट-टाइम स्केलिंग: "कई अनुमान" की रणनीति
सबसे दिलचस्प निष्कर्षों में से एक टेस्ट-टाइम स्केलिंग (Test-Time Scaling) है।
- रूपक: कल्पना कीजिए कि आप एक कठिन पहेली सुलझाने की कोशिश कर रहे हैं।
- रणनीति A: आप एक अनुमान लगाते हैं और उम्मीद करते हैं कि वह सही होगा।
- रणनीति B: आप 500 अलग-अलग संभावित समाधान उत्पन्न करते हैं, उन सभी को देखते हैं, और सबसे अच्छा चुनते हैं।
- परिणाम: OpenDDE रणनीति B में बहुत अच्छा है। पेपर दिखाता है कि यदि आप AI को एक ही समस्या के लिए कई अलग-अलग "अनुमान" (सैंपल्स) उत्पन्न करने देते हैं, तो एक आदर्श समाधान खोजने की संभावना आसमान छू लेती है। यह एक ही इमारत का स्केच बनाने वाले 500 वास्तुकारों की एक टीम होने जैसा है; अंततः, उनमें से एक एक उत्कृष्ट कृति (masterpiece) तैयार करेगा।
5. यह क्या कर सकता है (और क्या नहीं कर सकता)
दावे:
- बेहतर सटीकता: एंटीबॉडी (शरीर के रक्षा प्रोटीन) और एंटीजन (आक्रमणकारी) से संबंधित परीक्षणों में, OpenDDE ने AlphaFold3 और ESMFold2 जैसे अन्य ओपन मॉडलों को पछाड़ दिया। इसने ओपन-सोर्स दुनिया में किसी भी अन्य मॉडल की तुलना में इन इंटरैक्शन के आकार की अधिक बार सही भविष्यवाणी की।
- नए सिस्टम: यह उन बिल्कुल नए जैविक संरचनाओं पर भी अच्छी तरह से काम किया जिन्हें AI ने पहले कभी नहीं देखा था, जिससे यह साबित होता है कि यह केवल पुराने डेटा को याद नहीं कर रहा है।
- एकीकृत इंजन: इसे आकार की भविष्यवाणी करने (यह प्रोटीन कैसा दिखता है?) और आकार को डिजाइन करने (इस प्रोटीन में फिट होने के लिए एक नई दवा कैसी होनी चाहिए?) दोनों को संभालने के लिए बनाया गया है।
सीमाएँ (जो पेपर स्वीकार करता है):
- अभी पूर्ण ड्रग मशीन नहीं: पेपर स्पष्ट है कि OpenDDE आधार (इंजन) है, न कि पूरी कार। यह संरचनाओं की भविष्यवाणी अच्छी तरह से करता है, लेकिन यह अभी भी छोटे-अणु वाली दवाओं (जैसे गोलियां) की जटिल रसायन विज्ञान को पूरी तरह से नहीं संभाल पाता है या 100% निश्चितता के साथ यह भविष्यवाणी नहीं कर पाता कि एक दवा कितनी अच्छी तरह से बंधेगी।
- "ब्लैक बॉक्स" गैप: हालांकि OpenDDE ओपन है, शोधकर्ता स्वीकार करते हैं कि वे नहीं जानते कि गुप्त "IsoDDE" सिस्टम (बंद प्रतिस्पर्धी) कैसे काम करता है। वे 100% सुनिश्चित नहीं हो सकते कि उनकी सफलता उनके कोड, उनके डेटा या किसी और चीज़ के कारण है, क्योंकि वे प्रतिस्पर्धी की पूरी रेसिपी नहीं देख सकते।
सारांश
OpenDDE एक शक्तिशाली, मुफ्त उपयोग के लिए उपलब्ध AI है जो एक आणविक वास्तुकार के रूप में कार्य करता है। यह जटिल जैविक अणु कैसे मुड़ते हैं और एक साथ कैसे फिट होते हैं, यह समझने के लिए चरण-दर-चरण तर्क प्रक्रिया का उपयोग करता है। भारी मात्रा में डेटा पर प्रशिक्षण देकर और "कई उत्पन्न करें, सबसे अच्छा चुनें" रणनीति का उपयोग करके, इसने सटीकता का एक ऐसा स्तर प्राप्त कर लिया है जो दुनिया के सबसे महंगे, क्लोज्ड-सोर्स सिस्टमों को टक्कर देता है। यह ड्रग डिस्कवरी के लोकतंत्रीकरण की दिशा में एक बड़ा कदम है, जो वैज्ञानिकों को जीवन के निर्माण खंडों को समझने और डिजाइन करने के लिए एक उच्च-गुणवत्ता वाला टूल प्रदान करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।