← नवीनतम पेपर
🤖 machine learning

Amortized Molecular Optimization via Group Relative Policy Optimization

यह शोध पत्र AMORTIX को प्रस्तुत करता है, जो एक एमोर्टाइज्ड (amortized) ग्राफ ट्रांसफार्मर मॉडल है जो विविध संरचनात्मक बाधाओं और प्रारंभिक संरचनाओं में प्रशिक्षण को स्थिर करने के लिए ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइजेशन (Group Relative Policy Optimization) का उपयोग करके, बिना इन्फरेंस-टाइम ओरकल कॉल्स के, कुशल, सिंगल-पास मॉलिक्यूलर ऑप्टिमाइजेशन प्राप्त करता है।

मूल लेखक: Muhammad bin Javaid, Hasham Hussain, Ashima Khanna, Berke Kisin, Jonathan Pirnay, Alexander Mitsos, Dominik G. Grimm, Martin Grohe

प्रकाशित 2026-05-11
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Muhammad bin Javaid, Hasham Hussain, Ashima Khanna, Berke Kisin, Jonathan Pirnay, Alexander Mitsos, Dominik G. Grimm, Martin Grohe

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक मास्टर शेफ हैं जो एक आदर्श नया व्यंजन बनाने की कोशिश कर रहे हैं। आपके पास एक विशिष्ट, गैर-परक्राम्य (non-negotiable) आधार सामग्री (जैसे कि एक विशिष्ट प्रकार का पास्ता या एक अनूठा मसाला मिश्रण) है जिसे अंतिम रेसिपी में बना रहना ही चाहिए। आपका लक्ष्य अन्य सामग्रियां जोड़कर इसे अद्भुत बनाना है, लेकिन आपको हर एक संयोजन का परीक्षण करने के लिए उसे वास्तव में बनाना और चखना होगा।

दवा की खोज (drug discovery) की दुनिया में, इस "चखने" का काम एक कंप्यूटर प्रोग्राम द्वारा किया जाता है जिसे ओरेकल (Oracle) कहा जाता है। इसे चलाना अविश्वसनीय रूप से महंगा और धीमा है।

पुराना तरीका: "ट्रायल एंड एरर" शेफ (इंस्टेंस ऑप्टिमाइज़ेशन)

वर्तमान में, अधिकांश वैज्ञानिक इंस्टेंस ऑप्टिमाइज़ेशन (Instance Optimization) नामक विधि का उपयोग करते हैं। कल्पना कीजिए कि प्रत्येक नए आधार घटक (base ingredient) को बेहतर बनाने के लिए जिसे आप सुधारना चाहते हैं, आप एक नई शेफ टीम को काम पर रखते हैं।

  1. वे शून्य से शुरुआत करते हैं।
  2. वे हजारों विविधताएं बनाते हैं।
  3. वे सभी का स्वाद लेते हैं (महंगे ओरेकल को कॉल करते हैं) ताकि सबसे अच्छा विकल्प मिल सके।
  4. एक बार जब वे विजेता को ढूंढ लेते हैं, तो वे पूरी टीम को हटा देते हैं।
  5. यदि आपके पास 1,000 अलग-अलग आधार घटक हैं, तो आपको 1,000 अलग-अलग टीमें रखनी होगी और 1,000 अलग-अलग महंगे टेस्टिंग सत्रों का भुगतान करना होगा।

यह काम करता है, लेकिन यदि आपके पास कई अलग-अलग शुरुआती बिंदु हैं, तो यह बहुत धीमा है और इसमें बहुत पैसा खर्च होता है।

नया तरीका: "सुपर-लर्नर" शेफ (एमोर्टाइज्ड ऑप्टिमाइज़ेशन)

यह पेपर AMORTIX नामक एक नया दृष्टिकोण पेश करता है जिसे एमोर्टाइज्ड ऑप्टिमाइज़ेशन (Amortized Optimization) कहा जाता है। इसे एक ऐसे जीनियस शेफ के रूप में सोचें जो कुछ समय के लिए "पाक कला विद्यालय" (ट्रेनिंग) जाता है।

  1. प्रशिक्षण (Training): शेफ हजारों उदाहरणों का अध्ययन करता है, सामान्य नियम सीखता है जैसे "यदि आधार मसालेदार है, तो कुछ मीठा जोड़ें" या "यदि आधार भारी है, तो कुछ हल्का जोड़ें।"
  2. प्रतिफल (Payoff): एक बार जब शेफ प्रशिक्षित हो जाता है, तो आप उन्हें कोई भी नया आधार घटक दे सकते हैं, और वे एक सेकंड में एक आदर्श व्यंजन तैयार कर सकते हैं। उन्हें फिर से हजारों विकल्प बनाने और चखने की आवश्यकता नहीं है; वे बस वही उपयोग करते हैं जो उन्होंने सीखा है।
  3. लाभ: लागत प्रशिक्षण के दौरान अग्रिम रूप से चुकाई जाती है। उसके बाद, नए व्यंजन बनाना लगभग मुफ्त और त्वरित है।

बड़ी समस्या: "आसान बनाम कठिन" पहेली

लेखकों ने पिछले "सुपर-लर्नर" शेफ के साथ एक बड़ी बाधा पाई है।

  • कुछ आधार घटक सुधारने के लिए आसान होते हैं (जैसे फीके सूप में नमक डालना)। लगभग कोई भी बदलाव उन्हें बेहतर बना देता है।
  • कुछ आधार घटक कठिन होते हैं (जैसे किसी पत्थर को स्वादिष्ट बनाने की कोशिश करना)। सबसे अच्छे बदलाव भी उन्हें केवल थोड़ा सा ही बेहतर बना पाते हैं।

यदि आप एक शेफ को उनके सभी व्यंजनों की तुलना करके प्रशिक्षित करते हैं, तो "आसान" व्यंजन (जो आसानी से उच्च स्कोर प्राप्त करते हैं) "कठिन" व्यंजनों को दबा देते हैं। शेफ सोचता है, "खैर, मैंने एक बेहतरीन सूप बनाया, इसलिए मैं बहुत अच्छा कर रहा हूँ!" और वह पत्थर को सुधारने में अपनी विफलता को अनदेखा कर देता है। सीखने का संकेत (learning signal) भ्रमित हो जाता है क्योंकि कठिनाई का स्तर बहुत अधिक भिन्न होता है।

समाधान: ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन (GRPO)

AMORTIX इसे एक चतुर ट्रिक के साथ हल करता है जिसे ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन (Group Relative Policy Optimization) कहा जाता है।

एक "आसान सूप" की तुलना सीधे एक "कठिन पत्थर" से करने के बजाय, सिस्टम उन्हें अलग-अलग समूहों में रखता है:

  • समूह A (आसान आधार): शेफ आसान सूप के 10 संस्करण बनाता है। सिस्टम केवल उनकी आपस में तुलना करता है। "इन 10 सूपों में से कौन सा सबसे अच्छा है?"
  • समूह B (कठिन आधार): शेफ पत्थर के 10 संस्करण बनाता है। सिस्टम केवल उनकी आपस में तुलना करता है। "इन 10 पत्थरों में से कौन सा सबसे कम बुरा है?"

उन्हें अपने ही "कठिनाई समूह" के साथियों के विरुद्ध परखकर, सिस्टम बिना भ्रमित हुए दोनों आसान और कठिन कार्यों के लिए सही सबक सीखता है।

उन्होंने क्या सिद्ध किया?

लेखकों ने AMORTIX का तीन मुख्य परिदृश्यों में परीक्षण किया:

  1. मानक परीक्षण (PMO बेंचमार्क): उन्होंने "सबसे अच्छा अणु खोजने" के एक मानक खेल में अन्य शीर्ष विधियों के खिलाफ खेला। AMORTIX सबसे तेज़ और सबसे कुशल था, जो "सुपर-लर्नर" विधियों में प्रथम और कुल मिलाकर दूसरे स्थान पर रहा।
  2. "नया घटक" परीक्षण (स्कैफोल्ड डेकोरेशन): उन्होंने सिस्टम को बिल्कुल नए आधार संरचनाएं दीं जिन्हें उसने पहले कभी नहीं देखा था। AMORTIX ने उन्हें तुरंत सफलतापूर्वक सुधारा, और उन विधियों को पछाड़ दिया जिन्हें हर नए आधार के लिए हजारों बार फिर से खाना बनाना पड़ता था।
  3. "फ्यू-शॉट" परीक्षण (प्रोड्रग डिज़ाइन): उन्होंने दिखाया कि सिस्टम को एक दवा को "प्रोड्रग" (एक ऐसी दवा जो शरीर के अंदर सक्रिय होती है) में बदलने के लिए केवल चार उदाहरण दिए। सिस्टम ने नियम सीख लिया और इसे 52 पूरी तरह से अलग दवाओं पर सफलतापूर्वक लागू किया, जिन्हें उसने पहले कभी नहीं देखा था, और तुरंत वैध, काम करने वाले डिज़ाइन बनाए।

निचोड़ (The Bottom Line)

AMORTIX एक नया AI टूल है जो कई उदाहरणों का एक साथ अध्ययन करके दवाओं को डिजाइन करना सीखता है, न कि हर नई समस्या के लिए शून्य से शुरू करता है। यह आसान और कठिन रासायनिक संरचनाओं को संभालने के लिए एक स्मार्ट ग्रुपिंग ट्रिक का उपयोग करता है, जिससे वैज्ञानिक हर एक नए ड्रग विचार के लिए हजारों कंप्यूटर सिमुलेशन चलाने की उच्च लागत चुकाए बिना, तुरंत अनुकूलित ड्रग कैंडिडेट बना सकते हैं।

नोट: पेपर स्पष्ट रूप से बताता है कि जबकि AI इन अणुओं को डिजाइन करता है, यह वर्तमान में केवल 2D रासायनिक संरचनाओं (सपाट चित्रों) के साथ काम करता है और अभी तक 3D आकारों या स्टीरियोकेमिस्ट्री (stereochemistry) को ध्यान में नहीं रखता है, जो वास्तविक दुनिया के भौतिक बाइंडिंग के लिए महत्वपूर्ण हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →