← नवीनतम पेपर
🤖 machine learning

On the Design Space of Discrete Diffusion Online Adaptation for Molecular Optimization

यह शोध पत्र आणविक अनुकूलन (molecular optimization) में डिस्क्रीट डिफ्यूजन मॉडल्स के लिए एक व्यापक ऑनलाइन अनुकूलन ढांचा प्रस्तावित करता है जो सीमित ओरेकल बजट के तहत ऑफलाइन फाइन-ट्यूनिंग और इन्फरेंस-टाइम सर्च बेसलाइन्स से बेहतर प्रदर्शन करने के लिए अधिग्रहण (acquisition), रिवॉर्ड शेपिंग, मॉडल डिबायसिंग, रिप्ले और वैधता नियंत्रण को एकीकृत करता है।

मूल लेखक: Trevor Chen, Ariel Dai, Jason Yang, Riccardo De Santi, Daniel Khalil, Wenda Chu, Nate Gruver, Pranav Murugan, Alexander F. G. Goldberg, Maruan Al-Shedivat, Yisong Yue

प्रकाशित 2026-07-07
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Trevor Chen, Ariel Dai, Jason Yang, Riccardo De Santi, Daniel Khalil, Wenda Chu, Nate Gruver, Pranav Murugan, Alexander F. G. Goldberg, Maruan Al-Shedivat, Yisong Yue

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक मास्टर शेफ (AI मॉडल) है जिसने व्यंजनों की एक विशाल लाइब्रेरी से वर्षों तक खाना बनाना सीखा है। यह शेफ लाखों अलग-अलग व्यंजन बनाना जानता है, साधारण टोस्ट से लेकर जटिल सूफ़ले (soufflé) तक। यह "प्रीट्रेन्ड प्रायर" (pretrained prior) है।

हालाँकि, आप कोई भी साधारण व्यंजन नहीं चाहते। आप एक बहुत ही विशिष्ट, कीमती लक्ष्य चाहते हैं: आप संभव सबसे स्वादिष्ट व्यंजन बनाना चाहते हैं, लेकिन आपके पास एक फूड क्रिटिक (ओरेकल/Oracle) को अपने निर्माणों का स्वाद चखने और रेटिंग देने के लिए एक सीमित बजट है। आप क्रिटिक से वे सभी व्यंजन चखने के लिए भुगतान नहीं कर सकते जो शेफ बना सकता है।

यह पेपर इस बारे में है कि कैसे इस शेफ को रैंडम व्यंजन बनाना बंद करने और उस विशिष्ट प्रकार के भोजन पर ध्यान केंद्रित करने के लिए कैसे सिखाया जाए जिसे आप चाहते हैं, वह भी कम से कम क्रिटिक टेस्टिंग का उपयोग करके। लेखक इसे "ऑनलाइन अडैप्टेशन" (Online Adaptation) कहते हैं।

यहाँ उनकी सफलता की "रेसिपी" का सरल विवरण दिया गया है, जो पेपर में दिए गए उपमाओं (analogies) का उपयोग करता है:

समस्या: "रैंडम गेस" का जाल (The "Random Guess" Trap)

यदि आप केवल शेफ से 1,000 व्यंजन बनाने के लिए कहते हैं और क्रिटिक से उनमें से टॉप 10 को चखने के लिए कहते हैं, तो आप फंस सकते हैं। शेफ बार-बार वे व्यंजन बनाता रहेगा जो अच्छे हैं (जैसे कि एक स्टैंडर्ड पास्ता), क्योंकि वे वही जानते हैं जो वे सबसे अच्छा जानते हैं, लेकिन वे उस अद्भुत व्यंजन को मिस कर सकते हैं जो थोड़ा अजीब और जोखिम भरा हो सकता है।

यह पेपर एक लूप का अध्ययन करता है जहाँ शेफ व्यंजन बनाता है, क्रिटिक कुछ व्यंजनों का स्वाद लेता है, और शेफ अगली बार बेहतर व्यंजन बनाने के लिए फीडबैक से सीखता है। लेकिन इस लूप को चलाने के कई तरीके हैं, और लेखक जानना चाहते थे कि: कौन सी विशिष्ट तरकीबें एक साथ सबसे अच्छा काम करती हैं?

जीतने वाली रेसिपी के 5 घटक (The 5 Ingredients of the Winning Recipe)

लेखकों ने पाँच विशिष्ट उपकरणों (knobs) वाले एक "किचन" का परीक्षण किया और पाया कि इन सभी का एक साथ उपयोग करने से सबसे अच्छे परिणाम मिलते हैं, विशेष रूप से छोटे अणुओं (जैसे नई दवाएं) के लिए।

  1. "जुआरी का चुनाव" (Thompson Sampling)

    • उपमा: केवल उन व्यंजनों को चखने के लिए क्रिटिक से पूछने के बजाय जिन्हें शेफ सबसे अच्छा मानता है, शेफ कुछ ऐसे व्यंजन भी चुनता है जिनमें अनिश्चितता हो। शायद शेफ पक्का नहीं है कि एक स्पाइसी करी काम करेगी या नहीं, लेकिन यह अद्भुत हो सकती है।
    • परिणाम: यह शेफ को बार-बार वही "सुरक्षित" पास्ता बनाने से रोकता है। यह टीम को जोखिम भरे लेकिन संभावित रूप से उच्च-इनाम वाले विचारों को खोजने के लिए मजबूर करता है।
  2. "हेल मैरी" फोकस (CVaR Reward Shaping)

    • उपमा: आमतौर पर, आप औसत व्यंजन को बेहतर बनाने की कोशिश कर सकते हैं। लेकिन यहाँ, लक्ष्य एक परफेक्ट व्यंजन ढूंढना है। यह टूल शेफ को बताता है: "औसत की चिंता न करें; ठीक-ठाक व्यंजनों को छोड़ दें। अपनी पूरी ऊर्जा टॉप 10% व्यंजनों को और भी बेहतर बनाने में लगाएं।"
    • परिणाम: यह शेफ को एक 'B+' मील पर समझौता करने के बजाय "जैकपॉट" के पीछे भागने के लिए प्रेरित करता है।
  3. "एंटी-ग्रुपथिंक" (Density Entropy Regularization)

    • उपमा: शेफ स्वाभाविक रूप से वे व्यंजन बनाना पसंद करता है जिन्हें वे सबसे अच्छा जानते हैं (लोकप्रिय मोड)। यह टूल एक सख्त मैनेजर की तरह काम करता है जो कहता है, "वही लोकप्रिय पास्ता बनाना बंद करो! मुझे पता है कि तुम इसे बना सकते हो, लेकिन हमें छिपे हुए रत्नों को खोजने के लिए कम प्रसिद्ध और दुर्लभ व्यंजनों को आज़माना होगा।"
    • परिणाम: यह शेफ को उसके कंफर्ट ज़ोन से बाहर निकलने और रसोई के उन हिस्सों को खोजने के लिए मजबूर करता है जिन्हें वह आमतौर पर अनदेखा करता है।
  4. "मेमोरी बैंक" (Replay Buffer)

    • उपमा: यदि शेफ केवल अभी बनाए गए व्यंजनों से सीखता है, तो वह तीन राउंड पहले बनाया गया एक बेहतरीन व्यंजन भूल सकता है। यह टूल अब तक मिले सबसे अच्छे व्यंजनों की एक "हाइलाइट रील" रखता है और उन्हें वापस ट्रेनिंग में शामिल करता है।
    • परिणाम: यह सीखने की प्रक्रिया को स्थिर करता है ताकि नई चीजें आजमाते समय शेफ अपनी सबसे अच्छी खोजों को न भूल जाए।
  5. "सेफ्टी नेट" (Validity Penalty)

    • उपमा: परफेक्ट डिश खोजने की दौड़ में, शेफ शुद्ध हवा या खाने योग्य नहीं पत्थरों से "डिश" बनाने की कोशिश कर सकता है (अवैध अणु/invalid molecules)। यह टूल किसी भी ऐसी चीज़ को बड़ा "थम्स डाउन" देता है जो वास्तविक, खाने योग्य डिश नहीं है।
    • परिणाम: यह शेफ को असंभव विचारों पर समय बर्बाद करने से रोकता है, यह सुनिश्चित करता है कि हर प्रयास एक वास्तविक, पकाए जाने योग्य अणु हो।

बड़ी खोज: छोटे अणु बनाम प्रोटीन (The Big Discovery: Small Molecules vs. Proteins)

पेपर ने पाया कि यह "फुल रेसिपी" छोटे अणुओं (जैसे नई दवाओं) के लिए अद्भुत रूप से काम करती है

  • क्यों? शेफ का मूल ज्ञान (प्रायर) बहुत व्यापक और जेनेरिक है। एक महान नई दवा खोजने के लिए, शेफ को जो वह आमतौर पर बनाता है उससे एक बहुत बड़ी छलांग लगानी पड़ती है। ऊपर दिए गए उपकरण उन्हें सुरक्षित रूप से वह बड़ी छलांग लगाने में मदद करते हैं।

हालाँकि, प्रोटीन (जैसे एक विशिष्ट एंजाइम बनाना) के लिए, परिणाम इतने नाटकीय नहीं थे।

  • क्यों? शेफ पहले से ही विशेषज्ञ था। उन्हें विशेष रूप से प्रोटीन के उस परिवार पर प्रशिक्षित किया गया था, इसलिए "महान" व्यंजन उनके द्वारा बनाए जाने वाले ज्ञान के काफी करीब थे। उन्हें एक बड़ी छलांग लगाने की आवश्यकता नहीं थी, इसलिए "एंटी-ग्रुपथिंक" और "हेल मैरी" जैसे उपकरण कम आवश्यक थे।

अंतिम निर्णय (The Final Verdict)

लेखकों ने अपने "ऑनलाइन अडैप्टेशन" लूप की तुलना दो अन्य सामान्य तरीकों से की:

  1. ऑफलाइन फाइन-ट्यूनिंग (Offline Fine-tuning): शेफ को डेटा के एक बड़े ढेर के साथ एक बार सिखाना, और फिर उन्हें किचन में भेज देना।
  2. इन्फरेंस-टाइम सर्च (Inference-Time Search): शेफ को एक साथ 1,000 व्यंजन बनाने के लिए कहना और बीच में सीखे बिना उनमें से सबसे अच्छा चुनना।

विजेता: "ऑनलाइन अडैप्टेशन" लूप (5-टूल रेसिपी) जीत गया।

  • इसने कम क्रिटिक टेस्टिंग (ओरेकल कॉल्स) के साथ बेहतर अणु खोजे।
  • यह कंप्यूटर समय (GPU आवर्स) के मामले में अधिक कुशल था।
  • यह विशेष रूप से तब शक्तिशाली था जब सबसे अच्छा समाधान शेफ के मूल ज्ञान से बहुत दूर था।

संक्षेप में: सबसे अच्छा नया अणु खोजने के लिए, केवल रैंडम अनुमान न लगाएं या केवल एक बार न सीखें। इसके बजाय, एक स्मार्ट लूप का उपयोग करें जो जोखिम भरे विचारों का पता लगाता है, केवल शीर्ष प्रदर्शन करने वालों पर ध्यान केंद्रित करता है, AI को उसके कंफर्ट ज़ोन से बाहर निकलने के लिए मजबूर करता है, पिछली सफलताओं को याद रखता है, और सब कुछ वैध रखता है। यह संयोजन उच्च-इनाम वाले अणुओं की खोज करने का सबसे कुशल तरीका है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →