← नवीनतम पेपर
🤖 machine learning

Rooted Absorbed Prefix Trajectory Balance with Submodular Replay for GFlowNet Training

यह शोध पत्र RapTB प्रस्तुत करता है, जो एक GFlowNet प्रशिक्षण उद्देश्य है जो अवशोषित प्रत्यय-आधारित बैकअप (absorbed suffix-based backups) के माध्यम से प्रारंभिक प्रीफिक्स के लिए क्रेडिट असाइनमेंट में सुधार करता है, और SubM, एक उप-मॉड्यूलर रिप्ले रणनीति जो वितरण विस्थापन (distribution shift) को कम करने के लिए है, जो सामूहिक रूप से मोड कोलैप्स को संबोधित करते हैं और अणु निर्माण (molecule generation) जैसे कार्यों में विविधता को बढ़ाते हैं।

मूल लेखक: Xi Wang, Wenbo Lu, Shengjie Wang

प्रकाशित 2026-07-21
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Xi Wang, Wenbo Lu, Shengjie Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कहानियाँ लिखना या नई दवाएँ डिज़ाइन करना सिखा रहे हैं। आप चाहते हैं कि रोबोट रचनात्मक हो, कई अलग-अलग अच्छे समाधान खोजे, न कि केवल एक ही सटीक उत्तर। यह जेनरेटिव फ्लो नेटवर्क (GFlowNets) की दुनिया है। इन्हें एक विशेष प्रकार के रोबोटिक मस्तिष्क के रूप में समझें जो संभावनाओं के एक विशाल भूलभुलैया (maze) में घूमना सीखता है। एक मानक रोबोट के विपरीत, जो केवल निकास तक पहुँचने के लिए एकल "सर्वश्रेष्ठ" पथ खोजने की कोशिश करता है, एक GFlowNet ऐसे घूमना सीखता है जो प्रत्येक पथ के "पुरस्कार" (reward) से मेल खाता हो। यदि कोई पथ खजाने के संदूक (उच्च पुरस्कार) की ओर ले जाता है, तो रोबोट को वहां अक्सर जाना चाहिए, लेकिन उसे अन्य अच्छे खजानों पर भी जाना चाहिए, न कि केवल सबसे बड़े खजाने पर। विज्ञान के लिए यह अत्यंत महत्वपूर्ण है क्योंकि वास्तविक दुनिया की समस्याएं, जैसे कि एक नई दवा का आविष्कार करना, अक्सर कई अलग-अलग वैध समाधान रखती हैं, और हम उन सभी को यथासंभव अधिक खोजना चाहते हैं।

हालाँकि, इसमें एक पेंच है। जब ये रोबोट सीखने की कोशिश करते हैं, तो वे अक्सर एक ही ढर्रे में फंस जाते हैं। वे एक छोटे, आसान रास्ते को खोज सकते हैं जो थोड़े से पुरस्कार की ओर ले जाता है और फिर कहीं और देखने से इनकार कर सकते हैं, जिससे वे उन लंबी, जटिल राहों को अनदेखा कर देते हैं जो अद्भुत खोजों की ओर ले जाती हैं। इसे "मोड कोलैप्स" (mode collapse) कहा जाता है। यह एक ऐसे छात्र की तरह है जिसे गणित की समस्या को हल करने का एक आसान तरीका मिल जाता है और फिर वह किसी अन्य विधि को सीखने से इनकार कर देता है, भले ही वे विधियाँ बाद में कठिन समस्याओं को हल करने में उसकी मदद करती हों। बड़ा सवाल जो शोधकर्ता सामना करते हैं, वह यह है: हम रोबोट को जिज्ञासु और विविध कैसे बनाए रखें, यह सुनिश्चित करते हुए कि वह पूरे भूलभुलैया की खोज करे बिना ऊब जाए या केवल एक ही कोने में फंस जाए?

यह शोध पत्र एक नया प्रशिक्षण तरीका पेश करता है जिसे RapTB (Rooted Absorbed Prefix Trajectory Balance) कहा जाता है, जिसे एक स्मार्ट मेमोरी सिस्टम SubM (Submodular Replay) के साथ जोड़ा गया है ताकि इन समस्याओं को ठीक किया जा सके। लेखकों ने पाया कि रोबोट के पिछले प्रशिक्षण तरीके एक ऐसे शिक्षक की तरह थे जो केवल एक लंबी कहानी के बिल्कुल अंत में फीडबैक देता था। यदि कहानी अच्छी समाप्त हुई, तो शिक्षक कहता "अच्छा काम किया!" लेकिन यह नहीं समझाता था कि शुरुआत क्यों अच्छी या बुरी थी। इसने रोबोट को भ्रमित कर दिया कि कौन से शुरुआती चुनाव सफलता की ओर ले गए, जिससे वह बार-बार एक ही तरह के छोटे, सुरक्षित आरंभ दोहराने लगा (एक समस्या जिसे "प्रिफिक्स कोलैप्स" कहा जाता है)।

इसे ठीक करने के लिए, RapTB एक बुद्धिमान मार्गदर्शक की तरह कार्य करता है जो हर कदम पर फीडबैक देता है। यह अंतिम पुरस्कार को देखता है और उस सफलता को पीछे की ओर "अवशोषित" (absorb) करता है, रोबोट को बताता है, "हे, तुम्हारे द्वारा शुरुआत में किए गए चुनाव वास्तव में इस शानदार अंत का हिस्सा थे!" यह रोबोट को एक स्पष्ट मानचित्र देता है कि पहले शब्द से ही एक अच्छी कहानी कैसे बनाई जाए। इसके अतिरिक्त, यह शोध पत्र तर्क देता है कि केवल "सर्वश्रेष्ठ" कहानियों को याद रखना ही पर्याप्त नहीं है; रोबोट का मेमोरी बैंक लगभग एक जैसे दिखने वाले (near-duplicates) उदाहरणों से भर सकता है। इसलिए, उन्होंने SubM जोड़ा, जो एक स्मार्ट लाइब्रेरियन की तरह है जो मेमोरी को ताज़ा करता है। केवल उच्चतम स्कोर वाली कहानियों को रखने के बजाय, SubM उच्च गुणवत्ता वाली कहानियों का एक ऐसा मिश्रण चुनता है जो एक-दूसरे से बहुत भिन्न हों और जिनकी लंबाई भी अलग-अलग हो। यह सुनिश्चित करता है कि रोबोट उदाहरणों के एक विविध पुस्तकालय से सीखे, न कि एक दोहराव वाले लूप से।

शोधकर्ताओं ने रासायनिक अणुओं (जिन्हें SMILES नामक टेक्स्ट स्ट्रिंग्स के रूप में दर्शाया जाता है) और गणितीय पहेलियों (जैसे संख्या 24 बनाना) जैसे कार्यों पर इसका परीक्षण किया। उन्होंने पाया कि उनका नया तरीका, RapTB + SubM, पिछले तकनीकों की तुलना में लगातार बेहतर प्रदर्शन करता है। इसने ऐसे अणु तैयार किए जो न केवल रासायनिक रूप से वैध थे, बल्कि बहुत अधिक विविध और उच्च गुणवत्ता वाले भी थे। गणितीय पहेलियों में, इसने छोटे, आसान उत्तरों में अटके बिना कई अधिक सही समाधान खोजे। यह शोध पत्र सुझाव देता है कि चरण-दर-चरण क्रेडिट असाइनमेंट को एक विविध मेमोरी रणनीति के साथ जोड़कर, हम इन AI सिस्टमों को अधिक मजबूत, रचनात्मक और विश्वसनीय खोजकर्ता के रूप में प्रशिक्षित कर सकते हैं, जिससे वे एक ही, संकीर्ण समाधान में फंस जाने के जाल से बच सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →