← नवीनतम पेपर
🤖 machine learning

GFlowNet Training by Policy Gradients

यह शोध पत्र एक नवीन GFlowNet प्रशिक्षण ढांचे का प्रस्ताव करता है जो नए नीति-आधारित (policy-based) तरीकों को व्युत्पन्न करने के लिए फ्लो बैलेंस (flow balance) को अपेक्षित पुरस्कार अनुकूलन (expected reward optimization) के साथ जोड़ता है, जिसमें फॉरवर्ड पॉलिसियों को संयुक्त रूप से प्रशिक्षित करने और बैकवर्ड पॉलिसियों को डिजाइन करने के लिए एक युग्मित रणनीति (coupled strategy) शामिल है, जो सैद्धांतिक रूप से गारंटीकृत है और सिम्युलेटेड एवं वास्तविक दुनिया के डेटासेट दोनों पर प्रदर्शन में सुधार के लिए अनुभवजन्य रूप से सिद्ध है।

मूल लेखक: Puhua Niu, Shili Wu, Mingzhou Fan, Xiaoning Qian

प्रकाशित 2026-08-06
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Puhua Niu, Shili Wu, Mingzhou Fan, Xiaoning Qian

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक ऐसी दुनिया है जहाँ आपको एक आदर्श रेसिपी, सबसे कुशल डिलीवरी रूट, या एक नया ड्रग मॉलिक्यूल खोजने की आवश्यकता है, लेकिन संभावित संयोजनों की संख्या इतनी विशाल है कि उन्हें एक-एक करके जांचने में ब्रह्मांड की आयु से भी अधिक समय लगेगा। यह "कॉम्बिनेटोरियल एक्सप्लोजन" (combinatorial explosion) की चुनौती है, एक ऐसी समस्या जो जीव विज्ञान से लेकर इंजीनियरिंग तक सब कुछ प्रभावित करती है। इसे हल करने के लिए, वैज्ञानिक एक चतुर उपकरण का उपयोग करते हैं जिसे जेनेरेटिव फ्लो नेटवर्क (GFlowNet) कहा जाता है। एक GFlowNet को एक कठोर नियम पुस्तिका के रूप में नहीं, बल्कि एक जादुई जल प्रणाली के रूप में सोचें। यह जटिल वस्तुओं को चरण-दर-चरण बनाता है, जैसे एक नदी घाटी के माध्यम से रास्ता बनाती है। इसका लक्ष्य यह सुनिश्चित करना है कि "पानी" (या प्रायिकता) इस तरह बहे कि नदी अंततः सबसे सुंदर, उच्च-पुरस्कार वाली घाटियों (सर्वश्रेष्ठ समाधानों) में ठीक उतनी ही बार पहुंचे जितनी बार वे घाटियाँ इसके योग्य हैं।

पारंपरिक रूप से, इस जल प्रणाली को सही ढंग से बहना सिखाना एक विशाल, अदृश्य तराजू को संतुलित करने की कोशिश करने जैसा था। पुराने तरीके, जिन्हें "वैल्यू-बेस्ड" (value-based) दृष्टिकोण कहा जाता है, इस बात पर ध्यान केंद्रित करते हैं कि क्या प्रत्येक जंक्शन पर पानी का स्तर एक विशिष्ट समीकरण से मेल खाता है। यह कुछ ऐसा है जैसे एक प्लंबर लगातार हर पाइप में दबाव को मापता रहता है ताकि कहीं कोई रिसाव न हो। हालांकि यह काम करता है, लेकिन यह धीमा और अनाड़ी हो सकता है, खासकर जब परिदृश्य अलग-थलग, उच्च-पुरस्कार वाले शिखरों से भरा हो जहाँ पहुँचना कठिन हो। शोधकर्ताओं ने पूछा: क्या ऐसा कोई तरीका है जिससे हम पानी की प्रणाली को केवल प्रत्येक स्टॉप पर दबाव की जाँच करने के बजाय, उसके द्वारा लिए गए पथ को पुरस्कृत करके सिखा सकें? वे इन नेटवर्कों को प्रशिक्षित करने का एक नया तरीका प्रस्तावित करते हैं जो एक गणितज्ञ द्वारा समीकरण हल करने के बजाय, एक वीडियो गेम चरित्र द्वारा अंक एकत्र करके भूलभुलैया दौड़ने के सीखने जैसा महसूस होता है।

प्रवाह को प्रशिक्षित करने का नया तरीका

लेखक, पुहुआ निउ और उनकी टीम ने GFlowNets के लिए एक नया प्रशिक्षण तरीका विकसित किया है जो ध्यान को "गणित की जाँच करने" से हटाकर "पुरस्कार का अनुसरण करने" पर केंद्रित करता है। पुराने विचारों में, नेटवर्क को पूरे मानचित्र में पानी के प्रवाह को संतुलित रखने के लिए प्रशिक्षित किया जाता था, एक ऐसी विधि जो पारंपरिक सुदृढीकरण लर्निंग (Reinforcement Learning - RL) के समान थी जो प्रत्येक अवस्था के मूल्य का अनुमान लगाती है। हालाँकि, नया दृष्टिकोण इसे सीधे एक पॉलिसी ग्रेडिएंट (policy gradient) समस्या के रूप में मानता है।

इसे समझने के लिए, कल्पना कीजिए कि आप एक कुत्ते को गेंद लाने के लिए सिखा रहे हैं।

  • पुराना तरीका (वैल्यू-बेस्ड): आप आँगन के हर संभावित स्थान पर खड़े होते हैं और गणना करते हैं कि उस स्थान का "फेचिंग वैल्यू" (गेंद लाने का मूल्य) कितना है। फिर आप कुत्ते के व्यवहार को समायोजित करते हैं ताकि हर एक स्थान पर गणित पूरी तरह से सटीक रहे। यह सटीक है, लेकिन इसके लिए हर घास के तिनके का मूल्य गणना करने के लिए बहुत मानसिक ऊर्जा की आवश्यकता होती है।
  • नया तरीका (पॉलिसी-बेस्ड): आप बस कहते हैं, "गुड डॉग!" जब कुत्ता गेंद की ओर दौड़ता है और "बैड डॉग" जब वह गलत दिशा में दौड़ता है। आपको आँगन के हर स्थान का मूल्य जानने की आवश्यकता नहीं है; आप बस उसके रास्ते में मिलने वाले पुरस्कारों के आधार पर उसके दौड़ने की शैली को समायोजित करते हैं।

यह पेपर एक विशेष प्रकार के "पुरस्कार" को पेश करता है जो उस रणनीति (या पॉलिसी) पर निर्भर करता है जिसका नेटवर्क वर्तमान में उपयोग कर रहा है। ऐसा करके, वे GFlowNets के जटिल फ्लो-बैलेंस समीकरणों और आधुनिक AI की सरल, अधिक प्रत्यक्ष "पुरस्कार और दंड" वाली सीखने की शैली के बीच के अंतर को पाटते हैं। उन्होंने पाया कि यह विधि नेटवर्क को बहुत तेज़ी से और मजबूती से सीखने की अनुमति देती है, विशेष रूप से तब जब "खजाना" (उच्च-पुरस्कार वाले समाधान) अलग-थलग स्थानों में छिपा हो जो ढूँढना कठिन हो।

उन्होंने क्या पाया और क्या टाला

शोधकर्ताओं ने अपने नए "रिवॉर्ड-बेस्ड" प्रशिक्षण का परीक्षण कई अलग-अलग चुनौतियों पर किया, जिसमें ग्रिड सिमुलेशन (जैसे एक विशाल शतरंज बोर्ड), जैविक अनुक्रमों का डिज़ाइन (जैसे DNA स्ट्रिंग्स), और आणविक संरचनाओं (जैसे नई दवाएं) का निर्माण शामिल है।

इन सिमुलेशन में, उनके नए तरीके, जिसे वे RL-G (एक स्मार्ट गाइड के साथ) और RL-T (सुरक्षित बदलावों को बनाए रखने के लिए एक "ट्रस्ट रीजन" का उपयोग करके) कहते हैं, ने लगातार पुराने तरीकों को पछाड़ दिया।

  • गति: नए तरीके बहुत तेज़ी से अभिसरण (समाधान ढूँढना) करते हैं। 256x256 ग्रिड प्रयोग में, नए तरीके पारंपरिक "ट्रैजेक्टरी बैलेंस" (TB) विधियों की तुलना में कम चरणों में कम त्रुटि दर तक पहुँच गए।
  • सटीकता: अंतिम परिणाम अक्सर अधिक सटीक होते हैं। उदाहरण के लिए, 256x256 ग्रिड में, उनके सर्वश्रेष्ठ तरीके (RL-G) ने लगभग 0.439 का टोटल वेरिएशन एरर प्राप्त किया, जबकि अगला सर्वश्रेष्ठ पारंपरिक तरीका (TB-U) लगभग 0.728 था। आणविक डिज़ाइन परीक्षणों में, उनके तरीकों ने पुराने तरीकों की तुलना में अधिक अद्वितीय "मोड्स" (विभिन्न उच्च-गुणवत्ता वाले समाधान) खोजे।

महत्वपूर्ण रूप से, यह पेपर इस विचार के विरुद्ध तर्क देता है कि हमें हमेशा जटिल, ऑफ-पॉलिसी सैंपलर (जैसे थॉम्पसन सैंपलिंग या रैंडम मिक्सिंग) पर निर्भर रहना चाहिए। जबकि वे तरीके "एक्सप्लोरेशन" (नई चीजें आज़माना) और "एक्सप्लोइटेशन" (जो काम करता है उसका उपयोग करना) को संतुलित करने की कोशिश करते हैं, लेखक दिखाते हैं कि अपने पॉलिसी-बेस्ड दृष्टिकोण के साथ मजबूत ग्रेडिएंट एस्टीमेशन का उपयोग करके, नेटवर्क बिना किसी जटिल बाहरी ट्रिक के स्वाभाविक रूप से सर्वोत्तम पथ खोज सकता है। उन्होंने केवल यह सुझाव नहीं दिया; उन्होंने कई डेटासेट्स पर इसे मापा और दिखाया कि नई रणनीतियाँ इन नेटवर्कों को प्रशिक्षित करने का एक अधिक स्थिर और कुशल तरीका प्रदान करती हैं।

"ट्रस्ट रीजन" और "गाइड"

यह सुनिश्चित करने के लिए कि नेटवर्क भ्रमित न हो जाए या किसी बुरी आदत में न फँस जाए, लेखकों ने दो विशेष सामग्रियां जोड़ीं:

  1. द ट्रस्ट रीजन (RL-T): कल्पना कीजिए कि आप एक कुत्ते को दौड़ना सिखा रहे हैं। यदि आप उसे बहुत जल्दी बहुत तेज़ दौड़ने के लिए कहते हैं, तो वह लड़खड़ा सकता है। "ट्रस्ट रीजन" एक पट्टे की तरह है जो एक कदम में कुत्ते के दौड़ने की शैली में होने वाले बदलाव को सीमित करता है। यह सीखने को स्थिर रखता है और नेटवर्क को जंगली, बुरे अनुमान लगाने से रोकता है। पेपर दिखाता है कि यह प्रशिक्षण को अधिक सहज और विश्वसनीय बनाता है।
  2. द गाइडेड पॉलिसी (RL-G): कभी-कभी, कुत्ते को थोड़े संकेत की आवश्यकता होती है। लेखकों ने एक "गाइडेड" पॉलिसी पेश की जो एक मानचित्र के रूप में कार्य करती है, जो नेटवर्क को धीरे से डेड एंड (कम-पुरस्कार वाले क्षेत्रों) से दूर और खजाने की ओर मोड़ती है। यह नेटवर्क को "रिवॉर्ड डेजर्ट्स" (पुरस्कार के रेगिस्तान) में फंसने से बचने में मदद करता है जहाँ पास में कोई अच्छा समाधान नहीं है।

यह क्यों मायने रखता है

पेपर इस निष्कर्ष के साथ समाप्त होता है कि GFlowNets के प्रशिक्षण को एक प्रत्यक्ष पुरस्कार-अनुकूलन (reward-optimization) समस्या के रूप में पुनर्गठित करके, हम जटिल वस्तुओं को उत्पन्न करने के लिए बेहतर, तेज़ और अधिक विश्वसनीय AI बना सकते हैं। चाहे वह नई दवा का डिज़ाइन बनाना हो, आपूर्ति श्रृंखला को अनुकूलित करना हो, या ब्रह्मांड की संरचना को समझना हो, यह विधि समाधान तक पहुँचने का एक अधिक सीधा मार्ग प्रदान करती है। लेखक अपने परिणामों के प्रति आश्वस्त हैं क्योंकि उन्होंने अपने दावों को कठोर गणितीय प्रमाणों और वास्तविक दुनिया एवं सिम्युलेटेड डेटा पर व्यापक प्रयोगों के साथ पुख्ता किया है। उन्होंने केवल यह अनुमान नहीं लगाया कि यह काम करेगा; उन्होंने दिखाया कि यह वास्तव में काम करता है, जो हमें AI को बनाने और खोजने के लिए सिखाने के तरीके में एक आशाजनक नई दिशा प्रदान करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →