← नवीनतम पेपर
📊 statistics

Information-Geometric Forward Policy Training in GFlowNets

यह शोध पत्र फिशर-राओ मेट्रिक और नेचुरल ग्रेडिएंट्स का लाभ उठाकर GFlowNets की फॉरवर्ड पॉलिसियों को प्रशिक्षित करने के लिए एक सूचना-ज्यामितीय (information-geometric) ढांचे को प्रस्तुत करता है, जो प्रक्षेपवक्र फिशर सूचना (trajectory Fisher information) के सटीक, मोंटे कार्लो या ग्राफिकल-मॉडल-आधारित सन्निकटन के माध्यम से संरचना-जागरूक अनुकूलन के लिए एक सिद्धांत-आधारित दृष्टिकोण प्रदान करता है।

मूल लेखक: Yordan Raykov, Rodrigo Veiga

प्रकाशित 2026-08-05
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yordan Raykov, Rodrigo Veiga

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

स्मार्ट गेसिंग की कला: मशीन लर्निंग के नए कंपास की एक यात्रा

कल्पना कीजिए कि आप एक रोबोट को बिल्ली की एक सटीक तस्वीर बनाना सिखाने की कोशिश कर रहे हैं, लेकिन आप उसे अंतिम चित्र दिखा नहीं सकते। आप केवल उसे बता सकते हैं, "वह कान थोड़ा ज़्यादा नुकीला लग रहा है," या "पूंछ सही जगह पर है।" यह जेनरेटिव फ्लो नेटवर्क्स (GFlowNets) की चुनौती है। ये एक प्रकार के चतुर आर्टिफिशियल इंटेलिजेंस हैं जिन्हें जटिल वस्तुओं—जैसे अणु (molecules), प्रोटीन संरचनाएं, या तार्किक आरेख—को चरण-दर-चरण बनाने के लिए डिज़ाइन किया गया है। पूरी तस्वीर को एक साथ अनुमान लगाने के बजाय, AI छोटे-छोटे निर्णयों की एक श्रृंखला बनाता है, जैसे एक के बाद एक लेगो ब्रिक रखना, जब तक कि अंतिम वस्तु बन न जाए। लक्ष्य यह सुनिश्चित करना है कि रोबंतु अक्सर ऐसी वस्तुएं बनाए जो "पुरस्कृत" (उपयोगी या दिलचस्प) हों।

हालाँकि, इसमें एक पेच है। यदि रोबोट एक ऐसे रूटीन में फंस जाता है जहाँ वह केवल उबाऊ, सुरक्षित वस्तुएं ही बनाता है, तो वह संभावनाओं के कोनों में छिपी रोमांचक, उच्च-पुरस्कार वाली वस्तुओं के बारे में कभी नहीं सीख पाता। इसे ठीक करने के लिए, वैज्ञानिक आमतौर पर रोबोट के "मस्तिष्क" (इसके पैरामीटर्स) को मानक गणित का उपयोग करके ट्यून करते हैं, जो हर कदम को एक सपाट मानचित्र पर सीधी रेखा के रूप में मानता है। लेकिन संभावनाओं की दुनिया सपाट नहीं है; यह एक ग्लोब की सतह की तरह घुमावदार है। कभी-कभी, एक सपाट मानचित्र पर गलत दिशा में दिया गया एक छोटा सा धक्का आपको मीलों दूर भटका सकता है। यह शोध पत्र पूछता है: क्या होगा यदि हम रोबोट को एक ऐसा कंपास दें जो उस दुनिया के घुमाव को समझ सके जिसकी वह खोज कर रहा है? इन्फॉर्मेशन ज्योमेट्री (Information Geometry) नामक गणित की एक शाखा का उपयोग करके, लेखक इन AI बिल्डरों को प्रशिक्षित करने का एक तरीका प्रस्तावित करते हैं ताकि वे केवल सीधी रेखाओं में न चलें, बल्कि संभावनाओं के प्राकृतिक घुमावों के साथ फिसलते हुए चलें, जिससे उन्हें खजाने खोजने में बहुत तेज़ी मिले।


शोध पत्र का बड़ा विचार: संभावनाओं की घुमावदार दुनिया में नेविगेशन

इस शोध पत्र के लेखक, योर्डन रेकोव और रोड्रिगो वेगा ने GFlowNets को प्रशिक्षित करने का एक नया तरीका निकाला है। उन्होंने महसूस किया कि इन AI बिल्डरों को सिखाने का मानक तरीका एक ऊंचे पहाड़ के क्षेत्र में एक सपाट, 2D मानचित्र का उपयोग करके नेविगेट करने जैसा है। यह छोटी पहाड़ियों के लिए ठीक काम करता है, लेकिन जब ज़मीन कठिन हो जाती है, तो आप रास्ता भटक जाते हैं। उनका समाधान? वे AI की निर्णय लेने की प्रक्रिया को केवल संख्याओं की एक सूची के रूप में नहीं, बल्कि एक सांख्यिकीय सैंपलर (statistical sampler) के रूप में देखते हैं—एक ऐसी मशीन जो संभावनाओं की एक धारा उत्पन्न करती है।

उन्होंने पाया कि यह मशीन एक विशेष, घुमावदार सतह पर रहती है जिसे सांख्यिकीय मैनिफोल्ड (statistical manifold) कहा जाता है। इसे एक गोले की सतह की तरह समझें। यदि आप एक गोले पर चल रहे हैं, तो दो बिंदुओं के बीच का सबसे छोटा रास्ता बीच से जाने वाली सीधी रेखा नहीं है (जो आपको ज़मीन के नीचे ले जाएगी); बल्कि यह सतह के साथ एक वक्र है जिसे जियोडेसिक (geodesic) कहा जाता है। शोध पत्र दिखाता है कि GFlowNets के लिए मानक प्रशिक्षण तरीके पृथ्वी के माध्यम से सीधी रेखा में चलने की कोशिश करने जैसे हैं, जो अक्षम है। इसके बजाय, लेखक नेचुरल ग्रेडिएंट्स (Natural Gradients) का उपयोग करने का प्रस्ताव देते हैं। यह एक शानदार गणितीय उपकरण है जो एक ऐसे GPS की तरह काम करता है जो जानता है कि ज़मीन घुमावदार है। यह AI को बताता है, "केवल अपने नंबरों को थोड़ा सा न बदलें; अपने पूरे स्ट्रैटेजी को उस दिशा में बदलें जो परिणाम को सबसे अधिक प्रभावित करती है, और इस बात का ध्यान रखें कि दुनिया का आकार क्या है।"

पथ खोजने के तीन तरीके

लेखकों ने केवल यह नहीं कहा, "इस जादुई गणित का उपयोग करें।" वे जानते थे कि सटीक वक्र की गणना करना कठिन है, इसलिए उन्होंने समस्या को तीन अलग-अलग "रेजीम" या परिदृश्यों में विभाजित किया, जो इस बात पर निर्भर करता है कि आपके पास कितनी जानकारी है:

  1. सटीक मानचित्र (Tabular Regime): सरल मामलों में जहाँ AI छोटा है और नियम स्पष्ट हैं (जैसे एक छोटा ग्रिड), आप दुनिया के सटीक घुमाव की गणना कर सकते हैं। यह एक छोटे पार्क के उच्च-रिज़ॉल्यूशन वाले 3D मानचित्र होने जैसा है। लेखक दिखाते हैं कि जब आप इस सटीक मानचित्र का उपयोग करते हैं, तो AI काफी तेज़ी से सीखता है।
  2. नमूना अनुमान (Monte Carlo Regime): बड़ी और अधिक अव्यवस्थित दुनिया में, आप पूरा मानचित्र नहीं बना सकते। इसके बजाय, आप आकार का अनुमान लगाने के लिए कुछ नमूने लेते हैं (जैसे यादृच्छिक स्थानों की तस्वीरें लेना)। शोध पत्र दिखाता है कि इन "स्नैपशॉट" के साथ भी, AI पुराने फ्लैट-मैप तरीके की तुलना में बेहतर सीखता है।
  3. स्मार्ट शॉर्टकट (Structure-Exploitable Regime): यह सबसे चतुर हिस्सा है। कभी-कभी, दुनिया में एक छिपा हुआ ढांचा होता है, जैसे एक पहेली जहाँ टुकड़े केवल कुछ खास तरीकों से ही फिट होते हैं। लेखक दिखाते हैं कि यदि आप इस संरचना को समझते हैं (जैसे कि यह जानना कि अणु के कुछ हिस्से दूसरों को प्रभावित नहीं करते), तो आप एक "सरोगेट" मानचित्र बना सकते हैं। यह पूर्ण नहीं है, लेकिन यह एक बहुत अच्छा अनुमान है जिसे कंप्यूट करना बहुत तेज़ है। वे गणितीय रूप से सिद्ध करते हैं कि जब तक आपका अनुमान पर्याप्त करीब है, AI अभी भी सही पथ खोज लेगा।

उन्होंने क्या पाया: तेज़, स्मार्ट और अधिक खोजपूर्ण

टीम ने नेटवर्क में त्रिभुजों को गिनने से लेकर प्रोटीन डेटा में छिपे पैटर्न खोजने तक, कई अलग-अलग चुनौतियों पर अपने विचार का परीक्षण किया। यहाँ उन्होंने जो पाया वह है:

  • तेज़ अभिसरण (Faster Convergence): लगभग हर परीक्षण में, उनके "घुमावदार" प्रशिक्षण पद्धति का उपयोग करने वाला AI मानक "सपाट" पद्धति की तुलना में लक्ष्य तक तेज़ी से पहुँचा। उदाहरण के लिए, एक "हाइपरग्रिड" पहेली (एक ग्रिड जिसमें छिपे हुए उच्च-पुरस्कार वाले स्थान हैं) पर, नई पद्धति ने उच्च-पुरस्कार वाले क्षेत्रों को बहुत तेज़ी से खोजा।
  • बेहतर अन्वेषण (Better Exploration): AI के साथ सबसे बड़ी समस्याओं में से एक यह है कि वह एक रूटीन में फंस जाता है और केवल आसान, स्पष्ट रास्तों की खोज करता है। लेखकों ने पाया कि उनके तरीके ने AI को मानचित्र के "भ्रामक" कोनों की खोज करने में मदद की—ऐसी जगहें जो उबाऊ दिखती हैं लेकिन जहाँ बड़े पुरस्कार छिपे होते हैं। "डिसैप्टिव ग्रिड" नामक एक परीक्षण में, उनके तरीके ने लगभग सभी उच्च-पुरस्कार वाले मोड (676 में से 666) खोज लिए, जबकि मानक पद्धति उन सभी को खोजने में संघर्ष कर रही थी।
  • वास्तविक दुनिया की सफलता: उन्होंने वास्तविक जैविक डेटा (Sachs प्रोटीन-सिग्नलिंग डेटासेट) पर भी इसका परीक्षण किया। हालाँकि यहाँ परिणाम थोड़े मिश्रित थे (यह दर्शाता है कि वास्तविक जीवन अव्यवस्थित है), फिर भी विधि ने दिखाया कि यह मानक उपकरणों की तुलना में इसके स्थानीय निर्णयों को अनुकूलित करने में सुधार कर सकती है।

यह क्या नहीं है (और यह क्या खारिज करता है)

यह जानना महत्वपूर्ण है कि यह शोध पत्र क्या दावा नहीं करता है। लेखक बहुत सावधानी बरतते हैं कि वे यह न कहें कि यह सब कुछ तुरंत हल करने वाला जादुई समाधान है।

  • यह अन्वेषण रणनीतियों का विकल्प नहीं है: वे स्पष्ट रूप से कहते हैं कि उनका तरीका मौजूदा विचारों के साथ काम करता है। यह इस आवश्यकता को नहीं बदलता कि AI को कभी-कभी जोखिम लेना चाहिए; यह केवल जोखिमों को स्मार्ट बनाता है।
  • यह हर मीट्रिक पर हमेशा "जीत" नहीं है: जटिल प्रोटीन डेटा परीक्षण में, नई पद्धति ने पूरी समस्या को जादुई रूप से हल नहीं किया या पूर्ण "कारण संरचना" (causal structure) नहीं खोजी। इसने सीखने की प्रक्रिया में सुधार किया, लेकिन अंतिम परिणाम अभी भी अन्य उन्नत तरीकों के साथ समान था। शोध पत्र सुझाव देता है कि लाभ बेहतर स्थानीय अनुकूलन से आते हैं, न कि मौलिक परिवर्तन से कि AI स्वयं क्या खोज सकता है।
  • यह एक "निरंतर" (continuous) ट्रिक नहीं है: कुछ अन्य तरीके डिस्क्रीट स्टेप्स (जैसे लेगो ब्रिक्स) को स्मूथ, निरंतर प्रवाह में बदलने की कोशिश करते हैं ताकि गणित आसान हो सके। लेखक इसके विरुद्ध तर्क देते हैं। वे चरणों को डिस्क्रीट और वास्तविक रखते हैं, और डिस्क्रीट स्टेप्स को सीधे निर्देशित करने के लिए घुमावदार गणित का उपयोग करते हैं। उनका मानना है कि यह समस्या की वास्तविक प्रकृति को बनाए रखता है।

निष्कर्ष

सरल शब्दों में, यह शोध पत्र सुझाव देता है कि जब हम एक AI को चरण-दर-चरण जटिल चीजें बनाना सिखा रहे हों, तो हमें इसकी सीखने की राह को एक सपाट, सीधी रेखा के रूप में मानना बंद कर देना चाहिए। यह स्वीकार करके कि संभावनाओं का स्थान घुमावदार है और एक विशेष "नेचुरल ग्रेडिएंट" कंपास का उपयोग करके, हम AI को बेहतर और अधिक विश्वसनीय रूप से सर्वोत्तम समाधान खोजने के लिए मार्गदर्शन कर सकते हैं। यह उत्तर दिशा की ओर इशारा करने वाले कंपास से एक ऐसे कंपास में अपग्रेड करने जैसा है जो वास्तव में खजाने की ओर इशारा करता है, और इलाके के आकार को ध्यान में रखता है। हालांकि यह हर समस्या को तुरंत हल नहीं करता है, परिणाम बताते हैं कि यह AI खोजकर्ताओं को स्मार्ट और अधिक कुशल बनाने के लिए एक शक्तिशाली नया उपकरण है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →