← नवीनतम पेपर
🤖 AI

Flowing Through States: Neural ODE Regularization for Reinforcement Learning

यह शोध पत्र एक न्यूरल ODE-आधारित नियमितीकरण विधि प्रस्तावित करता है जो प्रतिनिधित्व शिक्षण (representation learning) को पर्यावरण के विकास के साथ संरेखित करने के लिए लेटेंट डायनेमिक्स को स्पष्ट रूप से मॉडल करता है, जिससे एटाारी (Atari) और ग्रिडवर्ल्ड बेंचमार्क पर एक्टर-क्रिटिक सुदृढीकरण शिक्षण एल्गोरिदम का प्रदर्शन महत्वपूर्ण रूप से सुधर जाता है।

मूल लेखक: Mohamed Ghanem, Bernd Finkbeiner

प्रकाशित 2026-08-10
📖 9 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mohamed Ghanem, Bernd Finkbeiner

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को भूलभुलैया (maze) में नेविगेट करना सिखा रहे हैं। मशीन लर्निंग की दुनिया में, यह रोबोट भूलभुलैया को दीवारों और फर्श के रूप में नहीं देखता; इसके बजाय, वह संख्याओं के एक बादल को देखता है, एक "लेटेंट स्पेस" (latent space), जहाँ हर स्थान एक विशाल, अदृश्य मानचित्र में एक बिंदु है। चुनौती यह है कि जबकि वास्तविक दुनिया सुचारू, तार्किक चरणों में चलती है—जैसे कि एक कार का मोड़ लेना या एक गेंद का ढलान से नीचे लुढ़कना—रोबोट का आंतरिक मानचित्र अक्सर अराजक रूप से उछलता रहता है। यह दो बहुत समान स्थानों को पूरी तरह से अलग मान सकता है, या दो बहुत अलग स्थानों को एक जैसा, क्योंकि गणित जिसका उपयोग यह सीखने के लिए करता है, स्वाभाविक रूप से समय के प्रवाह और कारण-और-प्रभाव का सम्मान नहीं करता है। यह एक बड़ी समस्या है क्योंकि यदि रोबोट का आंतरिक मानचित्र अव्यवस्थित है, तो वह भ्रमित हो जाता है और धीरे सीखता है। वैज्ञानिक इसे ठीक करने के लिए रोबोट के मस्तिष्क को यह समझने के लिए मजबूर करना चाहते हैं कि दुनिया एक निरंतर धारा के रूप में चलती है, न कि केवल असंबद्ध स्नैपशॉट की एक श्रृंखला के रूप में।

"फ्लोइंग थ्रू स्टेट्स" (Flowing Through States) नामक यह शोध पत्र इस अव्यवस्थित मानचित्र को ठीक करने का एक चतुर तरीका प्रस्तावित करता है। लेखक सुझाव देते हैं कि रोबोट की भूलभुलैया के माध्यम से यात्रा को यादों के random उछाल के रूप में नहीं, बल्कि एक परिदृश्य के माध्यम से बहती एक चिकनी नदी के रूप में देखना चाहिए। वे एक गणितीय उपकरण का उपयोग करते हैं जिसे "न्यूरल ऑर्डिनरी डिफरेंशियल इक्वेशन" (Neural ODE) कहा जाता है, जो अनिवार्य रूप से एक सुचारू, अटूट पथ का वर्णन करने का एक शानदार तरीका है। इसे इस तरह सोचें: यदि आप एक पत्ती को धारा में छोड़ते हैं, तो उसका पथ पानी की लहरों द्वारा निर्धारित होता है; वह अचानक धारा के विपरीत ऊपर नहीं जा सकती या बगल में नहीं कूद सकती। शोध पत्र का तर्क है कि रोबoret के दुनिया के प्रति आंतरिक समझ को भी इसी तरह व्यवहार करना चाहिए। एक विशेष "रेगुलराइजेशन" (regularization) नियम—एक प्रकार का प्रशिक्षण दंड—जोड़कर, लेखक रोबोट को अपने आंतरिक मानचित्र को इन सुचारू, नदी जैसे प्रवाहों के साथ संरेखित करने के लिए मजबूर करते हैं। उन्होंने एटाari (Atari) और ग्रिड-आधारित पहेलियों जैसे वीडियो गेम पर इसका परीक्षण किया, और पाया कि जब रोबोट के आंतरिक मानचित्र नदी की तरह सुचारू रूप से बहते थे, न कि एक लिली पैड पर कूदने वाले मेंढक की तरह उछलते थे, तो वे बहुत तेजी से सीखते थे और बेहतर खेलते थे।

समस्या: रोबोट का अराजक मानचित्र

यह समझने के लिए कि यह क्यों महत्वपूर्ण है, कल्पना कीजिए कि एक रोबोट ब्रेकआउट (Breakout) जैसा वीडियो गेम खेलना सीख रहा है। हर बार जब गेम स्क्रीन बदलती है, तो रोबोट एक तस्वीर लेता है और उसे समझने के लिए संख्याओं की एक सूची (एम्बेडिंग) में बदल देता है। एक आदर्श दुनिया में, यदि गेंद थोड़ी सी दाईं ओर चलती है, तो रोबोट की संख्याओं की सूची में भी थोड़ा सा बदलाव होना चाहिए। लेकिन वास्तव में, विशेष मार्गदर्शन के बिना, न्यूरल नेटवर्क उछल-कूद वाले हो सकते हैं। गेम में एक छोटा सा बदलाव रोबोट के आंतरिक नंबरों को बेतहाशा बदल सकता है, जैसे कि गेंद स्क्रीन के दूसरी ओर टेलीपोर्ट हो गई हो।

ऐसा इसलिए होता है क्योंकि रोबोट अलग-अलग स्नैपशॉट से सीख रहा है। वह स्थिति A देखता है, फिर स्थिति B, लेकिन वह स्वाभाविक रूप से यह नहीं जानता कि B केवल A का एक सुचारू विस्तार है। यह एक स्टैक डिस्कनेक्टेड फोटो देखकर कार चलाना सीखने जैसा है; आप जान सकते हैं कि कार कैसी दिखती है, लेकिन आप यह नहीं समझ पाएंगे कि स्टीयरिंग व्हील समय के साथ पहियों को कैसे सुचारू रूप से घुमाता है। शोध पत्र बताता है कि रोबोट के मस्तिष्क के कुछ हिस्से वस्तुओं को पहचानने में अच्छे हैं (जैसे ईंट देखना), लेकिन वे अनिवार्य रूप से उन वस्तुओं के हिलने और बदलने की गतिशीलता (dynamics) को समझने में अच्छे नहीं हैं।

समाधान: विचारों की नदी

लेखक मोहम्मद घनेम और बर्नड फिंकबीनर एक तकनीक पेश करते हैं जिसे वे FlowReg कहते हैं। उनका बड़ा विचार भौतिकी की एक अवधारणा को उधार लेना है: यह विचार कि यदि आप जानते हैं कि अभी कोई चीज़ कहाँ है, और आप जानते हैं कि इसके चलने के नियम क्या हैं, तो आप सटीक भविष्यवाणी कर सकते हैं कि यह अगली बार कहाँ होगी। गणित में, इसे ऑर्डिनरी डिफरेंशियल इक्वेशन (ODE) द्वारा वर्णित किया गया है।

कल्पित करें कि रोबोट का आंतरिक मानचित्र एक परिदृश्य है। FlowReg के बिना, रोबोट एक बड़ा, अजीब कदम उठाकर बिंदु A से बिंदु B तक जा सकता है। FlowReg के साथ, लेखक रोबोट को यह कल्पना करने के लिए मजबूर करते हैं कि उस परिदृश्य के माध्यम से एक अदृश्य नदी बह रही है। रोबोट को फिर उस नदी की धारा के साथ चलने के लिए प्रशिक्षित किया जाता है।

वे इसे इस प्रकार करते हैं:

  1. नदी का मॉडल: वे एक अलग, छोटा न्यूरल नेटवर्क ("फ्लो मॉडल") बनाते हैं जो इस अदृश्य नदी के मानचित्र के रूप में कार्य करता है। यह नदी सुचारू और निरंतर होने के लिए डिज़ाइन की गई है।
  2. संरेखण (Alignment): जैसे-जैसे रोबोट गेम खेलना सीखता है, वह अपने आंतरिक मानचित्र में बिंदुओं का एक पथ (ट्रैजेक्टरी) बनाता है। FlowReg इस ऊबड़-खाबड़ पथ की तुलना सुचारू नदी से करता है।
  3. दंड (Penalty): यदि रोबोट का पथ नदी के आर-पार कूदने या टेढ़ा-मेढ़ा चलने की कोशिश करता है, तो सिस्टम उसे एक "दंड" (loss function) देता है। यह रोबोट को अपने आंतरिक मानचित्र को समायोजित करने के लिए मजबूर करता है ताकि उसका पथ नदी की तरह सुचारू रूप से बहे।

महत्वपूर्ण बात यह है कि रोबोट गेम खेलते समय वास्तव में नदी का उपयोग नहीं करता है। नदी का उपयोग केवल प्रशिक्षण के दौरान एक मार्गदर्शक, एक "रेगुलराइज़र" के रूप में किया जाता है, ताकि रोबोट के मस्तिष्क को आकार दिया जा सके। एक बार प्रशिक्षित होने के बाद, वह एक सामान्य रोबोट की तरह खेलता है, लेकिन उसका मस्तिष्क अब बहुत बेहतर तरीके से व्यवस्थित है।

परिणाम: सुचारू पथ, बेहतर स्कोर

टीम ने 11 अलग-अलग एटाari गेम्स (जैसे Qbert, River Raid, और Beam Rider) और कुछ ग्रिड-वर्ल्ड पजल्स पर इस विचार का परीक्षण किया। उन्होंने अपने FlowReg रोबोट्स की तुलना मानक रोबोट्स से की जिनके पास यह सुचारू-प्रवाह प्रशिक्षण नहीं था।

परिणाम प्रभावशाली थे। FlowReg रोबोट्स ने मानक रोबोट्स की तुलना में लगातार उच्च स्कोर किया। उदाहरण के लिए, Qbert गेम में, मानक रोबोट का औसत स्कोर लगभग 4,374 अंक था। FlowReg रोबोट ने, "इंडेक्स" (Index) नामक एक विशिष्ट समय-सैंपलिंग विधि का उपयोग करते हुए, औसत 8,306 अंकों तक का उछाल दिखाया। River Raid में, स्कोर लगभग 1,862 से बढ़कर 2,947 हो गया।

लेकिन यह केवल जीतने के बारे में नहीं था; यह इस बारे में था कि वे कैसे जीते। लेखकों ने "लेटेंट पाथ्स" (latent paths) का अध्ययन किया—वास्तविक रेखाएं जो रोबोटों ने अपने आंतरिक मानचित्रों में खींची थीं। उन्होंने पाया कि FlowReg रोबोट बहुत अधिक सुचारू, सीधी रेखाएं खींचते थे।

  • पथ की लंबाई (Path Length): मानक रोबोट का पथ लंबा और घुमावदार (जैसे नशे में टहलना) था, जबकि FlowReg रोबोट का पथ छोटा और कुशल था।
  • त्वरण (Acceleration): मानक रोबोट ने दिशा में अचानक, झटकेदार बदलाव किए (उच्च "एक्सेलरेशन एनर्जी"), जबकि FlowReg रोबोट स्थिर, कोमल वक्रों के साथ चला।

दिलचस्प बात यह है कि उन्होंने TACO नामक एक अलग विधि का भी परीक्षण किया, जो भविष्य की भविष्यवाणी करके पथों को सुचारू बनाने की कोशिश करती है। हालांकि TACO ने पथों को सुचारू बनाया, लेकिन इसने वास्तव में कुछ खेलों में रोबोट के प्रदर्शन को खराब कर दिया। यह सुझाव देता है कि केवल पथ को सुचारू बनाना पर्याप्त नहीं है; पथ को सही तरीके से सुचारू होना चाहिए, जो गेम के वास्तविक नियमों का सम्मान करता हो। FlowReg सफल रहा क्योंकि इसने यह सुनिश्चित करने के लिए ODE के अद्वितीय गुणों का उपयोग किया कि सुगमता (smoothness) गेम की गतिशीलता के अनुरूप हो।

यह क्यों महत्वपूर्ण है और आगे क्या है

शोध पत्र सुझाव देता है कि यह दृष्टिकोण इसलिए काम करता है क्योंकि यह रोबोट को दुनिया की एक "वैश्विक" (global) समझ देता है। केवल यह याद रखने के बजाय कि "स्थिति A से स्थिति B होती है," रोबोट उस अंतर्निहित "प्रवाह" को सीखता है जो सभी स्थितियों को जोड़ता है। यह उन खेलों में विशेष रूप से सहायक है जहाँ अवस्था स्थान (state space) विविक्त (discrete) होता है (जैसे वर्गों का ग्रिड), क्योंकि गेम में कोई प्राकृतिक "सुगमता" नहीं होती है—रोबोट को अपने स्वयं के मस्तिष्क में वह सुगमता आविष्कार करनी पड़ती है।

लेखक कुछ सीमाओं का उल्लेख करते हैं। उदाहरण के लिए, जो "नदी" वे बनाते हैं, वह खुद को काट नहीं सकती। एक वास्तविक भूलभुलैया में, आपको दो अलग-अलग दिशाओं से एक ही संकीले गलियारे से गुजरना पड़ सकता है। यदि नदी खुद को काट नहीं सकती, तो उसे उस विशिष्ट परिदृश्य को मॉडल करने में संघर्ष करना पड़ सकता है। हालाँकि, एटाari गेम्स की जटिल, उच्च-आयामी दुनिया के लिए, यह समस्या नहीं थी।

वे यह भी बताते हैं कि हालांकि यह "ऑन-पॉलिसी" (on-policy) लर्निंग (जहाँ रोबोट अपने स्वयं के वर्तमान कार्यों से सीखता है) के लिए बहुत अच्छा काम करता है, लेकिन अभी तक इसका परीक्षण "ऑफ-पॉलिसी" (off-policy) विधियों (जहाँ रोबोट पुराने डेटा से सीखता है) या मॉडल-आधारित एल्गोरिदम पर नहीं किया गया है। लेकिन फिलहाल, प्रमाण बताते हैं कि रोबोट को उनके आंतरिक अवस्थाओं के माध्यम से "बहना" सिखाना उन्हें स्मार्ट, तेज़ और अधिक सुसंगत शिक्षार्थी बनाने का एक शक्तिशाली तरीका है। यह मेंढक के अराजक उछाल को नदी की स्थिर, शक्तिशाली धारा में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →