← नवीनतम पेपर
🤖 machine learning

Preserve Support, Not Correspondence: Dynamic Routing for Offline Reinforcement Learning

DROL (Dynamic Routing for Offline Reinforcement Learning) एक टॉप-1 डायनेमिक रूटिंग मैकेनिज्म का उपयोग करके वन-स्टेप ऑफलाइन RL एक्टर्स में सुधार करता है जो डेटासेट एक्शन्स को KK लेटेंट-कंडीशन्ड उम्मीदवारों में से निकटतम के असाइन करता है, जिससे मॉडल को पारंपरिक पॉइंटवाइज एक्सट्रैक्शन द्वारा उत्पन्न संघर्षपूर्ण ग्रेडिएंट्स के बिना स्थानीय पॉलिसी सुधार करने की अनुमति मिलती है।

मूल लेखक: Zhancun Mu, Guangyu Zhao, Yiwu Zhong, Chi Zhang

प्रकाशित 2026-04-27
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Zhancun Mu, Guangyu Zhao, Yiwu Zhong, Chi Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

समस्या: "ज़िद्दी छात्र" की दुविधा

कल्पना कीजिए कि आप एक छात्र हैं जो एक जटिल, भीड़भाड़ वाले शहर में रास्ता खोजना सीख रहे हैं। आपके पास एक शिक्षक (एक सुपर-इंटेलिजेंट GPS) है जो आपको बता सकता है कि बिल्कुल कौन सा रास्ता लेना है। हालाँकि, आप एक "वन-स्टेप" (One-Step) छात्र बनना चाहते हैं: आप हर एक सेकंड में GPS से सलाह नहीं लेना चाहते; आप चाहते हैं कि आप किसी सड़क के कोने को देखें और बस तुरंत जान जाएँ कि कहाँ जाना है।

वर्तमान AI (ऑफलाइन रीइन्फोर्समेंट लर्निंग) में, छात्र शिक्षक की नकल करके सीखते हैं। लेकिन इसमें एक पेंच है। शिक्षक अक्सर एक विशिष्ट क्षण के लिए एक विशिष्ट निर्देश देता है (जैसे, "इस सटीक चौराहे पर, बाएँ मुड़ें")।

समस्या यह है कि छात्र उस विशिष्ट निर्देश के प्रति बहुत जुनूनी हो जाता है। यदि शिक्षक कहता है "बाएँ मुड़ें," और छात्र को एहसास होता है कि "थोड़ा सा बाएँ मुड़ना" वास्तव में बहुत तेज़ और सुरक्षित होगा, तो छात्र बदलने से इनकार कर देता है। वे शिक्षक के शब्दों से "बंधे" हुए महसूस करते हैं। वे समझौता करते हैं—एक औसत दर्जे का बीच का रास्ता अपनाते हैं—बजाय इसके कि वे सबसे अच्छे स्थानीय मार्ग को खोज सकें। वे कन्रेस्पोंडेंस (सटीक निर्देश) को सुरक्षित रखने की कोशिश कर रहे होते हैं, न कि सपोर्ट (यह तथ्य कि सड़क वास्तव में चलने योग्य है) को।


समाधान: DROL ("डायनेमिक रूममेट" रणनीति)

शोधकर्ताओं ने DROL नामक एक नई विधि प्रस्तावित की है। एक छात्र द्वारा हर विशिष्ट निर्देश को याद करने के बजाय, DROL छात्र को "कैंडिडेट्स" (उम्मीदवारों) की एक टीम देता है (इन्हें रूममेट्स या साथियों के एक समूह के रूप में सोचें) प्रशिक्षण के दौरान।

1. रूममेट असाइनमेंट (डायनेमिक रूटिंग)

हर किसी के लिए सब कुछ बनने की कोशिश करने के बजाय, DROL कहता है: "शहर के हर सड़क के कोने के लिए, हम KK अलग-अलग रूममेट्स भेजेंगे। प्रत्येक रूममेट मोहल्ले के एक अलग हिस्से पर 'दावा' करने की कोशिश करेगा।"

जब कोई डेटा आता है (जैसे, "इस कोने पर, ड्राइवर ने दाईं ओर मुड़ा"), तो DROL किसी विशिष्ट छात्र को उसे रटने के लिए मजबूर नहीं करता है। इसके बजाय, यह रूममेट्स को देखता है और पूछता है: "कौन सा रूममेट वर्तमान में उस दाहिने मोड़ के सबसे करीब खड़ा है?"

जो रूममेट सबसे करीब है, वही "विजेता" (Winner) है। केवल वही विजेता को यह निर्देश मिलता है कि "दाएं कैसे मुड़ना है, यह सीखो।"

2. "हैंड-ऑफ" (ज़िम्मेदारी का हस्तांतरण)

यही जादुई हिस्सा है। क्योंकि रूममेट्स लगातार घूम रहे हैं और सीख रहे हैं, वे ज़िम्मेदारियों का आदान-प्रदान कर सकते हैं।

कल्पना कीजिए कि रूममेट A वर्तमान में "पार्क के उत्तरी भाग" के लिए जिम्मेदार है। जैसे-जैसे रूममेट A एक बेहतर नेविगेटर बनने लगता है, उसे एहसास हो सकता है, "अरे, मैं वास्तव में तेज़ हाईवे रूट में बहुत अच्छा हो रहा हूँ!" जैसे ही रूममेट A हाईवे की ओर बढ़ता है, रूममेट B हस्तक्षेप कर सकता है और कह सकता है, "मैं पार्क के उत्तरी भाग की जिम्मेदारी संभाल लूँगा; अब मैं इसके अधिक करीब हूँ।"

पुराने तरीकों में, किसी पथ का "स्वामित्व" एक विशिष्ट लेटेंट कोड (एक विशिष्ट छात्र) से चिपका हुआ था। DROL में, स्वामित्व तरल (fluid) है। यह एक छात्र को एक "बेहतर" क्रिया (उच्च Q-वैल्यू) की ओर बढ़ने की अनुमति देता है बिना मानचित्र में कोई "छेद" छोड़े, क्योंकि दूसरा छात्र तुरंत उस स्थान को कवर करने के लिए आगे आ सकता है।


यह क्यों महत्वपूर्ण है (TL;DR)

  • पुराना तरीका (पॉइंटवाइज कन्रेस्पोंडेंस): छात्र एक पूर्णतावादी (perfectionist) है जो शिक्षक के सटीक शब्दों से भटकने से डरता है, भले ही शिक्षक का रास्ता थोड़ा अक्षम हो।
  • DROL तरीका (डायनेमिक रूटिंग): छात्र एक समन्वित टीम है। वे मानचित्र को कवर करने (सपोर्ट को सुरक्षित करने) पर ध्यान केंद्रित करते हैं, न कि शब्दों की नकल करने (कन्रेस्पोंडेंस को सुरक्षित करने) पर।

परिणाम:
AI जटिल, "मल्टीमॉडल" कार्यों (ऐसी स्थितियाँ जहाँ कुछ करने के कई अलग-अलग "सही" तरीके होते हैं, जैसे भूलभुलैया में रास्ता खोजना) में बहुत बेहतर हो जाता है। यह उपयोग में तेज़ और सस्ता रहता (one-step inference), लेकिन यह बहुत स्मार्ट है क्योंकि इसने अपने "रूममेट्स" को पूरे क्षेत्र को कुशलतापूर्वक कवर करने के लिए विशेषज्ञ बनाने के लिए प्रशिक्षित किया है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →