← नवीनतम पेपर
🤖 machine learning

Drift Q-Learning

DriftQL एक नवीन ऑफलाइन सुदृढीकरण लर्निंग (reinforcement learning) विधि है जो एक ही नेटवर्क में ड्रिफ्ट-आधारित व्यवहारिक रेगुलराइज़र (behavioral regularizer) और क्रिटिक-संचालित नीति सुधार (critic-driven policy improvement) को जोड़कर एक ही फॉरवर्ड पास में कुशलतापूर्वक क्रियाएं उत्पन्न करती है, जो D4RL और OGBench पर अत्याधुनिक प्रदर्शन प्राप्त करती है और डिफ्यूजन एवं फ्लो-आधारित दृष्टिकोणों की तुलना में घटिया डेटा गुणवत्ता के प्रति बेहतर मजबूती प्रदर्शित करती है।

मूल लेखक: Anas Houssaini, Mohamad H. Danesh, Amin Abyaneh, Scott Fujimoto, Hsiu-Chin Lin, David Meger

प्रकाशित 2026-06-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Anas Houssaini, Mohamad H. Danesh, Amin Abyaneh, Scott Fujimoto, Hsiu-Chin Lin, David Meger

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक पुराने रोबोट के प्रयासों की वीडियो रिकॉर्डिंग का उपयोग करके भूलभुलैया (maze) में चलना सिखाने की कोशिश कर रहे हैं। आप नए रोबोट को वास्तविक दुनिया में कुछ भी नया करने की अनुमति नहीं दे सकते क्योंकि वह दुर्घटनाग्रस्त हो सकता है; उसे सख्ती से उस पुराने वीडियो से ही सीखना होगा। यह ऑफलाइन रीइन्फोर्समेंट लर्निंग (Offline Reinforcement Learning) की चुनौती है।

यह समस्या पेचीदा है: पुराना वीडियो रोबोट को गोल-गोल घूमते हुए या दीवारों से टकराते हुए (बुरे कार्यों) दिखा सकता है। यदि नया रोबोट बहुत "होशियार" बनने की कोशिश करता है और एक नया रास्ता बनाने की कोशिश करता है, तो वह एक "वर्जित क्षेत्र" (forbidden zone) में कदम रख सकता है जहाँ पुराना डेटा मौजूद नहीं है। इन अज्ञात क्षेत्रों में, उसका "स्कोरकार्ड" (वैल्यू एस्टीमेट) अविश्वसनीय होता है, और वह अनजाने में एक बहुत बुरा कदम चुन सकता है।

पुराना तरीका: धीमा, पुनरावृत्ति करने वाला कलाकार

पिछले तरीकों ने इसे डिफ्यूजन (Diffusion) या फ्लो (Flow) मॉडल का उपयोग करके हल करने की कोशिश की। इसे एक मूर्तिकार की तरह समझें जो संगमरमर के एक ब्लॉक से एक मूर्ति तराशने की कोशिश कर रहा है।

  • वे शोर (noise) के एक यादृच्छिक ढेर से शुरू करते हैं।
  • वे धीरे-धीरे इसे तराशते हैं, चरण-दर-चरण, बार-बार आकार को परिष्कृत करते हैं जब तक कि यह वीडियो में दिखने वाले एक वैध कार्य जैसा न दिखने लगे।
  • नुकसान: यह धीमा है। मूर्तिकला की तरह, अंतिम परिणाम प्राप्त करने के लिए कई चरणों की आवश्यकता होती है। इसे तेज़ बनाने के लिए, शोधकर्ताओं ने कभी-कभी ज्ञान को "डिस्टिल" (एक छात्र को मूर्तिकार की नकल करना सिखाना) करने की कोशिश की है, लेकिन यह जटिलता बढ़ाता है और इसके लिए अतिरिक्त उपकरणों की आवश्यकता होती है।

नया तरीका: DriftQL (एक "ड्रिफ्टिंग" दिशा-सूचक यंत्र)

लेखक DriftQL का प्रस्ताव देते हैं, जो एक मूर्तिकला उपकरण के बजाय रोबोट को एक स्मार्ट, एक-चरणीय दिशा-सूचक यंत्र (compass) देने जैसा है।

DriftQL कैसे काम करता है, इसे पार्क में लोगों की भीड़ के सरल उदाहरण से समझें:

  1. लक्ष्य: रोबोट को एक ऐसा कार्य (चलने की दिशा) चुनना है जो संभवतः अच्छा हो (उच्च इनाम/reward) लेकिन उसे पार्क की सीमाओं के भीतर रहना चाहिए (वह डेटा जो उसने देखा है)।
  2. "आकर्षण" बल (चुंबक): कल्पना करें कि रोबमाट कहाँ जाना है इसके लिए कुछ यादृच्छिक अनुमान लगाता है। DriftQL में एक चुंबकीय खिंचाव है जो इन अनुमानों को वीडियो में देखे गए वास्तविक रास्तों की ओर खींचता है। यह सुनिश्चित करता है कि रोबोट जंगल में न भटक जाए (आउट-ऑफ-डिस्ट्रीब्यूशन)।
  3. "विकर्षण" बल (व्यक्तिगत स्थान का बुलबुला): यदि रोबोट केवल चुंबक का अनुसरण करता है, तो उसके सभी अनुमान एक ही छोटे से बिंदु में सिमट जाएंगे। इसे रोकने के लिए, DriftQL एक "व्यक्तिगत स्थान" का नियम जोड़ता है। यदि रोबोट के अनुमान एक-दूसरे के बहुत करीब आते हैं, तो वे एक-दूसरे को दूर धकेलते हैं। यह रोबोट को केवल एक ही पथ पर फंसने के बजाय, सुरक्षित विकल्पों का एक विविध सेट खोजने में मदद करता है।
  4. "वैल्यू" बायस (स्कोरकार्ड): अंत में, रोबोट अपने "स्कोरकार्ड" को देखता है। यदि पार्क का एक विशिष्ट क्षेत्र उच्च इनाम (जैसे खजाना) वाला है, तो दिशा-सूचक यंत्र चुंबकीय खिंचाव को उस उच्च-मूल्य वाले क्षेत्र की ओर सूक्ष्म रूप से झुका देता है।

जादुई ट्रिक:
डिफ्यूजन/फ्लो जैसे मूर्तिकारों के विपरीत जिन्हें अपना उत्तर परिष्कृत करने के लिए 20 या 50 चरणों की आवश्यकता होती है, DriftQL यह सब एक ही चरण में कर देता है। यह तुरंत पूर्ण "ड्रिफ्ट" (धक्का और खिंचाव) की गणना करता है और तुरंत क्रिया (action) आउटपुट करता है।

यह क्यों महत्वपूर्ण है

लेखक दावा करते हैं कि DriftQL दोनों दुनियाओं का सबसे अच्छा हिस्सा है:

  • यह अभिव्यंजक (Expressive) है: धीमे मूर्तिकारों की तरह, यह जटिल, बहु-पथ स्थितियों (जैसे कई संभावित समाधानों वाली भूलभुलैया) को संभाल सकता है।
  • यह तेज़ है: एक साधारण, नियत (deterministic) रोबोट की तरह, यह एक ही क्षण में उत्तर उत्पन्न करता है। कोई धीमा मूर्तिकला नहीं, कोई अतिरिक्त "छात्र" नेटवर्क नहीं, कोई जटिल गणितीय समाधान नहीं।
  • यह मजबूत (Robust) है: जब वीडियो डेटा "गंदा" (बेतरतीब, बुरे कार्यों से भरा) होता है, तब भी DriftQL अच्छी तरह काम करता रहता है, जबकि अन्य तरीके संघर्ष करते हैं और विफल हो जाते हैं।

परिणाम

लेखकों ने मानक रोबोट बेंचमार्क (D4RL और OGBench) पर इसका परीक्षण किया।

  • प्रदर्शन: DriftQL ने लगातार धीमे, बहु-चरणीय तरीकों और सरल तरीकों को पछाड़ दिया। यह विशेष रूप से कठिन नेविगेशन कार्यों में बहुत अच्छा था।
  • गति: समय के मामले में, DriftCl अन्य उन्नत तरीकों की तुलना में निर्णय लेने में लगभग 2x से 4x तेज़ था क्योंकि यह लंबे, पुनरावृत्ति चरणों को छोड़ देता है।
  • सरलता: यह एक एकल नेटवर्क और एक सिंगल फॉरवर्ड पास के साथ यह उच्च प्रदर्शन प्राप्त करता है, जिससे इसे प्रशिक्षित करना और चलाना बहुत सरल हो जाता है।

संक्षेप में, DriftQL पुराने डेटा से रोबोट को सिखाने का एक नया तरीका है जो सरल तरीकों से अधिक स्मार्ट है लेकिन जटिल, बहु-चरणीय तरीकों की तुलना में बहुत तेज़ और सरल है। यह रोबोट को सुरक्षित और कुशल रखने के लिए एक "धक्का और खिंचाव" तंत्र का उपयोग करता है, वह भी एक ही त्वरित नज़र में।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →