← नवीनतम पेपर
🤖 machine learning

Fast and Highly Expressive Policy Learning for Offline Reinforcement Learning via Bootstrapped Flow Q-Learning

यह शोध पत्र बूटस्ट्रैप्ड फ्लो क्यू-लर्निंग (BFQ) प्रस्तुत करता है, जो एक नवीन ऑफलाइन सुदृढीकरण शिक्षण ढांचा है जो एक विभाजित-और-विजयी (divide-and-conquer) रणनीति के माध्यम से अल्प-दूरी के विस्थापन को सीधे शोर-से-क्रिया (noise-to-action) मैपिंग में बूटस्ट्रैप करके, मल्टी-स्टेप डिफ्यूजन के कम्प्यूटेशनल बोझ और भंगुरता को समाप्त करते हुए सटीक, सिंगल-स्टेप एक्शन जनरेशन को सक्षम बनाता है।

मूल लेखक: Thanh Nguyen, Tri Ton, Hongbin Choe, Tung M. Luu, Chang D. Yoo

प्रकाशित 2026-06-10
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Thanh Nguyen, Tri Ton, Hongbin Choe, Tung M. Luu, Chang D. Yoo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य विचार: एक रोबोट को बिना खेलने दिए सिखाना

कल्पना कीजिए कि आप एक रोबोट को चलना सिखाना चाहते हैं, लेकिन आपको रोबोट को वास्तविक दुनिया में चलने की कोशिश करने की अनुमति नहीं है। यदि वह गिर गया, तो वह टूट सकता है। इसके बजाय, आपके पास अन्य रोबोटों के चलने का एक विशाल वीडियो पुस्तकालय है—कुछ ने बिल्कुल सही तरीके से चला, कुछ लड़खड़ाए, और कुछ गिर गए। यह ऑफलाइन रीइन्फोर्समेंट लर्निंग (Offline Reinforcement Learning) है: बिना नए परीक्षण-और-त्रुटि (trial-and-error) के एक निश्चित डेटासेट से सीखना।

लक्ष्य रोबोट को एक "पॉलिसी" (एक मस्तिष्क) सिखाना है जो किसी स्थिति को देख सके और तुरंत अगले कदम के लिए सटीक निर्णय ले सके।

समस्या: धीमी और लड़खड़ाती चाल

हाल ही में, वैज्ञानिकों ने रोबोट को सिखाने के लिए डिफ्यूजन मॉडल्स (Diffusion Models) नामक तकनीक का उपयोग करना शुरू किया है (जिससे समान रूप से एआई चित्र बनाता है जैसे शोर/नॉइज़ को धीरे-धीरे हटाकर)। यह रोबोट को जटिल, कठिन गतिविधियाँ (जैसे एक पैर पर संतुलन बनाना) सीखने में मदद करता है जिन्हें सरल तरीके नहीं संभाल सकते।

हालाँकि, इसमें एक पेंच है।

  • उपमा: कल्पना कीजिए कि रोबंतु बिंदु A से बिंदु B तक जाने की कोशिश कर रहा है। पुराना डिफ्यूजन तरीका रोबोट से यह पूछने जैसा है कि वह वहां पहुँचने के लिए 50 छोटे, लड़खड़ाते कदम क्यों न उठाए।
    • पहले, वह एक कदम उठाता है। फिर सोचने के लिए रुकता है। फिर एक और कदम। फिर एक और ठहराव।
    • इसे सीखने के लिए, रोबोट को हर बार अभ्यास करते समय अपने दिमाग में उन सभी कदमों को "पीछे की ओर" (rewind) और "तेजी से आगे" (fast-forward) करना पड़ता है।
    • परिणाम: यह प्रशिक्षित होने में अविश्वसनीय रूप से धीमा है, और जब आप वास्तव में रोबोट को तैनात करते हैं, तो यह इतना धीमा चलता है कि वास्तविक समय (real-time) में प्रतिक्रिया नहीं दे पाता।

अन्य शोधकर्ताओं ने अतिरिक्त "सहायक" रोबोट जोड़कर या जटिल डिस्टिलेशन (एक छोटे रोबोट को बड़े रोबोट की नकल करना सिखाना) करके इसे ठीक करने की कोशिश की, लेकिन ये समाधान अक्सर अव्यवस्थित, अस्थिर या मूल समस्या जितने ही जटिल थे।

समाधान: BFQ (बूटस्ट्रैप्ड फ्लो क्यू-लर्निंग)

लेखक BFQ पेश करते हैं, जो रोबोट को सिखाने का एक नया तरीका है। वे इसे "बूटस्ट्रैप्ड फ्लो क्यू-लर्निंग" कहते हैं।

यह कैसे काम करता है, इस सरल रूपक (metaphor) का उपयोग करके देखें:

1. "विभाजित करो और जीतो" (Divide and Conquer) की रणनीति

रोबोट को एक बड़ी छलांग में शुरुआत से अंत तक की पूरी यात्रा सीखने के लिए मजबूर करने के (जो कठिन है) या 50 छोटे लड़खड़ाते कदमों के माध्यम से (जो धीमा है) जाने के बजाय, BFQ एक विभाजित करो और जीतो दृष्टिकोण का उपयोग करता है।

  • उपमा: कल्पना कीजिए कि आप एक बिखरे हुए स्केच से एक पूर्ण वृत्त (circle) बनाने के लिए एक सीधी रेखा खींचना चाहते हैं।
    • पुराना तरीका (Diffusion): आप 50 राउंड में पिक्सेल-दर-पिक्सेल धीरे-धीरे स्केच को मिटाते हैं।
    • BFQ तरीका: लेखकों ने महसूस किया कि यदि आप यात्रा के एक बहुत ही सूक्ष्म हिस्से को देखते हैं (एक माइक्रोस्कोपिक कदम), तो आप बहुत आसानी से अनुमान लगा सकते हैं कि आगे कहाँ जाना है। यह ऐसा है जैसे यह जानना कि यदि आप स्थिर खड़े हैं, तो एक छोटा कदम आगे लेना गणना करने में आसान है।
    • "बूटस्ट्रैप" (The Bootstrap): BFQ रोबोट को इन छोटे, आसान कदमों में महारत हासिल करना सिखाता है। फिर, यह उन छोटे कदमों का उपयोग करके बिखरी हुई शुरुआत से एक एक बड़ी, पूर्ण छलांग लगाने की क्षमता को "बूटस्ट्रैप" (बनाने) के लिए करता है।

2. "एक-कदम" का जादू (The "One-Step" Magic)

एक बार जब रोबोट इस "शॉर्टकट" तर्क को सीख लेता है, तो उसे अब 50 कदमों के माध्यम से लड़खड़ाने की आवश्यकता नहीं होती है।

  • परिणाम: जब रोबोट को हिलने की आवश्यकता होती है, तो वह वर्तमान स्थिति को देखता है और कहता है, "मुझे पता है कि मुझे कहाँ जाना है," और वह एक एकल कदम में वहां पहुँच जाता है।
  • गति: यह रोबोट को अविश्वसनीय रूप से तेज़ बनाता है। पेपर दिखाता है कि BFQ प्रति सेकंड 851 बार निर्णय ले सकता है, जबकि पुराने डिफ्यूजन तरीकों में केवल लगभग 238 बार ही संभव था (और वह भी कम स्टेप्स के साथ)।

3. कोई अतिरिक्त सहायक आवश्यक नहीं

पिछले कई प्रयासों को तेज करने के लिए एक "शिक्षक" मॉडल और एक "छात्र" मॉडल बनाने, या जटिल गणितीय गणनाओं (जैकबियन मैट्रिसेस) को चलाने की आवश्यकता थी, जिसने सिस्टम को नाजुक बना दिया।

  • BFQ का लाभ: यह केवल एक एकल मस्तिष्क (न्यूरल नेटवर्क) का उपयोग करता है। यह सीधे डेटा से सीखता है, बिना किसी शिक्षक की नकल करने या जटिल अतिरिक्त गणित की आवश्यकता के। यह सरल, अधिक स्थिर और प्रशिक्षित करने में आसान है।

परिणाम: तेज़, मजबूत और विश्वसनीय

लेखकों ने मानक रोबोट बेंचमार्क (जैसे D4RL सूट, जिसमें चलने, दौड़ने और भूलभुलैया में रास्ता खोजने जैसे कार्य शामिल हैं) पर BFQ का परीक्षण किया।

  • प्रदर्शन: BFQ न केवल तेज़ हुआ; बल्कि यह कार्यों में वास्तव में बेहतर भी हुआ। इसने अधिकांश परिदृश्यों में पिछले अत्याधुनिक डिफ्यूजन तरीकों (जैसे डिफ्यूजन क्यू-लर्निंग) को पछाड़ दिया।
  • दक्षता (Efficiency): इसने 7.8 घंटे में प्रशिक्षण लिया, जबकि समान कार्यों के लिए पुराने तरीकों को 49.5 घंटे तक लग सकते थे।
  • बहुमुखी प्रतिभा: यह सरल चलने वाले कार्यों पर भी बहुत अच्छा काम करता है और बहुत कठिन, भूलभुलैया जैसे नेविगेशन कार्यों पर भी जहाँ पुरस्कार दुर्लभ होते हैं और रास्ता लंबा होता है।

सारांश

सोचिए कि BFQ एक रोबोट को यह दिखाकर सिखा रहा है कि छोटे स्टीयरिंग समायोजन अनुमान लगाना आसान है। एक बार जब रोबोट उन छोटे समायोजनों के भौतिकी (physics) को समझ लेता है, तो वह बिना सेकंड-दर-सेकंड पूरे सफर का अनुकरण किए, एक जटिल मोड़ के लिए एकदम सही टर्न की तुरंत गणना कर सकता है।

पेपर का दावा है कि यह विधि रोबोट को पहले की तुलना में तेज़, सस्ते और अधिक सटीक तरीके से जटिल व्यवहार सीखने की अनुमति देती है, और वह भी बिना किसी अतिरिक्त "सहायक" सिस्टम की आवश्यकता के वास्तविक समय में निर्णय लेती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →