← नवीनतम पेपर
🤖 machine learning

ISEP: Implicit Support Expansion for Offline Reinforcement Learning via Stochastic Policy Optimization

यह शोध पत्र ISEP का प्रस्ताव करता है, जो ऑफलाइन सुदृढीकरण शिक्षण (reinforcement learning) के लिए एक स्टोकेस्टिक पॉलिसी ऑप्टिमाइज़ेशन फ्रेमवर्क है, जो वैल्यू फंक्शन इंटरपोलेशन के माध्यम से व्यवहार्य एक्शन सपोर्ट का निहित रूप से विस्तार करता है और परिणामी मल्टीमॉडल परिदृश्य (multimodal landscape) में नेविगेट करने के लिए कंडीशनल फ्लो मैचिंग का उपयोग करता है, जिससे सख्त बाधाओं की कठोरता को दूर करते हुए मोड कोलैप्स से बचा जा सके।

मूल लेखक: Yifei Chen, Shaoqin Zhu, Xiaoqiang Ji

प्रकाशित 2026-05-19
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yifei Chen, Shaoqin Zhu, Xiaoqiang Ji

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ शोध पत्र ISEP: Implicit Support Expansion for Offline Reinforcement Learning का सरल अवधारणाओं, उपमाओं और रूपकों के माध्यम से विवरण दिया गया है।

बड़ी समस्या: "सुरक्षित लेकिन फंसा हुआ" रोबोट

कल्पना कीजिए कि आप एक इंसान के चलने के वीडियो रिकॉर्डिंग का उपयोग करके एक रोबोट को चलना सिखाने की कोशिश कर रहे हैं। आप रोबोट को वास्तविक दुनिया में अभ्यास करने की अनुमति नहीं दे सकते क्योंकि वह गिर सकता है और कुछ तोड़ सकता है (यह Offline Reinforcement Learning है)।

समस्या यह है कि वीडियो रिकॉर्डिंग (डेटासेट) केवल यह दिखा सकती है कि इंसान धीरे चल रहा है या एक विशिष्ट, सुरक्षित पथ पर चल रहा है। यह शायद यह नहीं दिखा सकता कि इंसान दौड़ रहा है या कोई छोटा रास्ता ले रहा है जो वास्तव में तेज़ और सुरक्षित है, लेकिन वीडियो में मौजूद नहीं था।

  • रूढ़िवादी दृष्टिकोण (The Conservative Approach): अधिकांश वर्तमान तरीके कहते हैं, "रोबोट केवल वही कर सकता है जो उसने वीडियो में देखा है।" यह सुरक्षित है, लेकिन रोबोट कभी दौड़ना या शॉर्टकट लेना नहीं सीख पाता। वह "सुरक्षित क्षेत्र" में ही फंसा रह जाता है।
  • जोखिम भरा दृष्टिकोण (The Risky Approach): यदि आप रोबोट को बिना किसी सीमा के कहते हैं, "सबसे अच्छा रास्ता खोजो!", तो वह बेतरतीब ढंग से अनुमान लगाने लगेगा, छत पर चलने की कोशिश करेगा और दीवार से टकरा जाएगा (इसे extrapolation error कहा जाता है)।

समाधान: ISEP (एक "सुरक्षित पुल" बनाने वाला)

लेखक ISEP (Implicit Support Expansion via stochastic Policy optimization) का प्रस्ताव करते हैं। ISEP को एक स्मार्ट शिक्षक के रूप में सोचें जो ज्ञात वीडियो डेटा से अज्ञात, बेहतर पथों तक एक सुरक्षित पुल बनाता है।

यह यहाँ कैसे काम करता है, चरण-दर-चरण देखें:

1. "हाइब्रिड मैप" (Implicit Support Expansion)

आमतौर पर, एक रोबोट का दुनिया का "मैप" (नक्शा) सख्ती से उन्हीं स्थानों तक सीमित होता है जहाँ वीडियो डेटा मौजूद है।

  • ISEP क्या करता है: यह एक "हाइब्रिड मैप" बनाता है। यह वास्तविक वीडियो डेटा (सुरक्षित स्थानों) को देखता है लेकिन साथ ही रोबोट से पूछता है, "क्या होगा अगर तुम यह नया मूव आज़माओ?"
  • उपमा: कल्पना करें कि आप एक जंगल में हाइकिंग कर रहे हैं और आपके पास एक नक्शा है जो केवल मुख्य रास्तों को दिखाता है। ISEP एक गाइड की तरह है जो कहता है, "नक्शा मुख्य रास्ते को दिखाता है, लेकिन मैंने कुछ साइड पाथ भी चेक किए हैं जो आशाजनक लग रहे हैं। आइए मुख्य नक्शे को उन साइड पाथ के साथ मिलाकर एक नया, थोड़ा बड़ा नक्शा बनाएं।"
  • सुरक्षा जांच: गाइड आपको खतरनाक दलदल में भटकने नहीं देता। वे केवल मैप को उन क्षेत्रों में विस्तारित करते हैं जो सुरक्षित और उच्च-पुरस्कार (high-reward) वाले दिखते हैं, यह सुनिश्चित करते हुए कि रोबोट गलती से खाई में न गिर जाए।

2. "दो-मोड" की समस्या (क्यों औसत निकालना विफल रहता है)

यह इस पेपर का सबसे महत्वपूर्ण हिस्सा है।

  • परिदृश्य: कल्पना करें कि रोबोट के पास दो अच्छे विकल्प हैं:
    1. विकल्प A: धीरे चलना (वीडियो से)।
    2. विकल्प B: तेज़ दौड़ना (रोबोट द्वारा खोजा गया एक नया, बेहतर विचार)।
  • गलती (Deterministic Averaging): यदि आप रोबोट को इन दोनों का "औसत" (average) निकालने के लिए कहते हैं, तो वह इनके बीच का कुछ करने की कोशिश कर सकता है, जैसे कि "अजीब तरीके से जॉगिंग करना।" वास्तविक दुनिया में, यह "बीच का" एक्शन एक आपदा हो सकता है (जैसे अपने ही पैरों में उलझकर गिर जाना)। इसे Mode Collapse कहा जाता है।
  • ISEP का समाधान (Stochastic Selection): रोबोट को एक "बीच का" एक्शन चुनने के लिए मजबूर करने के बजाय, ISEP हर स्टेप पर एक सिक्का उछालता है।
    • हेड्स (Heads): "ठीक वही करो जो वीडियो ने दिखाया था (विकल्प A)।"
    • टेल्स (Tails): "उस नए, तेज़ विचार को आज़माओ (विकल्प B)।"
  • परिणाम: रोबोट धीरे चलने और तेज़ दौड़ने दोनों में माहिर होने के लिए सीखता है, न कि एक "अजीब जॉगर" बनने के लिए जो दोनों में से कुछ भी ठीक से नहीं कर पाता। यह व्यवहार के अलग-अलग "मोड्स" को अलग और सुरक्षित रखता है।

3. "आकार बदलने वाला" (Flow Matching)

इस कॉइन-फ्लिप रणनीति को सफल बनाने के लिए, रोबोट को एक ऐसे दिमाग की आवश्यकता है जो जटिल आकारों को संभाल सके।

  • पुराना तरीका: अधिकांश रोबोट एक "Gaussian" दिमाग का उपयोग करते हैं, जो एक सिंगल बेल कर्व (bell curve) की तरह है। यह केवल एक "केंद्र" वाले व्यवहार को दर्शा सकता है। यदि आपके पास दो अच्छे रास्ते हैं (धीमी चाल और तेज़ दौड़), तो बेल कर्व उन्हें बीच में एक गंदे ढेर में मिलाने की कोशिश करता है।
  • ISEP का तरीका: वे Flow Matching (विशेष रूप से Conditional Flow Matching) का उपयोग करते हैं।
  • उपमा: एक Gaussian पॉलिसी को स्याही की एक बूंद की तरह समझें जो फैल जाती है। ISEP का Flow Matching आकार बदलने वाली मिट्टी (shape-shifting clay) की तरह है। यह दो अलग-अलग द्वीपों (एक धीमी चाल के लिए और एक दौड़ने के लिए) में खुद को ढाल सकता है बिना बीच में दलदल बनाए। यह रोबोट को दोनों रणनीतियों को एक साथ अलग-अलग बनाए रखने की अनुमति देता है।

"डायल" (पैरामीटर p)

पेपर एक कंट्रोल नॉब पेश करता है जिसे pp कहा जाता है।

  • p=0p = 0: रोबोट डरपोक है। यह केवल वही करता है जो उसने वीडियो में देखा है। यह सुरक्षित है लेकिन सब-ऑप्टिमल (कम कुशल) है।
  • p=1p = 1: रोबोट लापरवाह है। यह वीडियो को अनदेखा करता है और बेतहाशा अनुमान लगाता है। यह सबसे अच्छा रास्ता ढूंढ सकता है, लेकिन यह टकरा भी सकता है।
  • p=0.3p = 0.3 या $0.5$: यह "गोल्डिलॉक्स" ज़ोन (Goldilocks zone) है। रोबोट ज्यादातर वीडियो पर टिका रहता है लेकिन कभी-कभी नए, बेहतर मूव्स आज़माता है। पेपर गणितीय रूप से सिद्ध करता है कि यदि आप इस डायल को सही ढंग से सेट करते हैं, तो रोबोट एक्सप्लोर करते समय भी गारंटीड रूप से नहीं टकराएगा।

परिणामों का सारांश

लेखकों ने मानक रोबोट कार्यों (जैसे चलना, कूदना और वस्तुओं को नियंत्रित करना) पर इसका परीक्षण किया।

  • परिणाम: ISEP (और इसका उन्नत संस्करण, ISEP-FM) लगातार अन्य तरीकों से बेहतर प्रदर्शन करता है।
  • क्यों? इसने सब-ऑप्टिमल डेटा (धीमी चाल) के "जाल" से निकलने और बेहतर प्रदर्शन के "द्वीप" (तेज़ दौड़ना) को खोजने में महारत हासिल की, वह भी खराब अनुमानों के "खतरे वाले क्षेत्र" में गिरे बिना।

मुख्य निष्कर्ष (Takeaway)

ISEP एक ऐसा तरीका है जो AI को एक स्थिर डेटासेट से सीखने में मदद करता है बिना उसमें फंसे। यह इसे निम्न प्रकार से करता है:

  1. आशाजनक नए विचारों को शामिल करने के लिए "सुरक्षित क्षेत्र" को धीरे से विस्तारित करता है।
  2. अच्छे विचारों को आपस में मिलने से रोकने के लिए "सिक्का उछालने" (coin flip) की रणनीति का उपयोग करता है।
  3. उन अच्छे विचारों को अलग रखने के लिए एक लचीले "आकार बदलने वाले" दिमाग का उपयोग करता है।

यह एक छात्र को केवल पाठ्यपुस्तक रटने के बजाय, इमारत से बाहर कदम रखे बिना, सबसे अच्छे उत्तर खोजने के लिए सुरक्षित रूप से लाइब्रेरी तलाशने के लिए सिखाने जैसा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →