← नवीनतम पेपर
🤖 machine learning

SPAR: Support-Preserving Action Rectification

यह शोध पत्र SPAR प्रस्तुत करता है, जो एक सपोर्ट-प्रिजर्विंग एक्शन रेक्टिफिकेशन फ्रेमवर्क है जो लर्निंग को एक फ्रोजन बिहेवियर क्लोनिंग पॉलिसी के लोकल रेसिडुअल रिफाइनमेंट के रूप में पुनर्गठित करके और वैल्यू मैक्सिमाइजेशन एवं डेटा डिस्ट्रीब्यूशन फिटिंग के बीच अंतर्निहित संघर्ष को हल करने के लिए लेटेंट सेल्फ-इमिटेशन का उपयोग करके स्टेट-ऑफ-द-आर्ट ऑफलाइन पॉलिसी इम्प्रूवमेंट प्राप्त करता है।

मूल लेखक: Jiaxin Zhao, Weihang Pan, Xun Liang, Binbin Lin

प्रकाशित 2026-05-28
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jiaxin Zhao, Weihang Pan, Xun Liang, Binbin Lin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को चलना, दौड़ना या पेन उठाना सिखाने की कोशिश कर रहे हैं। आपके पास इन कार्यों को करने वाले एक इंसान का एक विशाल वीडियो लाइब्रेरी है। लेकिन वह इंसान परफेक्ट नहीं है। कभी-कभी वे लड़खड़ाते हैं, कभी-कभी वे कोई अजीब शॉर्टकट लेते हैं, और कभी-कभी वे उस चाल को बिल्कुल सही तरीके से करते हैं। आपका लक्ष्य रोबोट को इंसान से बेहतर करना है, लेकिन केवल उस वीडियो लाइब्रेरी का उपयोग करके, और यह सुनिश्चित करते हुए कि रोबोट कुछ भी ऐसा नया न आजमाए जिससे वह टूट जाए।

यह ऑफलाइन रिइन्फोर्समेंट लर्निंग (Offline Reinforcement Learning) की समस्या है। प्रदान किया गया पेपर, SPAR, एक बहुत ही चतुर तरीका बताता है जिससे इस क्षेत्र की दो सबसे बड़ी समस्याओं को हल किया जा सकता है।

दो बड़ी समस्याएँ

लेखकों का कहना है कि मौजूदा तरीके आमतौर पर दो तरीकों से विफल होते हैं:

  1. "बहुत सुरक्षित" (Too Safe) वाली समस्या: कुछ तरीके बस इंसान की हुबहू नकल करते हैं। वे बहुत सुरक्षित हैं लेकिन कभी कुछ नया नहीं आज़माते। यदि इंसान ने शायद ही कभी कोई "परफेक्ट" चाल चली हो (हो सकता है कि वह वीडियो लाइब्रेरी में हो लेकिन बहुत दुर्लभ हो), तो रोबोट उसे कभी सीख नहीं पाता क्योंकि वह "सामान्य" रास्ते से बाहर कदम रखने से डरता है।
  2. "बहुत लालची" (Too Greedy) वाली समस्या: अन्य तरीके वीडियो देखकर स्मार्ट बनने की कोशिश करते हैं और अनुमान लगाते हैं, "अगर मैं यह करता, तो मुझे ज़्यादा अंक मिलते!" लेकिन क्योंकि वे वीडियो डेटा से बाहर जाकर अंदाज़ा लगाते हैं, वे अक्सर भ्रम (hallucinate) पैदा करते हैं। वे ऐसी चाल आज़मा सकते हैं जो कागज़ पर तो बहुत अच्छी दिखती है, लेकिन शारीरिक रूप से असंभव या खतरनाक है, जिससे रोबोट टकराकर गिर सकता है।

SPAR का समाधान: "एंकर और टवीक" (Anchor and Tweak) रणनीति

लेखक SPAR (Support-Preserving Action Rectification) का प्रस्ताव देते हैं। इसे एक बहुत ही विशिष्ट रूपक (metaphor) का उपयोग करते हुए तीन-चरणीय प्रक्रिया के रूप में समझें: द एंकर एंड द टवीक (The Anchor and the Tweak)।

चरण 1: द एंकर (The Anchor - जमे हुए इंसान)

सबसे पहले, SPAR वीडियो लाइब्रेरी लेता है और एक "बेस रोबोट" को केवल इंसान की हुबहू नकल करने के लिए प्रशिक्षित करता है। यह अभी सुधार करने की कोशिश नहीं करता; यह बस "सेफ ज़ोन" (सुरक्षित क्षेत्र) को सीखता है।

  • उपमा: कल्पना कीजिए कि एक रस्सी पर चलने वाला (tightrope walker) जिसने ठीक उसी रास्ते में महारत हासिल कर ली है जिस पर इंसान चला था। यह वॉकर अपनी जगह पर "जम" (frozen) गया है। वे सुरक्षित, ज्ञात डेटा का प्रतिनिधित्व करते हैं। वे एंकर हैं।

चरण ता: द टवीक (The Tweak - सूक्ष्म सुधार)

पूरे नए तरीके से चलना सिखाने के बजाय, SPAR केवल यह पूछता है: "इंसान की चाल को बेहतर बनाने के लिए हमें कितना टवीक (ट्वीक/सुधार) करने की आवश्यकता है?"

  • उपमा: कल्पना कीजिए कि बेस रोबोट रस्सी पर चल रहा है। SPAR एक छोटा, अदृश्य सहायक है जो रोबोट के कंधे पर खड़ा है। सहायक केवल छोटे सुधारों के बारे में फुसफुसाता है: "2 डिग्री बाईं ओर झुकें," या "अपना पैर 1 इंच ऊपर उठाएं।"
  • यह क्यों मदद करता है: केवल छोटे बदलावों (residuals) को खोजने के बजाय (न कि पूरी नई चालों के), SPAR यह सुनिश्चित करता है कि रोबोट को पूरी संभावनाओं के ब्रह्मांड में खोज करने की आवश्यकता नहीं है। यह केवल इंसान के रास्ते के आसपास एक बहुत ही छोटे, सुरक्षित दायरे में खोज करता है। इससे "सर्च स्पेस" छोटा हो जाता है और सीखना बहुत तेज़ और सुरक्षित हो जाता है।

चरण 3: "घोस्ट कोच" (The Ghost Coach - अदृश्य प्रशिक्षक)

यह इस पेपर की सबसे रचनात्मक तकनीक है। आमतौर पर, बेहतर होने के लिए, आपको एक कोच की आवश्यकता होती है जो कहता है, "यह करो!" लेकिन ऑफलाइन लर्निंग में, कोच (वैल्यू फंक्शन) अक्सर झूठ बोलता है या उन चालों को देखकर भ्रमित हो जाता है जो इंसान ने कभी नहीं कीं।

SPAR एक डेरिवेटिव-फ्री (derivative-free) विधि का उपयोग करता है जिसे लेटेंट सेल्फ-इमिटेशन (Latent Self-Imitation) कहा जाता है।

  • रूपक: कोच के निर्देश देने के बजाय (जो गलत हो सकते हैं), रोबोट अपने दिमाग में कई "क्या होगा अगर" (what-if) परिदृश्य बनाता है (एक "लेटेंट" या छिपे हुए स्थान में)। वह कल्पना करता है: "क्या होगा अगर मैं बाईं ओर झुका? क्या होगा अगर मैं दाईं ओर झुका?"
  • फिर, वह इन काल्पनिक चालों की वीडियो डेटा के साथ जाँच करता है। यदि कोई काल्पनिक चाल ऐसी दिखती है जो उच्च स्कोर करती और अभी भी इंसान के रास्ते के करीब है, तो वह उस विचार को रखता है। यदि वह खतरनाक या बहुत दूर लगती है, तो वह उसे फेंक देता है।
  • परिणाम: रोबोट अपने विचारों को सैंपल और फ़िल्टर करके सुधार करना सीखता है, न कि अंधे होकर किसी ग्रेडिएंट (गणितीय ढलान) का पालन करके जो उसे खाई में गिरा सकता है। यह एक शेफ की तरह है जो रेसिपी बुक में टाइपो (गलतियों) का पालन करने के बजाय खुद अपने सूप को चखकर नमक को एडजस्ट करता है।

तीन चरणों की क्रिया में (In Action)

  1. एंकर को फ्रीज़ करें: डेटा की हुबहू नकल करने के लिए एक रोबोट को प्रशिक्षित करें।
  2. टवीक को सीखें: एक दूसरा, छोटा मस्तिष्क प्रशिक्षित करें जो स्कोर सुधारने के लिए आवश्यक सूक्ष्म अंतरों को सीख सके, और सुरक्षित रहने के लिए "घोस्ट कोच" विधि का उपयोग करे।
  3. सेफ्टी गेट: जब रोबोट वास्तव में चलता है, तो वह "टवीक" को तभी लागू करता है जब "घोस्ट कोच" 100% आश्वस्त हो कि यह सुरक्षित है। यदि टवीक जोखिम भरा दिखता है, तो रोबोट बस मूल मानव चाल पर ही टिका रहता है।

यह क्यों काम करता है (परिणाम)

लेखकों ने D4RL बेंचमार्क पर इसका परीक्षण किया, जिसमें शामिल हैं:

  • चलना/दौड़ना: (HalfCheetah, Hopper, Walker2d)
  • भूलभुलैया नेविगेशन: (AntMaze)
  • सूक्ष्म मोटर कौशल: (Pen manipulation)

उन्होंने पाया कि SPAR लगातार अन्य शीर्ष तरीकों को पछाड़ देता है।

  • सरल कार्यों में, एक साधारण "टवीक" (SPAR-MLP) सबसे अच्छा काम करता है।
  • जटिल कार्यों में, जहाँ सफलता के कई तरीके होते हैं (जैसे कई रास्तों वाली भूलभुलैया), एक अधिक लचीला "टवीक" जो कई संभावनाओं की कल्पना कर सकता है (SPAR-PROJ), सबसे अच्छा काम करता है।

मुख्य निष्कर्ष (The Bottom Line)

SPAR "सुरक्षित होने" और "बेहतर होने" के बीच के संघर्ष को डिकपलिंग (अलग करने) द्वारा हल करता है।

  • यह सुरक्षा को वास्तविक मानव डेटा से बांधे रखता है।
  • यह सुधार को "छोटे ट्वीक्स" के एक छोटे, नियंत्रित स्थान में करता है।
  • यह सबसे अच्छे ट्वीक्स को खोजने के लिए कल्पना और फ़िल्टरिंग का उपयोग करता है, बिना कभी सुरक्षित रास्ते से बाहर निकले।

संक्षेप में, SPAR पहिए का पुनरुद्धार करने की कोशिश नहीं करता; यह बस मौजूदा पहिए को तब तक पॉलिश करता है जब तक कि वह पूरी तरह से न घूम जाए, यह सुनिश्चित करते हुए कि वह कभी सड़क से बाहर न जाए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →