← नवीनतम पेपर
🤖 AI

EXPO: Stable Reinforcement Learning with Expressive Policies

यह शोध पत्र एक्सप्रेसिव पॉलिसी ऑप्टिमाइज़ेशन (EXPO) का प्रस्ताव करता है, जो एक सैंपल-कुशल ऑनलाइन सुदृढीकरण शिक्षण (reinforcement learning) एल्गोरिदम है, जो वैल्यू मैक्सिमाइजेशन को जटिल बेस पॉलिसी से अलग करके और इसके बजाय ऑन-द-फ्लाई (on-the-fly) क्रियाओं को अनुकूलित करने के लिए एक लाइटवेट गॉसियन एडिट पॉलिसी का उपयोग करके एक्सप्रेसिव पॉलिसियों के प्रशिक्षण को स्थिर करता है, जिससे ऑफलाइन डेटा के साथ फाइन-ट्यूनिंग और ऑनलाइन प्रशिक्षण दोनों के लिए सैंपल दक्षता में महत्वपूर्ण सुधार प्राप्त होता है।

मूल लेखक: Perry Dong, Qiyang Li, Dorsa Sadigh, Chelsea Finn

प्रकाशित 2026-05-01
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Perry Dong, Qiyang Li, Dorsa Sadigh, Chelsea Finn

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक जटिल कार्य करना सिखाने की कोशिश कर रहे हैं, जैसे कि सुई में धागा पिरोना या भूलभुलैया (maze) से बाहर निकलना। आपके पास दो मुख्य उपकरण हैं: वीडियो का एक विशाल पुस्तकालय जो मनुष्यों को वह कार्य करते हुए दिखाता है (ऑफलाइन डेटासेट) और एक तरीका जिससे रोबोट वास्तविक समय में अपनी गलतियों से सीख सके और चीजें आजमा सके (ऑनलाइन रीइन्फोर्समेंट लर्निंग)।

यह शोध पत्र एक नई विधि पेश करता है जिसे EXPO (एक्सप्रेसिव पॉलिसी ऑप्टिमाइज़ेशन) कहा जाता है, जो एक विशिष्ट समस्या को हल करती है: आप एक ऐसे रोबोट को कैसे सिखा सकते हैं जो पहले से ही मानवीय गतिविधियों की नकल करने में बहुत कुशल है (वीडियो लाइब्रेरी के माध्यम से), और उसे बिना खराब किए और भी बेहतर और विश्वसनीय कैसे बनाया जाए?

यहाँ समस्या और समाधान का सरल विवरण दिया गया है, जिसमें रोजमर्रा के उदाहरणों का उपयोग किया गया है।

समस्या: "अति-जटिल" कलाकार

अधिकांश मानक रोबोट प्रशिक्षण विधियाँ सरल, "गौसियन" (Gaussian) पॉलिसियों का उपयोग करती हैं। इन्हें पेंट-बाय-नंबर्स किट की तरह समझें। वे स्थिर हैं, समझने में आसान हैं, और रोबند को पता होता है कि बेहतर स्कोर प्राप्त करने के लिए अपने ब्रश के स्ट्रोक को कैसे समायोजित करना है।

हालाँकि, आधुनिक रोबोट अक्सर "एक्सप्रेसिव" पॉलिसियों (जैसे डिफ्यूजन मॉडल) का उपयोग करते हैं। ये महारत हासिल कलाकारों की तरह हैं जो अविश्वसनीय रूप से जटिल और यथार्थवादी दृश्य चित्रित कर सकते हैं। उन्हें विशाल डेटासेट पर प्रशिक्षित किया जाता है ताकि वे मनुष्यों की सटीक नकल कर सकें। लेकिन यहाँ एक पेंच है:

  • समस्या: यदि आप एक मास्टर आर्टिस्ट को यह बताने की कोशिश करते हैं कि, "अपनी पेंटिंग की कीमत बढ़ाओ," और उन्हें अपनी पूरी 100-चरणीय रचनात्मक प्रक्रिया को बदलना पड़ता है, तो निर्देश शोर (noise) में खो जाते हैं। "ग्रेडिएंट" (निर्देश संकेत) अस्थिर हो जाता है। यह एक विशाल क्रूज शिप को एक छोटे से रडर (पतवार) से मोड़ने की कोशिश करने जैसा है; जहाज मुड़ता नहीं है, या वह अचानक मुड़कर दुर्घटनाग्रस्त हो जाता है।
  • परिणाम: इन जटिल रोबोटों को बेहतर प्रदर्शन के लिए सीधे अनुकूलित (optimize) करने की कोशिश करने से वे अस्थिर हो जाते हैं या वे जो सीखा है उसे भूल जाते हैं।

समाधान: "संपादक" और "चयनकर्ता"

EXPO इसे मास्टर आर्टिस्ट के जटिल मस्तिष्क को सीधे बदलने की कोशिश को रोककर हल करता है। इसके बजाय, यह एक दो-चरणीय टीम दृष्टिकोण का उपयोग करता है:

1. बेस आर्टिस्ट (स्थिर नकल करने वाला)

  • यह क्या है: यह मूल, जटिल रोबोट पॉलिसी है जिसे ऑफलाइन वीडियो डेटा पर प्रशिक्षित किया गया है।
  • भूमिका: यह एक विश्वसनीय आधार के रूप में कार्य करता है। इसे "इमिटेशन लर्निंग" का उपयोग करके प्रशिक्षित किया जाता है, जिसका अर्थ है "मनुष्यों की नकल करना।" इसे पुरस्कार (reward) को अधिकतम करने या अपने जटिल आंतरिक तर्क को बदलने के लिए नहीं कहा जाता है। यह बस वही करता रहता है जिसमें यह अच्छा है।
  • उपमा: इसे एक पेशेवर शेफ के रूप में सोचें जो रेसिपी के आधार पर एक परफेक्ट स्टेक बनाना जानता है। हम शेफ को खाना बनाने के तरीके को फिर से आविष्कार करने के लिए नहीं कहते; हम बस उन्हें खाना बनाने देते हैं।

2. एडिटर (हल्का-फुल्का सुधार करने वाला)

  • यह क्या है: एक छोटा, सरल और तेज़ पॉलिसी (एक गौसियन वितरण)।
  • भूमिका: यह एक सहायक शेफ (sous-chef) या स्वाद चखने वाला है। यह शेफ द्वारा पकाए गए स्टेक को देखता है और छोटे, स्थानीय समायोजन करता है। "शायद थोड़ा और नमक डालें," या "आंच थोड़ी कम करें।"
  • यह क्यों काम करता है: क्योंकि एडिटर सरल है और केवल छोटे बदलाव करता है (इसमें एक "दूरी प्रतिबंध" है ताकि यह व्यंजन को खराब न करे), यह बहुत स्थिर है। यह शेफ के कार्यों को उच्च पुरस्कारों की ओर धकेलना सीख जाता है, बिना उस जटिल 100-चरणीय कुकिंग प्रक्रिया को समझे।
  • उपमा: एडिटर एक जीपीएस (GPS) की तरह है जो पहले से गाड़ी चलाना जानने वाले ड्राइवर को छोटे मोड़-दर-मोड़ निर्देश देता है। जीपीएस कार नहीं चलाता; यह केवल छोटे कोर्स सुधार सुझाता है।

3. "ऑन-द-फ्लाई" सेलेक्टर (मैनेजर)

  • यह क्या है: एक निर्णय लेने वाला चरण जो हर बार जब रोबोट को कार्य करने की आवश्यकता होती है, तब तुरंत होता है।
  • भूमिका: सिस्टम बेस आर्टिस्ट से कुछ विचार (क्रियाएं) मांगता है और एडिटर से उन विचारों को सुधारने के लिए कहता है। फिर, यह सभी विकल्पों (मूल और संशोधित) को देखता है और उस विकल्प को चुनता है जिसे "वैल्यू फंक्शन" (स्कोरकीपर) सबसे अच्छा बताता है।
  • उपमा: एक टैलेंट शो जज की कल्पना करें। जज गाना दोबारा नहीं लिखता। इसके बजाय, गायक (बेस आर्टिस्ट) प्रदर्शन करता है, एक साउंड इंजीनियर (एडिटर) वॉल्यूम में मामूली बदलाव करता है, और जज उस संस्करण को चुनता है जो सुनने में सबसे अच्छा लगता है। जज फिर अगली बार सीखने के लिए उसी "सर्वश्रेष्ठ संस्करण" का उपयोग करता है।

यह एक बड़ी बात क्यों है?

शोध पत्र का दावा है कि "जटिल मस्तिष्क" (बेस) को "अनुकूलन" (एडिटर) से अलग करके, EXPO दो प्रमुख जीत हासिल करता है:

  1. स्थिरता (Stability): आपको डिफ्यूजन मॉडल के जटिल गणित से लड़ने की आवश्यकता नहीं है। आप बस आउटपुट को थोड़ा सा बदलते हैं, जो बहुत सुरक्षित है।
  2. दक्षता (Efficiency): रोबोट पिछले तरीकों की तुलना में 2 से 3 गुना तेज़ी से सीखता है। यह एक अच्छी शुरुआत पाने के लिए ऑफलाइन डेटा का उपयोग करता है, और उन कौशलों को तेजी से परिष्कृत करने के लिए ऑनलाइन "एडिटर" का उपयोग करता है ताकि कोई दुर्घटना न हो।

"एंट्रॉपी" बोनस (जब डेटा कम हो)

शोध पत्र एक विशेष मोड का भी उल्लेख करता है जो तब काम आता है जब ऑफलाइन वीडियो लाइब्रेरी बहुत छोटी या उबाऊ होती है। इस स्थिति में, सिस्टम एडिटर में थोड़ी सी "रैंडमनेस" (एंट्रॉपी) जोड़ देता है।

  • उपमा: यदि शेफ केवल स्टेक बनाना जानता है, तो एडिटर को कहा जाता है कि "बस यह देखने के लिए कि क्या होता है, एक अजीब मसाला डालकर देखें।" यह रोबोट को उन नई चीजों को खोजने के लिए प्रोत्साहित करता है जो उसने वीडियो में नहीं देखी हैं, जिससे वह एक ही ढर्रे में फंसने से बच जाता है।

सारांश

EXPO एक ऐसी विधि है जो आपको एक अत्यधिक जटिल, पूर्व-प्रशिक्षित रोबोट ( "मास्टर आर्टिस्ट") को लेने और उसे बिना खराब किए वास्तविक दुनिया के प्रदर्शन के लिए फाइन-ट्यून करने की अनुमति देती है। यह इसे जटिल रोबोट को स्थिर रखकर और छोटे, स्मार्ट समायोजन करने के लिए एक छोटे, सरल "एडिटर" का उपयोग करके करता है। सिस्टम फिर इन समायोजनों से प्राप्त सर्वोत्तम परिणाम को चुनने के लिए उपयोग करता है।

परिणामस्वरूप, रोबोट तेजी से, अधिक स्थिरता के साथ सीखता है, और उन जटिल कार्यों को संभाल सकता है जिन्हें सुधारने में पिछले तरीके संघर्ष करते थे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →