← नवीनतम पेपर
🤖 machine learning

OGPO: Sample Efficient Full-Finetuning of Generative Control Policies

यह शोध पत्र OGPO को प्रस्तुत करता है, जो एक सैंपल-एफिशिएंट ऑफ-पॉलिसी एल्गोरिदम है जो विविध रोबोटिक कार्यों में अत्याधुनिक प्रदर्शन प्राप्त करने के लिए जनरेटिव कंट्रोल पॉलिसियों की फुल-फाइनट्यूनिंग को सक्षम बनाता है, जिसमें विशेषज्ञ डेटा के बिना खराब-इनिशियलाइज्ड पॉलिसियों को फाइन-ट्यून करना भी शामिल है, जो क्रिटिक ओवर-एक्सप्लॉइटेशन को कम करने के लिए संशोधित PPO ऑब्जेक्टिव्स और व्यावहारिक स्टेबलाइजर्स का लाभ उठाता है।

मूल लेखक: Sarvesh Patil, Mitsuhiko Nakamoto, Manan Agarwal, Shashwat Saxena, Jesse Zhang, Giri Anantharaman, Cleah Winston, Chaoyi Pan, Douglas Chen, Nai-Chieh Huang, Zeynep Temel, Oliver Kroemer, Sergey Levine
प्रकाशित 2026-05-06
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sarvesh Patil, Mitsuhiko Nakamoto, Manan Agarwal, Shashwat Saxena, Jesse Zhang, Giri Anantharaman, Cleah Winston, Chaoyi Pan, Douglas Chen, Nai-Chieh Huang, Zeynep Temel, Oliver Kroemer, Sergey Levine, Abhishek Gupta, Hongkai Da, Paarth Shah, Max Simchowitz

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक रोबोट है जिसने इंसानों को काम करते देख उसे सीखा है, ठीक वैसे ही जैसे एक छात्र ने किसी पाठ्यपुस्तक को रट लिया हो। यह रोबोट एक "जेनरेटिव कंट्रोल पॉलिसी" (GCP) का उपयोग करता है। इस GCP को केवल निर्देशों के एक साधारण सेट के रूप में नहीं, बल्कि एक रचनात्मक कलाकार के रूप में सोचें जो एक धुंधले स्केच से शुरू करके, उसे तब तक स्पष्ट करने के लिए परिष्कृत करता है जब तक कि वह साफ न हो जाए, जैसे कि वह कदम-दर-कदम एक चित्र बना रहा हो।

समस्या यह है कि यह "कलाकार" बहुत कठोर है। यदि वास्तविक दुनिया थोड़ी भी बदल जाती है (जैसे कि एक कप दो इंच बाईं ओर खिसक जाता है), तो रोबोट विफल हो सकता है क्योंकि वह ठीक उसी चीज़ पर अड़ा रहता है जो उसने पाठ्यपुस्तक में देखी थी। इसे ठीक करने के लिए, हमें रोबोट को प्रयास और त्रुटि (Reinforcement Learning) के माध्यम से सिखाने की आवश्यकता है। लेकिन ऐसा करना आमतौर पर बहुत महंगा होता है: आपको रोबोट को हजारों बार शारीरिक रूप से प्रयास करने, विफल होने और टकराने (crash) के लिए छोड़ना पड़ता है ताकि वह सीख सके।

पेश है OGPO (ऑफ-पॉलिसी जेनरेटिव पॉलिसी ऑप्टिमिज़ेशन)।

यह शोध पत्र OGPO को इस रोबोट को सिखाने के एक अत्यंत कुशल तरीके के रूप में प्रस्तुत करता है, जिससे हजारों शारीरिक क्रैश की आवश्यकता नहीं पड़ती। यह कैसे काम करता है, इसके लिए सरल उपमाओं का उपयोग किया गया है:

1. दो-चरणीय प्रक्रिया: "सपना" बनाम "वास्तविकता"

लेखकों ने महसूस किया कि रोबोट का "कलाकार" दो परतों में काम करता है:

  • वास्तविकता की परत (पर्यावरण): रोबोट का वास्तविक दुनिया में अपने हाथ को हिलाना। यह धीमा, महंगा और जोखिम भरा है (यह चीजों को तोड़ सकता है)।
  • सपनों की परत (डिनोइजिंग): रोबोट की आंतरिक मानसिक प्रक्रिया जहाँ वह शोर (noise) से एक स्पष्ट योजना में सुधार करते हुए क्रिया की कल्पना करता है। यह पूरी तरह से गणनात्मक है—यह कंप्यूटर के मस्तिष्क के भीतर होता है और यह मुफ्त और त्वरित है।

पिछले अधिकांश तरीकों ने सीधे "वास्तविकता" की परत से सीखने की कोशिश की, जो धीमी है। OGPO चतुर है क्योंकि यह दोनों के बीच के संबंध को काट देता है। यह रोबोट को सस्ते "सपनों" की परत से सीखने देता है, लेकिन एक "जज" (निर्णायक) का उपयोग करता है जो उसे बताता है कि सपना अच्छा था या नहीं।

2. "जज" (द क्रिटिक)

OGPO एक अलग "जज" (एक न्यूरल नेटवर्क जिसे क्रिटिक कहा जाता है) रखता है जिसने वास्तविक दुनिया में रोबोट को विफल होते और सफल होते देखा है।

  • जब रोबोट "सपनों" की परत में होता है, तो वह कई अलग-अलग संभावित क्रियाएं उत्पन्न करता है (जैसे कि एक कलाकार एक पेंटिंग के 32 अलग-अलग संस्करणों का स्केच बनाता है)।
  • जज इन स्केचों को देखता है और कहता है, "यह वाला काम करेगा," या "यह वाला टकरा जाएगा।"
  • रोबोट फिर जज के फीडबैक के आधार पर अपनी "कलाकार" शैली को अपडेट करता है, बिना वास्तव में अपने हाथ को दोबारा हिलाए उन विशिष्ट प्रयासों के लिए।

यह शतरंज के खिलाड़ी के अभ्यास करने जैसा है जो एक ग्रैंडमास्टर कोच के खिलाफ अभ्यास कर रहा है। खिलाड़ी अपने दिमाग में 100 अलग-अलग चालों की कल्पना कर सकता है, और कोच कहता है, "चाल A खराब है, चाल B बेहतरीन है।" खिलाड़ी बिना 100 वास्तविक खेल खेले तुरंत सीख जाता है।

3. "फुल-फाइनट्यूनिंग" का जादू

कुछ पुराने तरीकों ने रोबोट को ठीक करने के लिए केवल "सपनों" के बहुत पहले चरण को ट्यून करने की कोशिश की (जैसे कि प्रारंभिक स्केच को बदलना) या ऊपर एक छोटा "सुधार" स्तर जोड़ने की कोशिश की।

  • OGPO अलग है। यह पूरी कलात्मक प्रक्रिया को अपडेट करता है। यह रोबोट को बताता है, "न केवल आपका अंतिम पेंटिंग गलत था, बल्कि आपका पहला स्केच, आपका दूसरा शेडिंग, और आपकी तीसरी रेखा भी थोड़ी गलत थी।"
  • यह PPO (AI को सिखाने का एक मानक तरीका) का उपयोग करके ऐसा करता है, लेकिन इसे इस तरह अनुकूलित किया गया है कि यह "सपनों" के पूरे क्रम को एक साथ देख सके।

4. यह एक बड़ी बात क्यों है (परिणाम)

शोध पत्र का दावा है कि OGPO तीन कारणों से एक गेम-चेंजर है:

  • यह अविश्वसनीय रूप से सैंपल-एफिशिएंट है: यह अन्य तरीकों की तुलना में बहुत तेजी से सीखता है क्योंकि यह पुराने डेटा का पुन: उपयोग करता है और अधिकांश सीख "सपनों" (गणना) में करता है न कि "वास्तविकता" (शारीरिक गति) में।
  • यह खराब शुरुआती स्थितियों के साथ भी काम करता है: भले ही रोबोट एक ऐसी पॉलिसी के साथ शुरू करे जो केवल 50% समय सफल होती है (या सिर्फ "ठीक-ठाक" होती है), OGPO इसे बिना किसी नए विशेषज्ञ मानव प्रदर्शन के लगभग 100% सफलता तक पहुँचा सकता है। यह पूरी तरह से अपनी गलतियों और सफलताओं से सीखता है।
  • यह जटिल कार्यों को संभालता है: शोध पत्र ने कठिन कार्यों पर इसका परीक्षण किया जैसे कि:
    • एक छेद में पेग डालना (उच्च सटीकता की आवश्यकता होती है)।
    • एक रैक पर उपकरण लटकाना (लंबे, बहु-चरणीय नियोजन की आवश्यकता होती है)।
    • दो हाथों से वस्तुओं को हिलाना (तालमेल की आवश्यकता होती है)।
    • कुशल हस्त हेरफेर (Dexterous hand manipulation) (जैसे कि एक इंसान द्वारा पेन चलाना)।

5. "OGPO+" अपग्रेड

लेखकों ने यह भी पाया कि बुनियादी OGPO कभी-कभी "अति-आत्मविश्वासी" हो जाता है या एक खराब जज से भ्रमित हो जाता है। इसलिए, उन्होंने OGPO+ बनाया, जो कुछ सुरक्षा जाल जोड़ता है:

  • सफलता बफर (Success Buffer): यह केवल उन समयों की एक विशेष नोटबुक रखता है जब रोबोट सफल हुआ था और रोबोट को उन अच्छे क्षणों को याद रखने के लिए मजबूर करता है, जिससे यह सुनिश्चित होता है कि वह तेज होने की कोशिश में सफल होने के तरीके को न भूल जाए।
  • रूढ़िवादी निर्णय (Conservative Judging): यह जज को शुरू में थोड़ा निराशावादी बनाता है, ताकि रोबोट किसी ऐसी "जीत" के बारे में उत्साहित न हो जो वास्तव में केवल एक भाग्यशाली संयोग थी।

सारांश

संक्षेप में, OGPO रोबोट नियंत्रकों के लिए एक नया प्रशिक्षण तरीका है जो रोबोट की आंतरिक "सोचने की प्रक्रिया" को एक सस्ते, तेज़ खेल के मैदान के रूप में मानता है। यह वास्तविक दुनिया के डेटा पर प्रशिक्षित एक "जज" का उपयोग करता है जो रोबोट के काल्पनिक प्रयासों की आलोचना करता है, जिससे रोबोट बहुत कम शारीरिक प्रयासों के साथ जटिल, उच्च-सटीक कौशल सीख सकता है। यह एक पियानो वादक को एक संगीत कार्यक्रम बजाना सिखाने जैसा है, जिसमें उन्हें एक कंडक्टर द्वारा उनके मानसिक चित्र को सही करने के दौरान अपने दिमाग में अभ्यास करने के लिए कहा जाता है, बजाय इसके कि उन्हें हजारों बार एक वास्तविक पियानो पर गलत चाबियाँ दबाने के लिए मजबूर किया जाए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →