← नवीनतम पेपर
💻 computer science

Posterior Optimization with Clipped Objective for Bridging Efficiency and Stability in Generative Policy Learning

यह शोध पत्र POCO को प्रस्तुत करता है, जो एक सिद्धांत-आधारित RL फ्रेमवर्क है जो जनरेटिव रोबोटिक पॉलिसियों को फाइन-ट्यून करने में दक्षता और स्थिरता के बीच सेतु बनाता है, जो पॉलिसी इम्प्रूवमेंट को क्लिप्ड ऑब्जेक्टिव के साथ एक पोस्टीरियर इन्फरेंस समस्या के रूप में स्वरूपित करता है, जिससे मजबूत ऑफलाइन-टू-ऑनलाइन अनुकूलन सक्षम होता है जो सिमुलेशन बेंचमार्क और वास्तविक दुनिया के कॉन्टैक्ट-रिच कार्यों दोनों पर अत्याधुनिक प्रदर्शन प्राप्त करता है।

मूल लेखक: Yuhui Chen, Haoran Li, Zhennan Jiang, Yuxing Qin, Yuxuan Wan, Weiheng Liu, Dongbin Zhao

प्रकाशित 2026-04-03
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuhui Chen, Haoran Li, Zhennan Jiang, Yuxing Qin, Yuxuan Wan, Weiheng Liu, Dongbin Zhao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

बड़ी तस्वीर: एक रोबोट को बिना नुकसान पहुँचाए सिखाना

कल्पना कीजिए कि आपके पास एक रोबोटिक हाथ है जो पहले से ही वस्तुओं को उठाने में काफी अच्छा है। इसने यह इंसानों को ऐसा करते हुए हजारों वीडियो देखकर सीखा है (इसे प्री-ट्रेनिंग कहा जाता है)। अब, आप उसे एक नया, थोड़ा कठिन काम सिखाना चाहते हैं, जैसे कि यूएसबी ड्राइव को स्क्रू करना या कंप्यूटर चिप को असेंबल करना।

आप चाहते हैं कि रोबोट असली दुनिया में चीज़ों को आज़माकर सीखे (रिनफोर्समेंट लर्निंग)। लेकिन यहाँ एक समस्या है:

  • "जंगली" दृष्टिकोण (The "Wild" Approach): यदि आप रोबोट को तेज़ी से सीखने के लिए बेतरतीब ढंग से चीज़ें आज़माने देते हैं, तो वह गलती से यूएसबी ड्राइव को तोड़ सकता है, रोबोट को जाम कर सकता है, या वह उन बुनियादी चीज़ों को भूल सकता है जो उसने चीज़ों को धीरे से पकड़ने के बारे में सीखी थीं। इसे कैटास्ट्रोफिक कोलैप्स (विनाशकारी पतन) कहा जाता है।
  • "सुरक्षित" दृष्टिकोण (The "Safe" Approach): यदि आप रोबोट को केवल वही करने के लिए मजबूर करते हैं जिसके बारे में वह 100% आश्वस्त है, तो वह इतना धीरे सीखता है कि एक नया काम मास्टर करने में उसे लाखों साल लग जाएंगे।

POCO एक नया तरीका है जो एक समझदार, सतर्क कोच की तरह काम करता है। यह रोबोट को अपनी गलतियों से तेज़ी से सीखने देता है, लेकिन उस पर एक "सुरक्षा हार्नेस" (safety harness) भी लगा देता है ताकि वह अपने बुनियादी कौशल को कभी न भूले या हार्डवेयर को नुकसान न पहुँचाए।


मूल समस्या: "जेनरेटिव" रोबोट

आधुनिक रोबोट जेनरेटिव मॉडल्स का उपयोग करते हैं। इन्हें केवल साधारण कैलकुलेटर के रूप में नहीं, बल्कि कलाकारों के रूप में सोचें। केवल "हाथ 5 सेमी बाईं ओर ले जाएं" जैसी गणना करने के बजाय, ये कलाकार-रोबोट काम पूरा करने के लिए पूरी मूवमेंट्स की एक श्रृंखला (समय का एक हिस्सा) की कल्पना करता है।

समस्या यह है कि इन "कलाकारों" को बदलना कठिन है। यदि आप मानक गणित (ग्रेडिएंट्स) का उपयोग करके उनके विचार बदलने की कोशिश करते हैं, तो आप अनजाने में उन्हें एक बिल्ली की तस्वीर बनाने के लिए कह सकते हैं जबकि उन्हें एक कुत्ते की तस्वीर बनानी थी। गणित बहुत जटिल हो जाता है, और रोबोट पागल हो जाता है।

POCO समाधान: "कोच और सुरक्षा जाल"

POCO इसे रोबोट के सीखने के तरीके को बदलकर हल करता है। केवल "बेहतर बनने की कोशिश करने" के बजाय, यह सीखने को एक अनुमान लगाने के खेल (इन्फरेंस) के रूप में देखता है।

1. "E-स्टेप": कोच की समीक्षा (Expectation)

कल्पना कीजिए कि रोबोट कप उठाने के कुछ अलग तरीके आज़माता है।

  • कोच (क्रिटिक): एक समझदार पर्यवेक्षक इन प्रयासों को देखता है। वह कहता है, "हे, वह पहला प्रयास ठीक था, लेकिन वह दूसरा शानदार था! और तीसरा तो आपदा था।"
  • वेटिंग (Weighting): कोच प्रत्येक प्रयास को एक "स्कोर" देता है। शानदार वाले को एक बड़ा गोल्ड स्टार मिलता है; आपदा वाले को एक लाल 'X' मिलता है।
  • क्लिपिंग (The Clipping - सुरक्षा जाल): यहीं जादू है। यदि कोच किसी ऐसे "शानदार" प्रयास के प्रति बहुत अधिक उत्साहित हो जाता है जो वास्तव में अजीब दिखता है (शायद रोबोट कप तोड़ने वाला है), तो POCO उस स्कोर को क्लिप (सीमित) कर देता है। यह कहता है, "ठीक है, यह बहुत अच्छा है, लेकिन चलिए बहुत ज़्यादा पागल नहीं होते। हम इसकी प्रशंसा को सीमित करेंगे ताकि रोबोट अत्यधिक प्रतिक्रिया न दे।" यह रोबोट को खतरनाक उतार-चढ़ाव करने से रोकता है।

2. "M-स्टेप": रोबोट का अभ्यास (Maximization)

अब, रोबोट कोच की प्रतिक्रिया देखता है।

  • इन "कलाकार" रोबोटों के लिए जटिल गणितीय सूत्रों की गणना करने के बजाय, यह बस उन अच्छे प्रयासों की नकल (imitate) करता है जिन्हें कोच ने हाइलाइट किया था।
  • "क्लिपिंग" सुरक्षा जाल के कारण, रोबोट केवल सुरक्षित अच्छे प्रयासों से सीखता है। वह अजीब चीज़ों से भ्रमित नहीं होता है।
  • यह अपनी "मसल मेमोरी" को थोड़ा बेहतर बनाने के लिए अपडेट करता है, लेकिन यह अपने मूल, सुरक्षित स्टाइल के करीब रहता है।

"ऑफलाइन-टू-ऑनलाइन" यात्रा

पेपर एक दो-चरणीय प्रशिक्षण प्रक्रिया का वर्णन करता है:

  1. ऑफलाइन (कक्षा में): रोबोट कक्षा में बैठकर इंसानों के वीडियो देखता है। वह बुनियादी बातें सीखता है। वह एक अच्छा छात्र है, लेकिन उसने अभी तक वास्तविक वस्तुओं को छुआ नहीं है।
  2. ऑनलाइन (फील्ड ट्रिप): रोबोट असली दुनिया में जाता है।
    • जाल (The Trap): आमतौर पर, जब कोई रोबोट असली दुनिया में जाता है, तो वह अजीब चीज़ें आज़माता है, वास्तविक दुनिया की उलझनों से भ्रमित हो जाता है, और अपनी क्लास के सबक भूल जाता है।
    • POCO की तरकीब: POCO रोबोट को उसकी क्लास के पाठों से बांध कर रखता है। भले ही रोबोट नई चीज़ें आज़माता है, "सुरक्षा जाल" (क्लिप्ड ऑब्जेक्टिव) यह सुनिश्चित करता है कि वह जो पहले से जानता है उससे बहुत दूर न जाए। वह बुनियादी बातों को भूले बिना वास्तविक दुनिया से सीखता है।

यह एक बड़ी बात क्यों है?

  • यह "बड़े दिमाग" वाले रोबोट्स के साथ काम करता है: यह विशाल, जटिल AI मॉडल्स (जैसे कि जो भाषा और दृष्टि को समझते हैं) को शून्य से दोबारा बनाए बिना उन्हें फाइन-ट्यून कर सकता है।
  • यह सुरक्षित है: वास्तविक दुनिया के परीक्षणों में, रोबोट ने कंप्यूटर पार्ट्स को असेंबल करने जैसे कठिन कार्यों पर 96.7% सफलता दर हासिल की। अन्य तरीके या तो पुर्जों को तोड़ देते थे या बहुत धीरे सीखते थे।
  • यह कुशल है: यह "सुरक्षित" तरीकों की तुलना में बहुत तेज़ी से सीखता है क्योंकि यह नई चीज़ें आज़माने से डरता नहीं है, जब तक कि उसके पास सुरक्षा जाल मौजूद हो।

सारांश उपमा (Summary Analogy)

रोबोट को एक नौसिखिया शेफ के रूप में सोचें जिसने कुकबुक पढ़ी है (प्री-ट्रेनिंग) लेकिन उसने कभी वास्तविक भोजन नहीं बनाया है।

  • स्टैंडर्ड RL: आप शेफ से कहते हैं, "जाओ खाना बनाओ! अगर स्वाद अच्छा है, तो इसे जारी रखो। अगर स्वाद खराब है, तो रुक जाओ।" शेफ घबरा जाता है, रसोई जला देता है, और पानी उबालना भी भूल जाता है।
  • POCO: आप एक सू-शेफ (सहायक शेफ) की भूमिका निभाते हैं। नौसिखिया शेफ एक नया नुस्खा आज़माता है। आप चखते हैं।
    • यदि यह अद्भुत है, तो आप कहते हैं, "ऐसा ही दोबारा करो!"
    • यदि यह अजीब है, तो आप कहते हैं, "यह दिलचस्प है, लेकिन बिल्कुल ऐसा मत करो। आइए इसे थोड़ा सा बदलें।"
    • क्लिपिंग: यदि शेफ 10 पाउंड नमक डालने की कोशिश करता है क्योंकि उसे लगा कि यह एक "अच्छा विचार" है, तो आप उसे धीरे से रोकते हैं और कहते हैं, "आइए बस एक चुटकी ही रखें।"
    • परिणाम: शेफ तेज़ी से नए व्यंजन बनाना सीख जाता है, बिना घर जलाए या चाकू का उपयोग करना भूले।

POCO वह समझदार सू-शेफ है, जो रोबोट को सुरक्षित और कुशलतापूर्वक जटिल, वास्तविक दुनिया के कौशल सीखने की अनुमति देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →