← नवीनतम पेपर
🤖 machine learning

From Prior to Pro: Efficient Skill Mastery via Distribution Contractive RL Finetuning

यह शोध पत्र DICE-RL को प्रस्तुत करता है, जो एक सैंपल-कुशल सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो ऑनलाइन फीडबैक से सफल व्यवहारों को बढ़ाने के लिए वितरण संकुचन (distribution contraction) का उपयोग करके प्रीट्रेन किए गए जनरेटिव रोबोट नीतियों को उच्च-प्रदर्शन वाले विशेषज्ञों में परिष्कृत करता है, जिससे सिमुलेशन और वास्तविक दुनिया दोनों परिवेशों में पिक्सेल इनपुट से जटिल दीर्घ-क्षितिज़ (long-horizon) हेरफेर कार्यों में महारत हासिल करना सक्षम होता है।

मूल लेखक: Zhanyi Sun, Shuran Song

प्रकाशित 2026-03-12
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhanyi Sun, Shuran Song

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक जटिल कार्य करना सिखा रहे हैं, जैसे कि दो पुली के चारों ओर एक बेल्ट लगाना या सॉकेट में लाइट बल्ब डालना। आपके पास इसे सिखाने के दो मुख्य तरीके हैं:

  1. "कॉपीकैट" विधि (बिहेवियर क्लोनिंग - Behavior Cloning): आप रोबोट को एक मानव विशेषज्ञ द्वारा काम को पूरी तरह से करने के सैकड़ों वीडियो दिखाते हैं। रोबोट उनके मूव्स की नकल करना सीख जाता है। यह नकल करने में बहुत अच्छा है, लेकिन यदि वह थोड़ा सा भी पटरी से उतर जाता है या ऐसी स्थिति का सामना करता है जो उसने पहले नहीं देखी है, तो वह घबरा जाता है और विफल हो जाता है। यह उस छात्र की तरह है जिसने पाठ्यपुस्तक को रट लिया है लेकिन वह एक नए प्रकार के गणित के सवाल को हल नहीं कर सकता।

  2. "ट्रायल एंड एरर" विधि (रीइन्फोर्समेंट लर्निंग - Reinforcement Learning): आप रोबट को अपने आप प्रयास करने देते हैं, जब वह सफल होता है तो उसे पुरस्कृत करते हैं और जब वह विफल होता है तो उसे दंडित करते हैं। यह वैसे ही है जैसे इंसान साइकिल चलाना सीखते हैं। हालाँकि, वास्तविक दुनिया में, रोबोट महंगे और धीमे होते हैं। यदि कोई रोबोट शुद्ध रूप से ट्रायल एंड एरर के माध्यम से एक जटिल कार्य सीखने की कोशिश करता है, तो वह उपकरणों को तोड़ सकता है या उसे सीखने में वर्षों लग सकते हैं। यह हर बार गलती करने पर खाई से गिरकर साइकिल सीखने जैसा है।

समस्या:
हम चाहते हैं कि रोबोट के पास "कॉपीकैट" जैसी सुरक्षा और व्यापक ज्ञान हो, लेकिन "ट्रायल एंड एरर" सीखने वाले जैसी अनुकूलन क्षमता और सटीकता भी हो। लेकिन दोनों को मिलाना कठिन है। यदि आप रोबोट को बहुत अधिक स्वतंत्र रूप से "सीखने" देते हैं, तो वह जो सिखाया गया है उसे भूल जाता है और खतरनाक, रैंडम चीजें करने लगता है। यदि आप उसे बहुत सख्त रखते हैं, तो वह सुधार नहीं कर सकता।

समाधान: DICE-RL (द "स्मार्ट एडिटर"):
यह पेपर एक नया तरीका पेश करता है जिसे DICE-RL कहा जाता है। इसे एक रफ ड्राफ्ट को रिफाइन करने के लिए एक स्मार्ट एडिटर को काम पर रखने के रूप में सोचें।

यह इस प्रकार काम करता है:

1. "रफ ड्राफ्ट" (प्रीट्रेन्ड पॉलिसी - The Pretrained Policy)

सबसे पहले, हम मानव प्रदर्शनों के एक विशाल डेटासेट पर "कॉपीकैट" विधि का उपयोग करके रोबोट को प्रशिक्षित करते हैं। यह एक बेस पॉलिसी (Base Policy) बनाता है।

  • उपमा (Analogy): कल्पना कीजिए कि एक प्रतिभाशाली लेकिन थोड़ा अनाड़ी संगीतकार है जिसने एक गाने का 1,000 बार अभ्यास किया है। वह धुन और सामान्य संरचना को पूरी तरह से जानता है, लेकिन वह कुछ नोट्स गलत बजा सकता है या कोरस में थोड़ा तेज़ खेल सकता है। वह गाना बजाने के लिए "काफी अच्छा" है, लेकिन "प्रो" स्तर का नहीं है।

2. "डिस्ट्रीब्यूशन कॉन्ट्रैक्शन" (मुख्य विचार - The Core Idea)

आमतौर पर, जब आप रीइन्फोर्समेंट लर्निंग (RL) के साथ एक रोबोट को सुधारने की कोशिश करते हैं, तो आप उसे बेहतर मूव्स खोजने के लिए इधर-उधर भटकने देते हैं। यह खतरनाक और अक्षम है।

  • DICE-RL का ट्विस्ट: रोबोट को इधर-उधर भटकने देने के बजाय, DICE-RL एक चुंबक की तरह काम करता है। यह उस "रफ ड्राफ्ट" संगीतकार को कहता है, "तुम पहले से ही सही गाना बजा रहे हो। बस उन नोट्स को ठीक करो जो थोड़े से गलत हैं।"
  • यह "डिस्ट्रीब्यूशन को सिकोड़ने" (contracting the distribution) पर ध्यान केंद्रित करता है। कल्पना कीजिए कि रोबोट के संभावित कार्य धुंध के एक चौड़े बादल की तरह हैं। "बुरे" कार्य धुंधले किनारे हैं, और "अच्छे" कार्य स्पष्ट केंद्र हैं। DICE-RL उस बादल को दबाता है, रोबोट को स्पष्ट केंद्र में रहने के लिए प्रेरित करता है जहाँ सफल कार्य मौजूद हैं, और धुंधले किनारों को सिकोड़ देता है जहाँ विफलताएं होती हैं।

3. "रेसिडुअल" (हल्का सुधार - The Lightweight Correction)

रोबोट पूरा गाना फिर से नहीं सीखता। इसके बजाय, वह एक छोटा "रेसिडुअल" (Residual) (एक छोटा सुधार) सीखता है।

  • उपमा: बेस पॉलिसी मुख्य स्क्रिप्ट है। रेसिडुअल वह स्टिकी नोट है जिसे एडिटर जोड़ता है और कहता है, "इस विशिष्ट दृश्य में, स्क्रिप्ट के अनुसार 5 डिग्री अधिक बाईं ओर मुड़ें।"
  • यह महत्वपूर्ण है क्योंकि यह रोबोट को सुरक्षित रखता है। वह अचानक मेज को तोड़ने का निर्णय नहीं ले सकता; वह केवल सुरक्षित, पूर्व-अनुमोदित योजना में छोटे, गणना किए गए बदलाव कर सकता है।

4. "बेस्ट-ऑफ-एन" चयन (ऑडिशन - The Best-of-N Selection)

जब रोबोट को वास्तविक दुनिया में कोई मूव करना होता है, तो वह केवल एक रैंडम एक्शन नहीं चुनता है।

  • उपमा: कल्पना कीजिए कि रोबोट अगले मूव के 10 अलग-अलग संस्करण तैयार करता है (जैसे कि एक निर्देशक अभिनेता को एक लाइन को 10 अलग तरीकों से बोलने के लिए कहता है)। फिर वह सभी को स्कोर करने के लिए एक "वैल्यू फंक्शन" (एक स्मार्ट जज) का उपयोग करता है। वह निष्पादित करने के लिए एकल सबसे अच्छा संस्करण चुनता है।
  • यह सुनिश्चित करता है कि भले ही रोब सहित खोज (exploring) कर रहा हो, वह केवल वही मूव निष्पादित करता है जिसके सफल होने की सबसे अधिक संभावना दिखती है।

यह एक बड़ी बात क्यों है?

पेपर दिखाता है कि यह तरीका कंप्यूटर सिमुलेशन और वास्तविक रोबोटों पर भी अविश्वसनीय रूप से अच्छा काम करता है।

  • दक्षता (Efficiency): यह पारंपरिक तरीकों की तुलना में बहुत तेज़ी से सीखता है क्योंकि यह खतरनाक या बेकार मूव्स खोजने में समय बर्बाद नहीं करता है।
  • स्थिरता (Stability): यह "भूलता" नहीं है कि इसे क्या सिखाया गया था। यह मौजूदा ज्ञान के ऊपर निर्माण करता है, न कि उसे ओवरराइट करता है।
  • वास्तविक दुनिया की सफलता: उन्होंने एक वास्तविक रोबोटिक आर्म पर बेल्ट पिरोने और लाइट बल्ब डालने जैसे कठिन कार्यों के लिए इसका परीक्षण किया। "कॉपीकैट" रोबोट अक्सर विफल हुआ, लेकिन "DICE-RL" रोबोट (एडिट किया गया संस्करण) ने बहुत कम प्रयासों में कार्यों में महारत हासिल कर ली।

सारांश

DICE-RL एक ऐसे छात्र को लेने जैसा है जिसने पाठ्यपुस्तक को रट लिया है (प्रीट्रेन्ड पॉलिसी) और उसे एक स्मार्ट ट्यूटर (RL) देना जो उसे उसके उत्तरों को रिफाइन करने में मदद करता है। ट्यूटर उसे बेतरतीब ढंग से अनुमान लगाने नहीं देता; इसके बजाय, यह उसे उन विशिष्ट, उच्च-गुणवत्ता वाले उत्तरों पर ध्यान केंद्रित करने में मदद करता है जिन्हें वह पहले से ही जानता है कि संभव हैं, जिससे वह बहुत तेज़ी से और सुरक्षित रूप से एक सच्चा "प्रो" बन जाता है।

एक वाक्य में: DICE-RL एक रोबोट को जो "नकल करने में अच्छा" है, उसे "करने में महान" में बदल देता है, क्योंकि यह सावधानीपूर्वक सफल मूव्स पर उसका ध्यान केंद्रित करता है और उसे पटरी से उतरने नहीं देता।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →