← नवीनतम पेपर
💻 computer science

WAM-RL: World-Action Model Reinforcement Learning with Reconstruction Rewards and Online Video SFT

यह शोध पत्र WAM-RL को प्रस्तुत करता है, जो एक नवीन सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो पुनर्निर्माण पुरस्कारों (reconstruction rewards) के माध्यम से विश्व और क्रिया मॉडलों के संयुक्त ऑनलाइन अनुकूलन को सक्षम बनाता है, यह प्रदर्शित करते हुए कि विशेषज्ञ-मात्र प्रशिक्षण की सीमाओं से परे दीर्घ-क्षिति हेरफेर कार्यों (long-horizon manipulation tasks) में उत्कृष्ट प्रदर्शन प्राप्त करने के लिए दोनों घटकों का सह-विकास करना आवश्यक है।

मूल लेखक: Zezhong Qian, Xiaowei Chi, Yu Qi, Haozhan Li, Zhi Yang Chen, Shanghang Zhang

प्रकाशित 2026-06-17
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zezhong Qian, Xiaowei Chi, Yu Qi, Haozhan Li, Zhi Yang Chen, Shanghang Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक जटिल कार्य करना सिखा रहे हैं, जैसे कि पौधे को पानी देना या ब्लॉकों को एक के ऊपर एक रखना। पारंपरिक रूप से, हम रोबोट को विशेषज्ञों द्वारा काम को पूरी तरह से करने वाले वीडियो दिखाकर सिखाते हैं। रोबोट इन वीडियो को याद कर लेता है और उनकी नकल करने की कोशिश करता है। यह सरल कार्यों के लिए अच्छा काम करता है, लेकिन यदि रोबोट एक छोटी सी गलती करता है, तो वह अक्सर भ्रमित हो जाता है और पूरी तरह से विफल हो जाता है क्योंकि उसने कभी सुधार करना नहीं सीखा।

यह पेपर एक नया सिस्टम पेश करता है जिसे WAM-RL कहा जाता है। इसे एक रोबोट को केवल वीडियो देखने के बजाय, वास्तव में कार्य करते हुए "मस्तिष्क" और "शरीर" देने के रूप में समझें जो एक साथ सीखते हैं।

यह यहाँ कैसे काम करता है, सरल अवधारणाओं में विभाजित है:

1. दो भाग: "इमेजिनेटर" (कल्पना करने वाला) और "डूअर" (करने वाला)

अधिकांश उन्नत रोबोट मॉडल के दो मुख्य भाग होते हैं:

  • वर्ल्ड मॉडल (द इमेजिनेटर - कल्पना करने वाला): यह रोबोट के सिर के अंदर एक फिल्म निर्देशक की तरह है। रोबोट के हिलने से पहले, यह कल्पना करता है कि भविष्य कैसा दिखेगा। "यदि मैं अपना हाथ इस तरह हिलाता हूँ, तो ब्लॉक गिर जाएगा। यदि मैं उसे इस तरह हिलाता हूँ, तो वह वहीं रहेगा।" यह भविष्य की भविष्यवाणी करता है।
  • एक्शन मॉडल (द डूअर - करने वाला): यह रोबोट का शरीर है। यह उस "फिल्म" को लेता है जिसे इमेजिनेटर ने बनाया है और उसे वास्तविक मांसपेशियों की गतिविधियों में बदल देता है।

समस्या: पुराने सिस्टमों में, "इमेजिनेटर" स्थिर था। इसे आदर्श वीडियो पर प्रशिक्षित किया गया था और यह कभी बदलता नहीं था। यदि वास्तविक दुनिया उस आदर्श वीडियो से मेल नहीं खाती थी (जैसे कि यदि रोबोट ने एक ब्लॉक गिरा दिया), तो "डूअर" को इसे ठीक करने का तरीका नहीं पता होता था क्योंकि उसका "इमेजिनेटर" यह अनुमान नहीं लगा सकता था कि कोई गलती हुई है।

2. समाधान: एक टीम जो एक साथ बढ़ती है

लेखकों ने एक ऐसा ढांचा बनाया है जहाँ इमेजिनेटर और डूअर वास्तविक समय में एक-दूसरे से सीखते हैं।

  • डूअर को एक नया कोच मिला: केवल अंत में "अच्छा काम किया" या "बुरा काम किया" सुने जाने के बजाय, डूअर को इस आधार पर लगातार स्कोर मिलता है कि उसकी वास्तविक गतिविधियाँ इमेजिनेटर की भविष्यवाणियों से कितनी अच्छी तरह मेल खाती हैं। यदि रोबोट कल्पना करता है कि ब्लॉक अपनी जगह पर रहेगा, लेकिन वह गिर जाता है, तो डूअर को "दंड" (पेनल्टी) मिलता है। यह डूअर को इस तरह से हिलने के लिए प्रशिक्षित करता है जो योजना से मेल खाता हो।
  • इमेजिनेटर को वास्तविकता का अहसास कराया गया: इमेजिनेटर को रोबोट के सफल होने के वास्तविक वीडियो का उपयोग करके अपडेट किया जाता है। महत्वपूर्ण रूप से, लेखकों ने एक "सुरक्षा जाल" (जिसे KL रेगुलराइजेशन कहा जाता है) जोड़ा है। कल्पना कीजिए कि इमेजिनेटर एक छात्र है जो नई चीजें सीख रहा है। सुरक्षा जाल छात्र को वह सब कुछ भूलने या अपने व्यक्तित्व को बहुत अधिक बदलने से रोकता है जो वह पहले से जानता था। यह सुनिश्चित करता है कि इमेजिनेटर डूअर के साथ संबंध को तोड़े बिना अपनी भविष्यवाणियों में सुधार करे।

3. बड़ी खोज: आप केवल शरीर को प्रशिक्षित नहीं कर सकते

पेपर ने प्रयोगों के माध्यम से एक बहुत ही महत्वपूर्ण बात पाई:

  • छोटे कार्य: यदि आप केवल "डूअर" (शरीर) को प्रशिक्षित करते हैं और "इमेजिनेटर" (मस्तिष्क) को अकेला छोड़ देते हैं, तो रोबोट त्वरित, सरल कार्यों में बेहतर हो जाता है।
  • लंबे कार्य: लंबे समय तक चलने वाले जटिल कार्यों के लिए, केवल शरीर को प्रशिक्षित करना विफल हो जाता है। क्यों? क्योंकि शरीर इस बात से सीमित है कि मस्तिष्क भविष्य की भविष्यवाणी करने में कितना अच्छा है। यदि मस्तिष्क अपनी भविष्यवाणी में एक छोटी सी त्रुटि करता है, तो शरीर उसे ठीक नहीं कर सकता है, और त्रुटियां जमा होती रहती हैं जब तक कि रोबोट विफल न हो जाए।

उपमा: कल्पना कीजिए कि आप एक वीडियो गेम खेल रहे हैं जहाँ आप एक पात्र (डूअर) हैं, लेकिन मैप (इमेजिनेटर) थोड़ा गलत है। यदि गेम छोटा है, तो आप रास्ता ढूंढ लेंगे। लेकिन यदि गेम लंबा है, तो गलत मैप अंततः आपको खाई में ले जाएगा। आपको केवल अपने पात्र की दौड़ने की गति सुधारने के बजाय, खेलते समय मैप को ठीक करने की आवश्यकता है।

4. वे सफलता को कैसे मापते हैं

केवल यह जाँचने के बजाय कि रोबोट ने कार्य पूरा किया या नहीं, उन्होंने एक चतुर तरीका इस्तेमाल किया। उन्होंने कल्पित भविष्य (जो रोबोट ने सोचा था कि होगा) की तुलना वास्तविक भविष्य (जो वास्तव में हुआ) से की।

  • यदि रोबोट ने कल्पना की कि ब्लॉक वहीं रहेगा, और वह वहीं रहा, तो यह एक उच्च स्कोर है।
  • यदि रोबोट ने कल्पना की कि ब्लॉक वहीं रहेगा, लेकिन वह गिर गया, तो यह कम स्कोर है।
    यह रोबोट को वास्तविकता की अधिक सटीक भविष्यवाणी करने में मदद करता है, जो बदले में उसे बेहतर ढंग से हिलने में मदद करता है।

5. परिणाम: गलतियों से उबरना सीखना

सबसे रोमांचक परिणाम यह है कि इस प्रणाली ने रोबोट को गलतियों से उबरना सिखाया।

  • इस प्रणाली के बिना: यदि रोबोट ने एक ब्लॉक को पकड़ने की कोशिश की और चूक गया, तो वह उसी गलत तरीके से पकड़ने की कोशिश करता रहेगा, और अंततः हार मान लेगा।
  • इस प्रणाली के साथ: "इमेजिनेटर" ने यह अनुमान लगाना सीख लिया कि एक चूक हो सकती है। फिर इसने एक रिकवरी योजना (जैसे हाथ को वापस लाना और फिर से प्रयास करना) की "कल्पना" की। "डूअर" ने इस योजना को देखा और इसे निष्पादित किया। रोबोट ने सीखा कि, "ओह, मैं चूक गया, मुझे एक अलग कोण से प्रयास करना चाहिए," और सफल हुआ।

सारांश

WAM-RL एक ऐसा तरीका है जहाँ एक रोबोट का "मस्तिष्क" (भविัติवाणी) और "शरीर" (क्रिया) वास्तविक समय में एक साथ सीखते हैं। उन्हें एक साथ सुधारने से, रोबोट लंबे, जटिल कार्यों में बहुत बेहतर हो जाता है और सबसे महत्वपूर्ण बात यह है कि वह चीजें गलत होने पर अपनी गलतियों को सुधारना सीख जाता है, बजाय इसके कि वह केवल विफल हो जाए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →