SARM2: Multi-Task Stage Aware Reward Modeling for Self Improving Robotic Manipulation
यह शोध पत्र SARM2 प्रस्तुत करता है, जो एक मल्टी-टास्क स्टेज-अवेयर रिवॉर्ड मॉडल है जिसे SPIRAL फ्रेमवर्क के साथ संयोजित किया गया है, जो स्वायत्त रोलआउट्स से सघन, सटीक रिवॉर्ड्स उत्पन्न करके लॉन्ग-होराइजन कार्यों पर VLA पॉलिसी के प्रदर्शन को महत्वपूर्ण रूप से बढ़ाने के लिए स्व-सुधारित रोबोटिक मैनिपुलेशन को सक्षम बनाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को एक जटिल काम करना सिखा रहे हैं, जैसे कि शॉर्ट्स की एक जोड़ी मोड़ना या व्हाइटबोर्ड साफ करना। ये केवल एक-चरणीय क्रियाएं नहीं हैं; ये छोटे-छोटे मूव्स का एक लंबा क्रम हैं।
यह पेपर एक नया सिस्टम पेश करता है जिसे SARM2 कहा जाता है और एक लर्निंग फ्रेमवर्क जिसे SPIRAL कहा जाता है, ताकि रोबोट को पहले की तुलना में बहुत तेज़ी से और बेहतर तरीके से काम सिखाया जा सके। यह कैसे काम करता है, यहाँ सरल भाषा में समझाया गया है:
समस्या: "अंधा" रोबोट
वर्तमान में, रोबोट को सिखाने में आमतौर पर "बिहेवियर क्लोनिंग" (Behavior Cloning) का उपयोग किया जाता है। यह एक इंसान को काम करते हुए वीडियो दिखाने और उसे यह कहने जैसा है, "जो तुम देख रहे हो, ठीक वैसा ही कॉपी करो।"
- खामी: यदि रोबोट शुरुआत में एक छोटी सी गलती करता है, तो वह भटक जाता है। उसे नहीं पता होता कि वह क्यों विफल हुआ या उसे कैसे ठीक किया जाए क्योंकि वह केवल अंधाधुंध नकल कर रहा है।
- रिवॉर्ड (पुरस्कार) की समस्या: रोबोट को अपने आप सुधार करने के लिए सिखाने के लिए (Reinforcement Learning का उपयोग करके), आपको एक "स्कोरकार्ड" (रिवॉर्ड मॉडल) की आवश्यकता होती है जो उसे बताता है कि वह हर एक कदम पर कैसा प्रदर्शन कर रहा है।
- पुराने स्कोरकार्ड बहुत अस्पष्ट थे (जैसे कि काम के बिल्कुल अंत में केवल "अच्छा काम किया!" कहना)।
- अन्य स्कोरकार्ड बहुत विशिष्ट थे (आपको हर नए कार्य के लिए उन्हें शून्य से बनाना पड़ता था)।
समाधान: SARM2 (एक "स्मार्ट स्कोरकार्ड")
लेखकों ने एक नए प्रकार का स्कोरकार्ड बनाया है जिसे SARM2 कहा जाता है। इसे एक रोबोटिक कार्यों के लिए यूनिवर्सल GPS के रूप में समझें।
"एक्शन प्रिमिटिव" डिक्शनरी (Action Primitive Dictionary):
पूरे जटिल कार्य को एक साथ समझने के बजाय, SARM2 इसे छोटे, बुनियादी निर्माण खंडों (building blocks) में तोड़ देता है जिन्हें "प्रिमिटिव्स" कहा जाता है।- उपमा: कल्पना करें कि यह एक भाषा है। आपको हर किताब पढ़ने के लिए एक नए शब्दकोश की आवश्यकता नहीं होती; आपको बस वर्णमाला और सामान्य शब्दों की आवश्यकता होती है। SARM2 के पास लगभग 22 बुनियादी मूव्स की शब्दावली है (जैसे "उठाना", "धकेलना", "घुमाना", "पकड़ना/क्लैंप करना")।
- चाहे रोबोट शर्ट मोड़ रहा हो या बोर्ड साफ कर रहा हो, वह बस इन्हीं 22 बुनियादी मूव्स को अलग-अलग क्रमों में जोड़ रहा है।
"स्टेज एस्टीमेटर" (द GPS):
SARM2 देखता है कि रोबोट अभी क्या कर रहा है और पूछता है: "हम इन 22 बुनियादी मूव्स में से कौन सा कर रहे हैं?"- यदि रोबट वर्तमान में एक शर्ट को "घुमा" (rotating) रहा है, तो S-ARM2 जानता है कि रोटेशन के लिए "अच्छा" क्या दिखता है।
- यदि वह "मोड़ने" (folding) की ओर स्विच करता है, तो SARM2 तुरंत अपना ध्यान मोड़ने के लिए "अच्छे" दिखने वाले काम पर केंद्रित कर देता है।
"मल्टी-गेट एक्सपर्ट" सिस्टम (Multi-Gate Expert System):
यह SARM2 का मस्तिष्क है। कल्पना करें कि एक अस्पताल में कई विशेषज्ञ हैं।- यदि किसी मरीज का पैर टूटा है, तो आप उसे ऑर्थोपेडिस्ट के पास भेजते हैं। यदि उसे सिरदर्द है, तो आप उसे न्यूरोलॉजिस्ट के पास भेजते हैं।
- SARM2 भी इसी तरह काम करता है। जब यह वर्तमान "मूव" (जैसे "उठाना") की पहचान करता है, तो यह उस विशिष्ट "एक्सपर्ट" AI के लिए दरवाजा खोल देता है जो उठाने का निर्णय लेने में सबसे अच्छा है। यह एक सामान्य दिमाग का उपयोग करने के बजाय, सही क्षण के लिए सही विशेषज्ञ का उपयोग करता है।
परिणाम: SARM2 रोबोट को एक बहुत ही सटीक, चरण-दर-चरण स्कोर (एक "डेंस रिवॉर्ड") देता है जो उसे बताता है कि वह काम पूरा करने के कितने करीब है, चाहे कार्य कुछ भी हो।
लर्निंग लूप: SPIRAL (एक "स्व-सुधारने वाला जिम")
एक बार जब रोबोट के पास यह परफेक्ट स्कोरकार्ड (SARM2) आ जाता है, तो लेखकों ने एक सिस्टम बनाया है जिसे SPIRAL कहा जाता है ताकि रोबोट अपने आप अभ्यास कर सके।
यह कैसे काम करता है:
- रोबोट अपने आप कार्य करने का प्रयास करता है (एक "रोलआउट")।
- SARM2 देखता है और उसके द्वारा किए गए प्रत्येक मूव के लिए उसे एक स्कोर देता है।
- रोबोट उन स्कोर का उपयोग यह समझने के लिए करता है कि अगली बार क्या अलग करना है।
- यह बार-बार दोहराता है, बिना किसी इंसान के हर सेकंड निगरानी किए, बेहतर होता जाता है।
"फ्लाईव्हील" प्रभाव (The Flywheel Effect):
आमतौर पर, रोबोट को सीखने के लिए महंगे मानव प्रदर्शनों की आवश्यकता होती है। SPIRAL एक "डेटा फ्लाईव्हील" बनाता है। रोबोट अपना स्वयं का अभ्यास डेटा उत्पन्न करता है, SARM2 द्वारा ग्रेड प्राप्त करता है, सीखता है, और फिर से बेहतर डेटा उत्पन्न करता है। यह एक स्व-सुधारने वाले लूप के रूप में विकसित होता है।
उन्होंने क्या सिद्ध किया?
टीम ने वास्तविक रोबोटों पर दो विशिष्ट कार्यों के साथ इसका परीक्षण किया:
- शॉर्ट्स मोड़ना: एक कठिन कार्य जिसमें नरम, ढीला कपड़ा शामिल है।
- व्हाइटबोर्ड साफ करना: एक कार्य जिसमें बोर्ड को स्थिर रखने के लिए उसे पकड़ना आवश्यक है।
परिणाम:
- सटीकता: SARM2 पिछले तरीकों की तुलना में प्रगति का आकलन करने में 80% अधिक सटीक था।
- सफलता दर:
- शॉर्ट्स मोड़ने के लिए, इस सिस्टम का उपयोग करने वाले रोबोट आधे समय विफल होने से लेकर 100% सफलता तक पहुँच गए।
- व्हाइटबोर्ड साफ करने के लिए, वे 50% सफलता से बढ़कर 90% हो गए।
संक्षेप में
यह पेपर तर्क देता है कि रोबोट को वास्तव में स्मार्ट बनाने के लिए, हम उन्हें केवल वीडियो नहीं दिखा सकते। हमें उन्हें कार्य के छोटे "चरणों" को पहचानने और हर चरण के लिए एक सटीक, रियल-टाइम स्कोर देने के लिए प्रशिक्षित करने की आवश्यकता है। एक सार्वभौमिक "स्टेप डिक्शनरी" को विशेषज्ञों की एक टीम के साथ जोड़कर, और रोबोट को एक स्व-सुधारने वाले लूप में अभ्यास करने देकर, उन्होंने एक ऐसा सिस्टम बनाया है जहाँ रोबोट जटिल घरेलू काम अपने आप, तेज़ी से और विश्वसनीयता के साथ सीख सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।