APEX: Adaptive Policy Execution for Precise Manipulation
यह शोध पत्र APEX को प्रस्तुत करता है, जो एक प्लग-एंड-प्ले फ्रेमवर्क है जो उच्च-स्तरीय इमिटेशन लर्निंग पॉलिसियों और निम्न-स्तरीय नियंत्रकों के बीच निष्पादन अंतराल (execution gap) को पाटता है, गतिशील रूप से व्यवहार्य संदर्भों (dynamically feasible references) का पुनर्निर्माण करके और परीक्षण के समय स्टेट फीडबैक के अनुकूल होकर, जिससे मूल नीति या नियंत्रक में बिना किसी संशोधन के ट्रैकिंग त्रुटियों को काफी कम किया जाता है और हेरफेर की सफलता में सुधार किया जाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को सुई में धागा पिरोना या ब्लॉक्स को एक के ऊपर एक रखना सिखा रहे हैं। आपके पास एक "दिमाग" (AI पॉलिसी) है जो ठीक से जानता है कि क्या करना है, और आपके पास "मांसपेशियां" (लो-लेवल कंट्रोलर) हैं जो वास्तव में रोबोट के हाथों को हिलाती हैं।
समस्या यह है, जैसा कि इस पेपर में बताया गया है, कि दिमाग और मांसपेशियां एक ही भाषा पूरी तरह से नहीं बोल पातीं।
समस्या: "अनुवाद का अंतर" (The Translation Gap)
AI दिमाग योजना बनाने में बहुत अच्छा है। वह कहता है, "हाथ को इस सटीक स्थान पर ले जाओ, इस सटीक गति से।" हालांकि, रोबोट की मांसपेशियां (कंट्रोलर) अक्सर कठोर या अपूर्ण होती हैं। वे थोड़ी धीमी हो सकती हैं, या वे उस सूक्ष्म "त्वरण" (acceleration) कमांड को नहीं समझ सकतीं जो दिमाग दे रहा है।
इसे एक कंडक्टर (दिमाग) के रूप में सोचें जो ऑर्केस्ट्रा (मांसपेशियों) को एक नोट बजाने के लिए अपनी छड़ी लहराता है। कंडक्टर पूरी तरह से हाथ लहराता है, लेकिन वायलिन वादक (कंट्रोलर) थोड़ा बेसुरा है या एक सेकंड की देरी से प्रतिक्रिया करता है। परिणाम? संगीत (रोबोट की गति) थोड़ा बेसुरा हो जाता है। एक साधारण खेल में, इससे कोई फर्क नहीं पड़ता। लेकिन यदि रोबोट 3 मिलीमीटर के छेद में सुई पिरोने की कोशिश कर रहा है, तो थोड़ी सी भी चूक काम को विफल कर सकती है।
लेखक इसे "एग्जीक्यूशन गैप" (Execution Gap) कहते हैं।
पुराने समाधान (वे क्यों परेशान करने वाले थे)
पहले, इसे ठीक करने के लिए, लोगों ने दो चीजें आजमाई थीं:
- दिमाग को फिर से लिखना: AI के कोड को बदलें ताकि वह अधिक सावधान रहे। लेकिन क्या होगा यदि AI एक विशाल, प्री-ट्रेन किया हुआ मॉडल है जिसे आप छू नहीं सकते?
- मांसपेशियों को फिर से लिखना: रोबोट के आंतरिक कंट्रोलर को बदलें। लेकिन क्या होगा यदि रोबोट एक व्यावसायिक उत्पाद (जैसे UR5 आर्म) है और आपके पास उसके आंतरिक कोड तक पहुंच नहीं है?
दोनों तरीकों के लिए उन प्रणालियों पर गहन सर्जरी की आवश्यकता थी जिन्हें आप छूने की अनुमति नहीं रखते थे।
समाधान: APEX (एक "स्मार्ट अनुवादक")
लेखक APEX (एडैप्टिव पॉलिसी एग्जीक्यूशन) का प्रस्ताव देते हैं। APEX को एक सुपर-स्मार्ट अनुवादक या कंडक्टर के सहायक के रूप में सोचें जो दिमाग और मांसपेशियों के बीच खड़ा होता है।
यह दिमाग को नहीं बदलता है, और न ही यह मांसपेशियों को बदलता है। यह बस बीच में बैठता है और वास्तविक समय में मांसपेशियों को सुधार के संकेत देता है।
यह कैसे काम करता है, यहाँ एक जैविक उदाहरण दिया गया है:
- "सेरेब्रम" (दिमाग): AI एक कमांड भेजता है: "स्थिति X पर जाओ।"
- "सेरेबेलम" (APEX): मनुष्यों में, सेरेबेलम वह हिस्सा है जो सूक्ष्म मोटर नियंत्रण और संतुलन संभालता है। यह पूरे चलने की योजना नहीं बनाता है; यह बस आपको फिसलने से बचाने के लिए छोटे, तत्काल समायोजन करता है।
- चरण 1 (स्मूथिंग): APEX AI के कमांड को लेता है और उसे सुचारू बनाता है, इसमें वह गायब "गति" और "त्वरण" विवरण जोड़ता है जिसकी मांसपेशियों को सुचारू रूप से चलने के लिए आवश्यकता होती है।
- चरण 2 (अनुकूलन): जैसे-जैसे रोबोट चलता है, APEX मांसपेशियों पर नज़र रखता है। यदि मांसपेशियां पीछे रह रही हैं या लक्ष्य से आगे निकल रही हैं, तो APEX तुरंत एक छोटा सा सुधार कैलकुलेट करता है और उसे कमांड में जोड़ देता है। यह एक सेल्फ-ड्राइविंग कार की तरह है जो सड़क ऊबड़-खाबड़ होने पर भी लेन में रहने के लिए लगातार थोड़ा बाएं या दाएं मुड़ती रहती है।
उन्होंने क्या पाया
शोधकर्ताओं ने रोबोट द्वारा क्यूब्स को धकेलने, वस्तुओं को उठाने और छेदों में पेग डालने जैसे कठिन कार्यों को करने के परीक्षण किए।
- "रीप्ले" टेस्ट: उन्होंने एकदम सटीक विशेषज्ञ प्रदर्शन (जैसे किसी इंसान द्वारा कार्य को पूरी तरह से करने का वीडियो) लिए और रोबोट को बस उसकी नकल करने के लिए कहा। सटीक निर्देशों के साथ भी, रोबोट अक्सर विफल हो गया क्योंकि उसकी मांसपेशियां अपूर्ण थीं। APEX ने इसे ठीक कर दिया, त्रुटियों को 41% कम कर दिया और रोबोट को बहुत अधिक बार सफल बनाया।
- "असली AI" टेस्ट: उन्होंने APEX को चार अलग-अलग प्रकार के AI दिमागों (जिनमें कुछ बहुत उन्नत भी शामिल थे) के साथ जोड़ा। हर मामले में, APEX ने रोबomer को अधिक सफल होने में मदद की।
- सबसे कठिन कार्य के लिए (एक छोटे छेद में पेग डालना), APEX ने एक AI को 20% सफलता दर से बढ़ाकर 35% सफलता दर तक पहुँचा दिया। यह एक रोबोट के लिए एक बहुत बड़ी छलांग है!
मुख्य बात
आपको AI या रोबोट को बेहतर ढंग से काम करने के लिए उन्हें फिर से बनाने की आवश्यकता नहीं है। आपको बस एक हल्का "बिचौलिया" (APEX) चाहिए जो AI की सुनता है, रोबोट को देखता है, और तुरंत छोटे-छोटे समायोजन करता है ताकि यह सुनिश्चित हो सके कि रोबोट वास्तव में वही करता है जो उसे करने के लिए कहा गया था।
यह एक अनाड़ी डांसर को एक कोच देने जैसा है जो उनके डांस रूटीन को नहीं बदलता है बल्कि केवल उन्हें लय में रखने के लिए धीरे से उनके कंधे को थपथपाता है। परिणाम? एक बहुत बेहतर प्रदर्शन।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।