A Sim-to-Real Integration Pipeline for Training and Deployment of Chunk-Based VLA Manipulation Policies
यह शोध पत्र एक ओपन-सोर्स सिम-टू-रियल पाइपलाइन प्रस्तुत करता है जो विशेषज्ञ सिमुलेशन प्रक्षेप पथों (expert simulation trajectories) को वास्तविक हार्डवेयर पर पुन: चलाने के माध्यम से युग्मित डेटासेट (paired datasets) उत्पन्न करके, चंक-आधारित विजन-लैंग्वेज-एक्शन (VLA) मैनिपुलेशन पॉलिसियों के प्रशिक्षण में डेटा की कमी की बाधा को संबोधित करता है, जिससे कुशल नीति प्रशिक्षण, मूल्यांकन और सिम-टू-रियल अंतराल का प्रत्यक्ष मापन सक्षम होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
रोबोट लंबे समय से दोहराव के उस्ताद रहे हैं, जो एक कारखाने में हजारों बार एक ही सटीक गति करने में सक्षम हैं। लेकिन उन्हें एक मानव घर की अव्यवस्थित, अप्रत्याशित दुनिया को समझने के लिए सिखाना कठिन साबित हुआ है। आधुनिक रोबोटिक्स तेजी से एक नए दृष्टिकोण की ओर बढ़ रहा है जहाँ मशीनें देखकर और सुनकर सीखती हैं, जो वे देखते हैं उसे उस निर्देश के साथ जोड़ती हैं जो उन्हें दिया जाता है। यह विधि, जिसे विजन-लैंग्वेज-एक्शन (दृष्टि-भाषा-क्रिया) के रूप में जाना जाता है, एक रोबोट को एक दृश्य और एक बोले गए निर्देश, जैसे कि "लाल ब्लॉक को हिलाओ," को सीधे भौतिक गति में अनुवाद करने की अनुमति देती है। चुनौती रोबोट को सिखाने के लिए पर्याप्त उदाहरण एकत्र करने में निहित है। आमतौर पर, इसके लिए एक मनुष्य को हर कार्य के माध्यम से रोबोट के हाथ को भौतिक रूप से निर्देशित करने की आवश्यकता होती है, जो एक धीमी, महंगी और कठिन प्रक्रिया है। इसके अलावा, जब शोधकर्ता कंप्यूटर सिमुलेशन में रोबोट को प्रशिक्षित करने की कोशिश करते हैं और फिर उन्हें वास्तविक दुनिया में ले जाते हैं, तो परिणाम अक्सर विफल हो जाते हैं क्योंकि डिजिटल दुनिया बहुत आदर्श होती है। सिमुलेशन और वास्तविकता के बीच के अंतर को शायद ही कभी सटीक रूप से मापा जाता है, जिससे वैज्ञानिक इस बात को लेकर अनिश्चित रह जाते हैं कि विफलता एक खराब रोबोट मस्तिष्क के कारण हुई है या केवल इसलिए कि वास्तविक मेज बहुत फिसलन भरी थी।
पेरिस में इंस्टीट्यूट ऑफ इंटेलिजेंट सिस्टम्स एंड रोबोटिक्स के शोधकर्ताओं की एक टीम ने इस विभाजन को पाटने का एक नया तरीका विकसित किया है। मानव शिक्षकों या अप्रमाणित सिमुलेशन पर निर्भर रहने के बजाय, उन्होंने एक ऐसा सिस्टम बनाया है जो एक कंप्यूटर-जनरेटेड विशेषज्ञ का उपयोग करके एक वास्तविक रोबोट को सिखाता है। उनके सेटअप में, एक सिमुलेशन में एक वर्चुअल रोबोटिक हाथ एक घन (cube) को धकेलने के लिए एक सटीक पथ की योजना बनाता है। इस डिजिटल योजना को फिर प्रयोगशाला में एक वास्तविक फ्रैंका FR3 रोबोटिक हाथ को भेजा जाता है। वास्तविक रोबोट बिना किसी मानवीय मार्गदर्शन या वास्तविक समय के सुधार के, उस डिजिटल योजना का ठीक से पालन करने का प्रयास करता है। जैसे-जैसे वह चलता है, टीम रिकॉर्ड करती है कि वास्तविक रोबोट क्या देखता है और महसूस करता है, जिससे एक ऐसा डेटासेट बनता है जहाँ "सही" उत्तर सिमुलेशन से आता है, लेकिन "अनुभव" वास्तविक दुनिया से आता है। यह उन्हें मानवीय टेलीऑपरेशन की लागत के बिना वास्तविक दुनिया के डेटा का उपयोग करके नए रोबोट नीतियों को प्रशिक्षित करने की अनुमति देता है। महत्वपूर्ण रूप से, क्योंकि वे जानते हैं कि रोबोट को किस सटीक पथ का पालन करना था, वे योजना और वास्तविकता के बीच के अंतर को उच्च सटीकता के साथ माप सकते हैं।
शोधकर्ताओं ने इस पद्धति का परीक्षण करने के लिए वास्तविक रोबोट को 200 अलग-अलग सिम्युलेटेड प्रक्षेप पथों (trajectories) को दोहराने के लिए कहा, जिसमें प्रत्येक में घन को या तो बाईं ओर या दाईं ओर धकेलना शामिल था। उन्होंने पाया कि वास्तविक रोबोट ने डिजिटल योजना का उल्लेखनीय सटीकता के साथ पालन किया। औसतन, वास्तविक हाथ द्वारा लिया गया पथ इच्छित पथ से एक सेंटीमीटर से भी कम विचलित हुआ। सबसे बड़ी त्रुटियां केवल तभी हुईं जब रोबोट ने वस्तु को छुआ, जहाँ घर्षण और वजन के वास्तविक दुनिया के भौतिकी, जो कंप्यूटर में पूरी तरह से मॉडल नहीं किए गए थे, ने मामूली विचलन पैदा किया। इन छोटी त्रुटियों के बावजूद, रोबलेट ने सभी 200 कार्यों को सफलतापूर्वक पूरा किया। इसने सिद्ध किया कि सिमुलेशन और वास्तविक दुनिया के बीच का भौतिक अंतर प्रबंधनीय था, और सिस्टम उच्च गुणवत्ता वाला प्रशिक्षण डेटा स्वचालित रूप से उत्पन्न कर सकता है।
यह सिद्ध करने के लिए कि सिस्टम एंड-टू-एंड काम करता है, टीम ने फिर एकत्रित किए गए डेटा का उपयोग करके शून्य से एक नई रोबोट नीति को प्रशिक्षित करने के लिए किया। उन्होंने ORCHID नामक एक मॉडल को केवल 200 वास्तविक-विश्व उदाहरणों का उपयोग करके वही घन-धकेलने वाले कार्य करने के लिए सिखाया। जब उन्होंने इस नए, स्व-शिक्षित रोबोट का क्लोज्ड लूप में परीक्षण किया—जहाँ इसे दृश्य को देखना, निर्णय लेना और उसके अनुसार कार्य करना था—तो यह 20 में से 6 प्रयासों में सफल रहा। शोधकर्ताओं ने नोट किया कि सफलता की यह कम दर संभवतः प्रशिक्षण डेटा की कम मात्रा और प्रकाश व्यवस्था के बदलावों के कारण थी, न कि पद्धति में किसी मौलिक दोष के कारण। यह प्रयोग एक 'प्रूफ ऑफ कॉन्सेप्ट' के रूप में कार्य करता है, जो यह प्रदर्शित करता है कि एक रोबोट को सिमुलेशन से उत्पन्न वास्तविक दुनिया के डेटा पर प्रशिक्षित किया जा सकता है, और उसी सॉफ्टवेयर स्टैक का उपयोग डेटा एकत्र करने और अंतिम रोबोट चलाने दोनों के लिए किया जा सकता है।
यह अध्ययन इस बात पर प्रकाश डालता है कि कंप्यूटर से वास्तविक दुनिया में जाने में सबसे बड़ी चुनौतियाँ उच्च-स्तरीय योजना में नहीं, बल्कि विशिष्ट भौतिक अंतःक्रियाओं में हैं। त्रुटियां यादृच्छिक नहीं थीं; वे लगातार तब दिखाई दीं जब रोबोट ने वस्तु के संपर्क में आया, जिससे पता चलता कि वस्तु के वजन और मेज के घर्षण के बेहतर मॉडल प्रदर्शन को बेहतर बनाएंगे। एक ओपन-सोर्स प्रोटोकॉल और युग्मित सिम्युलेटेड एवं वास्तविक प्रक्षेप पथों का डेटासेट प्रदान करके, शोधकर्ताओं ने समुदाय को इन भौतिक विसंगतियों को मापने और कम करने के लिए एक उपकरण दिया है। उनका कार्य दिखाता है कि वास्तविक दुनिया का विशाल मात्रा में प्रशिक्षण डेटा उत्पन्न करना बिना किसी मानवीय हस्तक्षेप के संभव है, बशर्ते कि सिस्टम को डिजिटल योजना और भौतिक वास्तविकता के बीच के छोटे अंतरों को मापने और उनका हिसाब रखने के लिए डिज़ाइन किया गया हो।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।