ICI-VLA: In-Context Imitation with Spatiotemporally Aligned Demonstrations for Vision-Language-Action Models
ICI-VLA एक प्रशिक्षण और पुनर्प्राप्ति ढांचा है जो फिक्स्ड विजन-लैंग्वेज-एक्शन मॉडल्स को स्थानिक-काल्पनिक रूप से संरेखित, सिमेंटिक रूप से लेबल किए गए माइक्रो-डेमोन्स्ट्रेशन पर एक्शन जनरेशन को कंडिशन करके तीव्र, फ्यू-शॉट टेस्ट-टाइम एडाप्टेशन प्राप्त करने में सक्षम बनाता है, जिससे अतिरिक्त ग्रेडिएंट अपडेट की आवश्यकता समाप्त हो जाती है और कई रोबोटिक मैनिपुलेशन बेंचमार्क पर बेसलाइन्स से काफी बेहतर प्रदर्शन होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
रोबोट लंबे समय से नए कार्यों को तेजी से सीखने के लिए संघर्ष कर रहे हैं। पारंपरिक तरीकों में अक्सर हर बार एक नया काम मिलने पर रोबोट को शुरू से फिर से प्रशिक्षित करने की आवश्यकता होती है, जो एक ऐसी प्रक्रिया है जिसमें भारी मात्रा में डेटा और कंप्यूटिंग शक्ति की आवश्यकता होती है। यह रोबटों को बदलते परिवेश में तैनात करना कठिन बना देता है जहाँ उन्हें तुरंत अनुकूलित होना चाहिए। एक नया दृष्टिकोण, जिसे 'इन-कॉन्टेक्स्ट लर्निंग' (in-context learning) कहा जाता है, एक अलग रास्ता प्रदान करता है। रोबोट के मस्तिष्क को फिर से प्रशिक्षित करने के बजाय, यह विधि सिस्टम को यह देखने की अनुमति देती है कि पहले किसी कार्य को कैसे किया गया था और उस जानकारी का उपयोग करके यह पता लगाने की अनुमति देती है कि आगे क्या करना है, और यह सब बिना इसकी आंतरिक सेटिंग्स को बदले किया जाता है। जबकि इस तकनीक ने कंप्यूटरों के भाषा और छवियों को समझने के तरीके में क्रांति ला दी है, इसे भौतिक रोबोट पर लागू करना कहीं अधिक जटिल है। एक रोबोट को न केवल एक दृश्य दृश्य और एक बोले गए निर्देश को समझना होता है, बल्कि वास्तविक समय में अपने शरीर की गतिविधियों को भी समन्वित करना होता है, जहाँ समय या स्थिति में मामूली अंतर भी विफलता का कारण बन सकता है।
वुहान यूनिवर्सिटी के शोधकर्ताओं ने ICI-VLA नामक एक नया फ्रेमवर्क विकसित किया है जो सफलतापूर्वक इस "उदाहरणों से सीखने" की क्षमता को रोबोटिक भुजाओं तक पहुँचाता है। उनका सिस्टम रोबोट को किसी कार्य को किए जाने के कुछ छोटे वीडियो क्लिप देखने की अनुमति देता है और फिर तुरंत उस ज्ञान को एक नई, समान स्थिति में लागू करता है। मुख्य नवाचार इस बात में निहित है कि सिस्टम उदाहरणों को कैसे संभालता है। रोबोट को कार्य के पूरे, लंबे वीडियो खिलाने के बजाय, शोधकर्ताओं ने इन प्रदर्शनों को छोटे, लेबल वाले खंडों (segments) में विभाजित किया है जो रोबोट के वर्तमान कार्य के विशिष्ट क्षणों से मेल खाते हैं। वे फिर एक विशेष खोज उपकरण (search tool) को प्रशिक्षित करते हैं ताकि वह उस सटीक खंड को खोज सके जो वर्तमान में रोबोट जो देख रहा है उसके साथ संरेखित (align) हो, जिससे यह सुनिश्चित हो सके कि रोबोट सही समय पर सही गति की नकल करता है। रोबोट को उदाहरण वीडियो में दिए गए नंबरों को केवल याद करने से रोकने के लिए, सिस्टम को उदाहरण के सटीक अंत को अनदेखा करने और इसके बजाय वर्तमान दृश्य पर ध्यान केंद्रित करने के लिए प्रशिक्षित किया जाता है, जिससे रोबлот क्रिया को समझने के लिए मजबूर होता है न कि केवल उसे दोहराने के लिए।
अपने प्रयोगों में, टीम ने इस दृष्टिकोण का परीक्षण दो अलग-अलग सिम्युलेटेड वातावरणों और एक वास्तविक भौतिक रोबोट (जिसमें दो भुजाएँ हैं) पर किया। पहले सिमुलेशन में, जिसमें वस्तुओं को हिलाने और दराज खोलने जैसे विभिन्न कार्य शामिल थे, सिस्टम ने 97.7 प्रतिशत की सफलता दर हासिल की। दूसरे, अधिक कठिन सिमुलेशन में, जिसमें दोहरी-भुजा समन्वय (dual-arm coordination) शामिल था, इसने 60.4 प्रतिशत तक पहुँच प्राप्त की, जो पिछले तरीकों की तुलना में एक महत्वपूर्ण सुधार है। जब उन्होंने इस सिस्टम को भौतिक कैमरों और रोबोटिक भुजाओं वाले वास्तविक सेटअप में स्थानांतरित किया, तो इसने वस्तुओं को छाँटने और वस्तुओं को दराजों में रखने जैसे कार्यों को 83.2 प्रतिशत बार सफलतापूर्वक पूरा किया। ये परिणाम बताते हैं कि यदि रोबोट को सही, अच्छी तरह से मेल खाने वाले उदाहरण दिए जाएं, तो उसे हर नए काम के लिए फिर से प्रशिक्षित करने की आवश्यकता नहीं है।
इस सफलता का मूल आधार यह है कि सिस्टम सूचना के प्रवाह को कैसे प्रबंधित करता है। जब रोबोट को एक लंबा निर्देश दिया जाता है, जैसे "दराज खोलें और कटोरा अंदर रखें," तो सिस्टम इसे छोटे चरणों में तोड़ देता है। फिर यह पिछले अनुभवों के पुस्तकालय (library) में खोज करता है ताकि वर्तमान चरण से मेल खाने वाले छोटे क्लिप मिल सकें। उदाहरण के लिए, यदि रोबोट वर्तमान में दराज को बंद करने की कोशिश कर रहा है, तो सिस्टम दराज को बंद करने का एक छोटा क्लिप खोजेगा, न कि दराज को खोलने का क्लिप दिखाएगा। यह सुनिश्चित करता है कि रोबोट प्रासंगिक जानकारी देख रहा है। शोधकर्ताओं ने एक प्रशिक्षण तकनीक भी पेश की जहाँ वे सीखने के चरण के दौरान उदाहरण की क्रियाओं के कुछ हिस्सों को छिपा देते हैं। यह रोबोट को अभी जो वह देख रहा है और कार्य के सामान्य संदर्भ पर भरोसा करने के लिए मजबूर करता है, न कि केवल उदाहरण के नंबरों की अंधाधुंध नकल करने के लिए। यह रोबोट को भ्रमित होने से रोकता है यदि शुरुआती स्थिति उदाहरण से थोड़ी भिन्न हो।
यह अध्ययन इस बात पर प्रकाश डालता है कि उदाहरणों की मात्रा से अधिक उनकी गुणवत्ता मायने रखती है। इन छोटे प्रदर्शनों को रोबोट के वर्तमान गति चरण के साथ सावधानीपूर्वक चुनकर और संरेखित करके, सिस्टम तुरंत अनुकूलित हो सकता है। शोधकर्ताओं ने पाया कि शिखर प्रदर्शन प्राप्त करने के लिए केवल तीन उदाहरण ही पर्याप्त थे; अधिक जोड़ने से कोई मदद नहीं मिली और कभी-कभी इससे सिस्टम कम प्रभावी हो गया। यह इंगित करता है कि रोबोट को सूचना के सैलाब के बजाय कुछ, अत्यधिक प्रासंगिक संकेतों से लाभ होता है। यह सिस्टम रोबोट के मुख्य नियंत्रण सॉफ्टवेयर को स्थिर और अपरिवर्तित रखते हुए, प्राप्त उदाहरणों के आधार पर अपने व्यवहार को समायोजित करके काम करता है। इसका मतलब है कि रोबोट को महंगे और समय लेने वाले पुन: प्रशिक्षण सत्रों की आवश्यकता के बिना नई स्थितियों में तैनात किया जा सकता है।
हालाँकि परिणाम उत्साहजनक हैं, शोधकर्ता नोट करते हैं कि सिस्टम अभी भी पिछले प्रदर्शनों के एक अच्छे पुस्तकालय पर निर्भर करता है जिससे वह सीख सके। यदि रोबोट ऐसी स्थिति का सामना करता है जो उसके पुस्तकालय में मौजूद किसी भी चीज़ से पूरी तरह से अलग है, तो उसे उपयोगी उदाहरण खोजने में कठिनाई हो सकती है। इसके अतिरिक्त, पुस्तकालय बनाने और खोज उपकरण को प्रशिक्षित करने के लिए रोबोट के उपयोग से पहले महत्वपूर्ण ऑफलाइन कार्य की आवश्यकता होती है। हालाँकि, निष्कर्ष स्पष्ट रूप से अधिक लचीले रोबोट बनाने का मार्ग दिखाते हैं। पिछले अनुभवों को एक कठोर स्क्रिप्ट के बजाय एक संदर्भ मार्गदर्शिका (reference guide) के रूप में मानकर, रोबोट एक ऐसे स्तर की अनुकूलन क्षमता के साथ नई चुनौतियों को संभालने के लिए सीख सकते हैं जो पहले पहुंच से बाहर थी। यह कार्य सुझाव देता है कि भविष्य के रोबोटिक नियंत्रण का आधार शून्य से स्मार्ट मस्तिष्क बनाना नहीं, बल्कि उन्हें सही समय पर सही उदाहरणों से सीखना सिखाना है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।